讲师中心 微信公众号
AI工具推荐 视频效率加速

Sora 为何在未开放前引发全网关注

风静酱_3575

风静酱_3575

发布时间:2026-07-11 12:00:21

|

854人浏览过

|

来源于php中文网

原创

在尚未开放公众测试的情况下,openai 仅凭文本生成视频模型 sora 的一组预告内容,就迅速引发了科技圈、互联网行业和社交媒体的集中讨论。

根据 OpenAI 官方发布的视频案例,Sora 可基于用户输入的文本生成最长约 1 分钟的复杂场景视频。除了画面细节表现突出,这一模型还展现出对镜头运动的模拟能力。

从目前公开的效果来看,行业关注的核心,并不只是“能生成视频”,而是 Sora 在一定程度上呈现出对真实世界的理解能力。与其他文本生成视频模型相比,Sora 在语义理解、画面表现、视觉连贯性和生成时长方面都体现出明显优势。

OpenAI 将其定义为“世界模拟器”,称其能够模拟物理世界中的人物、动物与环境特征。不过,OpenAI 也明确表示,Sora 仍不完美,现阶段依然存在理解偏差以及潜在安全问题。

也正因此,Sora 目前仅向极少数用户开放测试。OpenAI 尚未公布其面向大众开放的具体时间,但仅凭现阶段公开的演示内容,已经足以让同类模型研发者感受到技术差距。

还未开放,Sora怎么就震惊了互联网圈?

Sora 预告内容为何迅速引爆关注

随着 OpenAI 发布 Sora,中文互联网很快出现大量围绕其能力的讨论。

不少自媒体和行业人士都对 Sora 的表现给出高度评价。360 创始人周鸿祎曾表示,Sora 的出现意味着 AGI 的实现时间有可能从 10 年缩短至两年左右。短时间内,Sora 的谷歌搜索热度快速上升,关注度一度逼近 ChatGPT。

Sora 受到广泛关注,直接原因在于 OpenAI 公布了 48 段演示视频,其中最长时长达到 1 分钟。相较此前文生视频模型 Gen2、Runway 的生成时长上限,这一表现进一步突破,同时画面清晰度更高,镜头语言也更成熟。

例如,在一段 1 分钟的视频中,一名身着红裙的女性走在霓虹闪烁的街头,整体风格偏写实,画面流畅自然。更受关注的是人物特写部分,脸部毛孔、斑点、痘印等细节都被模拟出来,妆容状态、颈部纹理与面部状态之间也保持了较强一致性。

除了人物写实效果,Sora 还展示了对动物和环境的模拟能力。在一段维多利亚冠鸽的多角度特写视频中,蓝色羽毛、红色眼珠的动态以及呼吸节奏等细节都被较为清晰地呈现出来,使得画面真假边界进一步被压缩。

对于非写实风格内容,Sora 同样给出了较强的生成效果。部分创意动画片段呈现出接近成熟动画电影的视觉质感,也因此引发了外界对于动画制作行业变化的讨论。

更重要的是,Sora 对文本生成视频模型的提升,并不只体现在时长和画质上。它还能模拟不同镜头与拍摄轨迹,包括第一人称游戏视角、航拍视角,以及类似电影一镜到底的连续镜头表达。

从这些公开案例不难理解,为什么互联网圈和社交媒体会对 Sora 产生如此强烈的反应。需要注意的是,目前外界看到的仍只是 OpenAI 释出的预告级内容。

OpenAI 如何用“视觉补丁”训练 Sora

那么,Sora 的模拟能力是如何实现的?

按照 OpenAI 发布的 Sora 技术报告,这一模型正在尝试突破早期视觉生成模型在数据类型、视频长度和固定尺寸上的限制。

过去,文本生成视觉内容的研究通常采用循环网络、生成对抗网络(GAN)、自回归 Transformer 以及扩散模型等方案,但这些方法大多集中在较少的视觉数据类别、较短视频或固定尺寸视频的处理上。

Sora 采用的是一种基于 Transformer 的扩散模型。其生成过程可分为正向过程和反向过程两个阶段,这也使其具备了沿时间维度向前或向后扩展视频的能力。

在正向过程中,模型模拟的是从真实图像逐步扩散到纯噪声图像的过程,也就是不断向图像中加入噪声,直到图像完全被噪声覆盖。反向过程则与之相反,模型会从噪声图像中逐步恢复出清晰图像。OpenAI 通过这种方式,让 Sora 学习视觉内容是如何形成的。

还未开放,Sora怎么就震惊了互联网圈?

从全噪点到清晰图的过程

OpenAI Codex Operator
OpenAI Codex Operator

在目标项目目录中运行 OpenAI Codex CLI,完成实现、调试等编码任务。当用户请求 OpenClaw 使用 Codex 时触发。

下载

这一过程需要通过大量训练反复完成。模型会在迭代中学习如何逐层去除噪声、还原细节,从而生成高质量图像。扩散模型也因此在图像生成、图像编辑和超分辨率等任务中表现出较强能力。

这解释了 Sora 为什么能够生成高清且细节丰富的视觉内容。但从静态图像迈向动态视频,还需要模型在数据和训练层面进一步扩展。

在扩散模型基础上,OpenAI 将视频、图像等不同类型的视觉数据转换为统一表示,并据此对 Sora 进行大规模训练。OpenAI 将这种表示方式称为“视觉补丁(patches)”,可以理解为一种更小粒度的数据单元,类似于 GPT 处理文本时所使用的 token 集合。

研究人员首先会将视频压缩到低维潜空间,再把这种表征拆分为时空 patches。这样的表示形式具有较高扩展性,便于完成从视频到 patch 的转换,也更适合训练一个同时处理多种视频和图片类型的生成模型。

还未开放,Sora怎么就震惊了互联网圈?

将视觉数据转化为 patches

为了以更少的信息量和更低的计算压力训练 Sora,OpenAI 还开发了一个视频压缩网络,先将视频降维到像素级低维潜空间,再基于压缩后的视频数据生成 patches。与此同时,OpenAI 也训练了解码器模型,用于把压缩后的信息重新映射回像素空间。

基于视觉补丁这种表示方式,研究者可以使用不同分辨率、不同持续时间以及不同长宽比的视频和图像来训练 Sora。进入推理阶段后,Sora 则能够通过在适当大小的网格中排列随机初始化的 patches,来判断视频逻辑并控制最终生成视频的尺寸。

OpenAI 在报告中提到,随着大规模训练推进,视频模型开始呈现出一些值得关注的能力,包括更真实地模拟现实世界中的人物、动物与环境,生成高保真视频,并实现一定程度的 3D 一致性和时间一致性,从而更接近对物理世界的模拟。

能力惊艳之外,Sora 仍有明显局限

无论从结果展示还是技术路线来看,Sora 都体现出很强的模型能力,但普通用户目前还无法直接体验。现阶段,外界更多是通过在 X 上向 OpenAI 创始人 Sam Altman 提交提示词,由其代为生成并公开展示视频结果。

这种有限开放的方式,也让外界对 Sora 的真实水平保持一定审慎态度:它是否真的如官方展示的那样强?

对此,OpenAI 的态度相对直接。官方承认,Sora 目前仍存在一些问题。类似早期 GPT 的“幻觉”现象,Sora 也会在以视觉为主的视频结果中出现较为具体的错误。

例如,它还不能准确模拟许多基础物理交互过程,包括跑步机履带与人的运动关系,以及玻璃杯破碎后液体流出的时序逻辑等。

在一段“考古工作者挖掘出一把塑料椅”的演示片段中,塑料椅是直接从沙子里“飘”出来的。

还有一段视频里,小狼崽会凭空出现,因此被网友调侃为“狼的有丝分裂”。

在部分案例中,模型也会出现前后左右方向判断不清的问题。

这些动态画面中的瑕疵说明,Sora 在物理运动逻辑的理解上仍有待继续训练和完善。与此同时,相比 ChatGPT 主要面向文本交互,Sora 直接作用于视频内容,其道德与安全风险也更加直观。

在此之前,文生图模型 Midjourney 已经让外界意识到,“有图未必有真相”。当人工智能能够生成高度逼真的图像时,虚假内容就更容易成为谣言传播的载体。身份验证公司 iProov 的首席科学官纽维尔博士也表示,Sora 可能让“恶意行为者更容易生成高质量的假视频”。

可以预见,如果这类生成视频能力被恶意滥用,用于欺诈、诽谤,或传播暴力、色情内容,潜在后果将难以低估。这也是 Sora 在带来技术震撼的同时,也引发外界担忧的重要原因。

OpenAI 显然也意识到了相关安全问题,这或许正是 Sora 目前仅以邀请制向极少数人开放测试的原因之一。至于何时面向大众开放,OpenAI 仍未给出明确时间表。不过从目前公开的演示效果来看,留给其他公司追赶 Sora 的时间窗口并不宽裕。

热门AI工具

更多
PixPix
PixPix Hot

PixPix是一款面向电商视觉生产的AI商品图生成工具。

Atoms
Atoms Hot

Atoms是一款AI智能体工具,第一支自动构建真实业务的 AI 团队。

DeepSeek

DeepSeek是一款面向对话、写作、编程和推理场景的AI大模型工具。

讯飞智作

讯飞智作是一款AI视频创作工具,AI文本配音工具,数字人课程、营销视频制作。

切问学术

切问学术是一款AI论文写作工具,复旦大学NLP团队推出的AI学术智能体。

VibeKnow
VibeKnow Hot

一款AI视频创作工具,主要用于全球首个AI知识视频创作平台,文档、文章、网页,一键生成视频,适合需要提升相关任务效率的用户。

AionClaw
AionClaw Hot

AionClaw是一款面向办公、创作和编程任务的AI桌面智能体。

WorkBuddy

一款AI办公效率工具,主要用于腾讯云推出的AI原生桌面智能体工作台,适合需要提升相关任务效率的用户。

豆包大模型

豆包大模型是一款由字节跳动推出的企业级大语言模型服务平台。

相关专题

更多
LLVM自定义Pass怎么写
LLVM自定义Pass怎么写

本专题聚焦LLVM自定义Pass开发,整理Pass类结构、run()方法、PreservedAnalyses、CMake构建、插件注册、-load-pass-plugin加载和测试用例编写流程。

0

2026.09.30

LLVM RISC-V参数配置教程
LLVM RISC-V参数配置教程

本专题介绍LLVM对RISC-V基础ISA和扩展的支持方式,涵盖RV32、RV64、标准扩展、实验性扩展、厂商扩展、-menable-experimental-extensions和版本差异。

0

2026.09.30

LLVM IR中间表示入门指南
LLVM IR中间表示入门指南

本专题整理LLVM IR的核心概念,包括中间表示作用、模块结构、函数、基本块、SSA形式、类型系统和常见语法,帮助新手理解LLVM编译流程中的关键层。

0

2026.09.30

PDF转图片方法
PDF转图片方法

需要把 PDF 页面用于上传、预览、分享或图片归档时,PDF 转图片方法专题整理 JPG/PNG 格式选择、逐页导出、清晰度设置、批量下载和结果检查等流程,帮助用户稳定完成 PDF 图片化处理。

0

2026.09.30

PixTV AI视频生成与无限画布创作
PixTV AI视频生成与无限画布创作

PixTV专题整理AI视频与视觉内容创作相关功能使用教程,涵盖AI生图、视频生成、无限画布、多模型创作、素材管理、声音音乐及视频剪辑等功能,帮助用户快速掌握PixTV从创意到成片的完整制作方法。

0

2026.09.29

Buffalo框架数据库开发全教程
Buffalo框架数据库开发全教程

本专题围绕Buffalo框架数据库开发,讲解database.yml多环境配置、soda与fizz迁移生成回滚、模型结构体标签、增删改查与条件查询、一对多与多对多关联、数据校验、回调钩子、事务处理及原生SQL执行能力。

200

2026.09.23

Buffalo框架路由与请求处理实操指南
Buffalo框架路由与请求处理实操指南

本专题讲解Buffalo框架路由与请求处理机制,涵盖路由注册与分组、资源路由、Handler编写规范、Context上下文方法、参数绑定、中间件编写挂载、Session与Cookie读写、Flash消息及错误页面定制方法。

120

2026.09.23

Buffalo框架零基础入门教程
Buffalo框架零基础入门教程

本专题整理Buffalo框架入门内容,涵盖Go环境准备、buffalo CLI安装、新项目生成、目录结构说明、dev热加载启动、数据库连接配置与常见报错排查,帮助新手按约定优于配置的思路跑通第一个Buffalo框架应用。

100

2026.09.23

Conan创建软件包配方指南
Conan创建软件包配方指南

本专题介绍通过conanfile.py创建软件包的方法,讲解包名、版本、依赖和构建设置等基础信息,以及source、build、package、package_info等常用方法的作用及编写思路。

60

2026.09.22

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
万彩AI动画视频生成教程
万彩AI动画视频生成教程

共0课时 | 0人学习

什么是Subversion (SVN)?
什么是Subversion (SVN)?

共0课时 | 123人学习

通义千问的提示词工程
通义千问的提示词工程

共1课时 | 257人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn