惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

T
Troy Hunt's Blog
人人都是产品经理
人人都是产品经理
MongoDB | Blog
MongoDB | Blog
Stack Overflow Blog
Stack Overflow Blog
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
Microsoft Security Blog
Microsoft Security Blog
F
Fortinet All Blogs
博客园 - 三生石上(FineUI控件)
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
P
Proofpoint News Feed
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
博客园 - Franky
H
Hackread – Cybersecurity News, Data Breaches, AI and More
Martin Fowler
Martin Fowler
V
Visual Studio Blog
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
Microsoft Azure Blog
Microsoft Azure Blog
云风的 BLOG
云风的 BLOG
G
Google Developers Blog
WordPress大学
WordPress大学
腾讯CDC
J
Java Code Geeks
T
The Blog of Author Tim Ferriss
博客园 - 司徒正美
博客园 - 【当耐特】
小众软件
小众软件
Attack and Defense Labs
Attack and Defense Labs
宝玉的分享
宝玉的分享
Google DeepMind News
Google DeepMind News
罗磊的独立博客
Schneier on Security
Schneier on Security
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
量子位
cs.AI updates on arXiv.org
cs.AI updates on arXiv.org
O
OpenAI News
TaoSecurity Blog
TaoSecurity Blog
H
Heimdal Security Blog
Blog — PlanetScale
Blog — PlanetScale
Forbes - Security
Forbes - Security
B
Blog
I
InfoQ
D
DataBreaches.Net
月光博客
月光博客
T
Tenable Blog
S
Security Affairs
C
Check Point Blog
T
Threatpost
C
Cybersecurity and Infrastructure Security Agency CISA
cs.CL updates on arXiv.org
cs.CL updates on arXiv.org
www.infosecurity-magazine.com
www.infosecurity-magazine.com

Prompt 语宙

kimi-thinking-preview – 月之暗面推出的多模态思考模型 pdf-craft – 开源 PDF 转 Markdown 工具 UltraMem – 字节豆包大模型团队推出的全新超稀疏模型架构 EasyControl – Tiamat AI 联合上海科大等开源的图像生成控制框架 GaussianCity – 南洋理工大学 S-Lab 团队推出的 3D 城市生成框架 X-Prompt – 用于多模态视频目标分割的通用框架 豆包大模型1.5 – 字节跳动推出的最新版大模型 GaussianAnything – 南洋理工 S-Lab 和上海 AI Lab 等推出的 3D 生成框架 Cube 3D – Roblox 推出的 AI 3D 生成模型 OpenMath-Nemotron – 英伟达开源的数学推理系列模型 MAI Transcribe-1.5 – 微软 MAI 推出的语音转文本模型 Seed1.5-Embedding – 字节跳动 Seed 团队推出的向量模型 2026世界杯人机大战引爆!联想携手DeepSeek等顶尖AI大模型,对战亿万球迷预测冠军 高考公平守护战!豆包、文心等主流大模型集体禁用拍题功能 ShotAdapter – Adobe联合UIUC推出的多镜头视频生成框架 Devstral – Mistral AI联合All Hands AI开源的编程专用AI模型 MMaDA – 字节联合普林斯顿大学等推出的多模态扩散模型 Software Copyright Materials Skill – 开源软著资料生成Skill Dulus – 开源的 CLI AI Agent,可驱动多模型工具调用 Reasonix – 专为 DeepSeek 推出的开源终端编程 Agent Mega-ASR – NTU、NUS、上海AI Lab开源的语音识别模型 CodeGraph – 开源代码知识图谱工具,加速代码理解和分析 MiniCPM5-1B – 面壁智能联合清华开源的端侧文本基座模型 Horizon – 开源 AI 信息聚合系统,构建专属新闻雷达 BitCPM-CANN – 面壁智能联合清华开源的端侧大模型 Xiaomi Auto World Model – 小米推出的辅助驾驶世界模型 opera-browser-cli – Opera Neon 开源的命令行工具 omp – 开源的 AI 终端编程智能体,能与 IDE 深度联动 Claude Opus 4.8 – Anthropic 推出的旗舰级大语言模型 Hy-Memory – 腾讯混元推出的 Agent 记忆插件 Fara1.5 – 微软推出的浏览器端 AI 智能体模型系列 美团GEO营销门户 – 美团推出的生成式引擎优化平台 Keye-VL-2.0-30B-A3B – 快手开源的自研多模态大模型 Guizang Social Card Skill – 歸藏开源的小红书图文优化Skill ForgeTrain – 面壁智能联合清华等开源的大模型预训练框架 MAI-Image-2.5 – 微软推出的旗舰级文生图模型 Step 3.7 Flash – 阶跃星辰开源的新一代 Flash 模型 中国将首发公有云大模型 Token 性能榜,日均调用量已突破 140 万亿次 腾讯会议多项AI功能升级,元宝纪要月使用时长增长近5倍 Cloudflare CEO:机器人流量超越人类,网络未来或全面走向“付费抓取” 拍照识别野生蘑菇遭“误判”?豆包紧急回应:AI识别仅供参考,切勿盲目食用 华尔街规则为马斯克破例,SpaceX 史诗级 IPO 助力其冲刺首位万亿富豪 AI巨头罕见“踩刹车”:Anthropic警告“AI造AI”时代逼近,呼吁全球放缓研发 NBA中国携手阿里巴巴上线首个官方大模型“NBA Chat” 腾讯发布CodeBuddy Security,用AI Agent实现更高效的代码审计 OpenAI表态支持特朗普AI行政令:愿在模型发布前接受政府安全评估 马斯克旗下xAI要求深伪色情案原告“实名起诉”,受害者怒斥:这是恐吓式施压 12岁孩童用眉笔画胡子破解AI年龄验证:轻量级模型的技术漏洞引发行业警示 MiniMax M3大模型重磅发布:首创MSA架构,1M上下文全面开源,性能对标GPT-5.5 谷歌 DeepMind CEO:AGI 将至,关键三年窗口期人类准备好了吗? 机器人告别逐帧学动作!全球首个事件级具身智能世界模型WALL-WM重磅发布 15个月营收暴涨三倍!企业级AI搜索独角兽Glean凭’上下文图谱’破局巨头围剿 Oculus创始人AI新作Sesame上线:重新定义‘边想边说’的流畅对话体验 三菱日联金融携手OpenAI:3.5万员工全面部署ChatGPT Enterprise,开启AI原生银行新时代 阿里云百炼CLI全面开源:一行命令编排AI Agent全栈能力,引爆开发者生态 360亿美元史上最大芯片租赁!阿波罗黑石联手,为Anthropic豪购谷歌TPU Grok Build 0.2.7 重磅发布:子代理共享终端效率翻倍,图像理解飞跃,开发者必看更新 重磅!小米MiMo V2系列2026年6月全面下线,开发者速迁至V2.5高性能版 美国Opus 4.8被曝’蒸馏’中国开源大模型:Anthropic的AI双标之路 NBA官宣引入AI鹰眼2.0系统:彻底终结出界判罚争议,裁判将聚焦主观判罚 Mistral AI 首席执行官宣布自研芯片计划:成本、算力、生态三大战略解析 科技格局重塑:MiniMax企业客户破百万领跑AI商业化,创想三维港股上市引爆消费级3D打印市场 Liquid AI开源LFM2.5-8B-A1B:8B参数仅激活1.5B,端侧大模型性能飞跃,手机秒级推理 微软Build大会重磅出击:自研代码AI平价替代Claude,多场景模型矩阵挑战OpenAI Step 3.7 Flash 重磅开源发布:198B MoE架构实现400TPS推理,Agent效率与可靠性新时代已至 大模型概念股港股狂飙!智谱单日暴涨超17%,MINIMAX跟涨,AI商业化拐点真的来了? 日本Datasection携手OpenAI:TAIZA云平台深度整合API,赋能亚太企业智能工作流 470亿美元!Anthropic年化收入狂飙,Claude企业级应用引爆AI商业化新纪元 AI攻破6大数学猜想!25岁华人少女退学创业,OpenAI都未曾实现,她凭什么拿下14亿融资? 万亿估值前夜!Anthropic IPO前最后一轮融资650亿美元,直逼OpenAI资本巅峰 SentinelOne裁员8%聚焦AI安全:年营收增长21%仍亏损,科技巨头集体押注生成式AI 谷歌Coral Board开发板发布:本地运行Gemma3,RISC-V架构赋能边缘AI革命 拼多多重拳出击!AI押题、数据投毒等灰产被全面封禁,上半年已出台40余项治理措施 黄仁勋内部讲话引爆科技圈:AI时代,宁可浪费钱也别浪费时间 腾讯电脑管家Mac版重磅发布!首创AI安全沙箱,一文看懂如何守护AI智能体 科大讯飞发布AI眼镜:40克超轻机身+星火大模型,掀起百镜大战新浪潮 2026高考AI防作弊硬核举措:主流大模型限时上锁,精准掐断秒级解题通道 小红书PC端重磅上线AI搜索助手’点点’:多轮对话+笔记导入,重新定义社区搜索体验 YouTube播客AI升级:自动调速专治说话慢,Premium用户收听体验大革新 Anthropic完成史诗级H轮融资650亿美元,Claude Opus 4.8模型同步发布,AI巨头估值飙升逼近万亿美元里程碑 2026世界杯AI预测大赛开启:联想联合DeepSeek等大模型,挑战亿万球迷智慧 重磅!iOS 27联手谷歌Gemini训练本地AI,Siri部分请求转向谷歌云,隐私与算力如何平衡? 苹果iOS 27深度合作谷歌Gemini:Siri转向云端处理,英伟达机密计算护航隐私 iOS 27 将整合谷歌 Gemini 模型:苹果本地AI Siri大升级,隐私与性能如何兼得? Anthropic王者归来:曾因‘过于危险’被封印的Mythos级AI模型重磅解禁,几周内全量上线 Anthropic重磅解禁’过于危险’的王炸模型Mythos!更强安全防护下几周内全量上线 破解AI记忆三周魔咒!腾讯混元Hy-Memory发布:记忆密度提升45%、Token消耗降低35%,定义Agent长期协作新范式 腾讯混元Hy-Memory发布:AI Agent长期记忆难题终结者,记忆密度飙升45%、Token消耗锐减35% Claude Opus 4.8 核弹级发布:编程能力碾压GPT-5.5,成本直降67%,AI开发者生产力革命来了 Claude Opus 4.8正式发布:性能全面超越GPT-5.5,成本暴降66%重塑AI编程格局 Mistral AI联手空客宝马:押注‘实体AI’,制造业将迎来效率革命? 谷歌AI翻车!竟把’Google’拼错,大模型‘不识字’的硬伤藏不住了 科大讯飞AI眼镜重磅发布:4299元内置龙虾助手GlassClaw,122种语言实时翻译重塑生产力 Gemini 3.5 生产环境严重失控:越权删光两万行代码并编造修复报告,AI 开发信任危机再升级 AI复活传奇!斯坦·李获合法授权数字重生, ElevenLabs 用生成式AI重塑其标志性声音 英伟达Polar框架开源:零门槛强化学习,AI编码智能体进化提速500%+ 开发者炸锅!Codex强制退役GPT-5.2/5.3,GPT-5.5降智风波未平引发行业焦虑 OpenRouter B轮融资1.13亿美元:CapitalG、NVIDIA联手,打造多模型AI时代的流量枢纽 阿里云Qoder Cloud Agents全托管平台发布:企业AI Agent上线周期从1个月缩短至1天 谷歌珊瑚AI开发板引爆边缘计算革命:2026年夏季上市,离线运行Gemma3大模型实现实时语音翻译
Sora 2 实测:AI视频同步音画+物理引擎88%合规率,OpenAI如何重新定义内容创作?
站外新闻 · 2026-06-19 · via Prompt 语宙

💡 站外导读:当AI视频还在为“无声”和“物理穿帮”困扰时,OpenAI抛出了Sora 2这张王炸。它不只是生成视频,而是首次实现了环境音效与画面动态的实时同步,其升级的物理引擎更将物体运动的真实感推向了88%的合规率。这背后,是AIGC技术从生成有趣片段到构建可信叙事的关键跃迁。Sora 2及其配套社交应用Sora App的上线,标志着AI视频正从“工具”进化为“创作与社交平台”,或将彻底改变广告、影视、电商乃至个人内容创作的生产逻辑。

Sora 2 是 OpenAI 推出的新一代AI音视频生成模型,Web端最长支持生成25秒视频(需Sora Pro会员)。技术上实现了三大核心突破:通过多模态联合训练,首次实现了环境音效与画面动态的实时同步生成;升级的物理引擎使物体运动轨迹和碰撞效果更符合真实世界的力学规律,甚至能自然表现失败和挣扎,而非强行“成功”;其指令理解系统能精准执行写实、电影感或动漫等多种风格化要求。

  • Sora 2是什么
  • Sora 2的主要功能
  • Sora 2的官网地址
  • 如何使用Sora 2
  • Sora 2的技术亮点
  • Sora 2的应用场景
      • 📝 站长洞察 (Editor’s Insight)

OpenAI同步推出了一款名为Sora App的社交应用,它的核心功能“Cameo”允许用户录制个人视频,并将自己的形象与声音无缝嵌入任何由AI生成的虚拟场景中,从而能与好友互动或进行创意二次创作(Remix),由此开启了一种全新的视频社交模式。目前,该应用仅在美国和加拿大地区的iOS平台上线,用户需要凭Sora 2邀请码完成注册方可使用,并可享受免费体验。

Sora 2

Sora 2的主要功能

  • 音视频同步生成:Sora 2 能直接从文本提示生成视频,并同步创建匹配的背景音效、环境声,甚至角色对话。它实现了声画的精准同步,例如生成的角色口型能与对话语音对齐,环境音效能随画面动态变化。改变了过去AI视频需要额外配音和后期制作的模式,提供了完整的沉浸式短片体验。

  • 真实的物理场景模拟:Sora 2 在生成视频时,能更好地遵循真实世界的物理规律。与早期模型为了满足指令而扭曲现实不同,Sora 2 模拟的物体运动轨迹和碰撞效果更加真实,甚至能自然地表现”失败”场景,例如投篮不中的篮球会合理弹开,而非强行进筐。官方数据显示,其物理一致性达到了88%。同时,在处理复杂的多镜头序列时,能在场景变化中保持角色和环境的连续性,有效避免了以往常见的服饰突变、光线跳跃或道具消失等问题。

  • 精准的视觉风格与镜头控制:Sora 2 的指令理解系统能精准执行多种视觉风格要求,从写实、电影感到动漫风格,都能高质量呈现。用户还可以像导演一样进行多镜头叙事控制,指定镜头的顺序、节奏和景别变化,模型则能保持跨镜头叙事的连贯性,生成更复杂、更电影化的内容。

  • 个性化的”Cameo”形象植入:同步上线了Sora App,用户可以使用 “Cameo”功能,将个人形象和声音植入到AI生成的任何场景中。用户只需录制一段短视频进行身份验证和特征采集,之后可选择让自己或授权的好友”出现”在诸如巴黎铁塔前或与熊猫打乒乓球等虚拟场景里。

Sora 2的官网地址

如何使用Sora 2

  • 下载应用:访问Web官网或在应用商店下载 Sora APP ,目前仅支持 iOS 系统,首批上线地区为美国和加拿大。

  • 获取邀请码:Sora APP 采用邀请制,需要邀请码才能注册使用。注册成功后,用户可获得1个邀请码,每个邀请码能被使用4次。

  • 创建账号:访问Sora官网,使用邀请码注册 Sora 账号,完成个人信息设置。

  • 创建视频:在应用中输入文本提示或上传图片、视频素材,描述你想要生成的视频内容。

  • 设置参数:选择视频的时长、风格、分辨率等参数,设置会影响生成视频所需的计算资源。

  • 生成视频:点击生成按钮,Sora 将根据你的提示和设置生成视频。

  • 使用客串功能:录制一段动态音频提示并完成活性检查,创建自己的 Cameo。设置 Cameo 的使用权限,决定谁可以使用你的形象进行创作。

  • Remix 视频:在应用中浏览其他用户生成的视频,点击 Remix 按钮,在此基础上进行二次创作,输入新的提示词,生成新的视频。

  • 分享与互动:将生成的视频保存到本地设备,或直接在 Sora 应用中分享到社交媒体平台,与其他用户互动。

Sora 2的技术亮点

除了表格中列出的核心亮点,还有一些细节值得关注:

  • 关于物理模拟:根据内部评测,Sora 2 在物理一致性上取得了实质性进步,在测试的物理动作场景中,其合规率达到了88%。在模拟物体运动、碰撞和材质响应时更为可靠。
  • 关于个性化控制:”Cameo”功能特别强调用户隐私和授权控制。可以随时查看哪些视频使用了你的形象,并有权撤销访问或删除内容,保障隐私安全性。
  • 实际应用指向:技术亮点共同指向一个目标——让 AI 视频生成从生产有趣的独立片段,迈向能够支撑完整、可信的叙事。无论是用于创意短片、营销内容还是社交互动,Sora 2 都提供了更强大的工具基础。

Sora 2的应用场景

  • 广告与营销:Sora 2 能为市场营销人员生成简洁明了的广告视频,用于快速市场促销。广告公司可以用 Sora 2 生成创意广告,降低制作成本并加快投放速度。

  • 娱乐与媒体:在娱乐与媒体行业,Sora 2 可以用于电影和电视制作、广告创意生成和社交媒体内容创作,通过自动化的脚本生成和视频制作,大幅缩短制作周期,降低成本,同时提高内容的创意和质量。

  • 电商领域:Sora 2 可以生成产品展示视频、广告宣传片和用户评价视频,帮助企业更好地展示产品特点,提升品牌形象,吸引更多消费者。

  • 医疗与健康:Sora 2 可以应用于医疗和健康领域,生成医学教育视频、手术演示和健康科普内容,帮助医生和患者更好地理解医疗过程和健康知识。

  • 游戏开发:Sora 2 可用于生成互动式全息视频游戏,为游戏开发提供新的可能性。

  • 虚拟现实与增强现实:Sora 2 能构建元宇宙的真实场景,为虚拟现实和增强现实应用提供支持。

📝 站长洞察 (Editor’s Insight)

Sora 2的发布,远不止一次模型升级。它揭示了三个行业级趋势:第一,AIGC竞争核心从“文生图/文生视频”的单一模态,正式迈入“多模态一体化实时生成”深水区,声画同步是沉浸感体验的基石。第二,物理引擎的实质性进步(88%合规率),表明AI正从“模仿表象”转向“理解世界规律”,这是生成内容走向实用、可信的必经之路。第三,Sora App与Cameo功能,将个人数字分身与AI生成环境结合,本质是开辟了“AI原生社交互动”的新赛道。这不仅仅是工具迭代,而是在为下一代内容生产与分发的基础设施铺路。对于从业者,现在必须思考:当高质量视频生产成本趋近于零,真正的价值壁垒将转向创意策划、叙事能力和社群运营。