惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

IT之家
IT之家
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
大猫的无限游戏
大猫的无限游戏
美团技术团队
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
博客园_首页
MyScale Blog
MyScale Blog
N
Netflix TechBlog - Medium
I
InfoQ
Jina AI
Jina AI
Martin Fowler
Martin Fowler
Recent Announcements
Recent Announcements
量子位
月光博客
月光博客
罗磊的独立博客
雷峰网
雷峰网
The Cloudflare Blog
V
V2EX
小众软件
小众软件
人人都是产品经理
人人都是产品经理
博客园 - Franky
T
Tailwind CSS Blog
有赞技术团队
有赞技术团队
S
SegmentFault 最新的问题

Prompt 语宙

kimi-thinking-preview – 月之暗面推出的多模态思考模型 pdf-craft – 开源 PDF 转 Markdown 工具 UltraMem – 字节豆包大模型团队推出的全新超稀疏模型架构 EasyControl – Tiamat AI 联合上海科大等开源的图像生成控制框架 GaussianCity – 南洋理工大学 S-Lab 团队推出的 3D 城市生成框架 X-Prompt – 用于多模态视频目标分割的通用框架 豆包大模型1.5 – 字节跳动推出的最新版大模型 GaussianAnything – 南洋理工 S-Lab 和上海 AI Lab 等推出的 3D 生成框架 Cube 3D – Roblox 推出的 AI 3D 生成模型 OpenMath-Nemotron – 英伟达开源的数学推理系列模型 MAI Transcribe-1.5 – 微软 MAI 推出的语音转文本模型 Seed1.5-Embedding – 字节跳动 Seed 团队推出的向量模型 2026世界杯人机大战引爆!联想携手DeepSeek等顶尖AI大模型,对战亿万球迷预测冠军 高考公平守护战!豆包、文心等主流大模型集体禁用拍题功能 ShotAdapter – Adobe联合UIUC推出的多镜头视频生成框架 Devstral – Mistral AI联合All Hands AI开源的编程专用AI模型 MMaDA – 字节联合普林斯顿大学等推出的多模态扩散模型 Software Copyright Materials Skill – 开源软著资料生成Skill Dulus – 开源的 CLI AI Agent,可驱动多模型工具调用 Reasonix – 专为 DeepSeek 推出的开源终端编程 Agent Mega-ASR – NTU、NUS、上海AI Lab开源的语音识别模型 CodeGraph – 开源代码知识图谱工具,加速代码理解和分析 MiniCPM5-1B – 面壁智能联合清华开源的端侧文本基座模型 Horizon – 开源 AI 信息聚合系统,构建专属新闻雷达 BitCPM-CANN – 面壁智能联合清华开源的端侧大模型 Xiaomi Auto World Model – 小米推出的辅助驾驶世界模型 opera-browser-cli – Opera Neon 开源的命令行工具 omp – 开源的 AI 终端编程智能体,能与 IDE 深度联动 Claude Opus 4.8 – Anthropic 推出的旗舰级大语言模型 Hy-Memory – 腾讯混元推出的 Agent 记忆插件
谷歌Veo 3.1重磅发布:AI视频生成进入4K竖屏+原生音频时代,...
站外新闻 · 2026-06-20 · via Prompt 语宙

💡 站外导读:AI视频生成领域正以前所未有的速度迭代,创作者和企业面临着效率与质量的双重挑战。传统视频制作流程复杂、成本高昂,而AI生成视频又常常在音画同步、画质控制、叙事连贯性上存在短板。谷歌最新发布的Veo 3.1模型,旨在解决这些核心痛点。它通过原生音频生成、4K/竖屏支持、以及精细的元素控制,将AI视频生成从“能用”推向了“好用、实用”的新阶段,标志着AIGC在视觉叙事领域迈出了关键一步。

Veo 3.1 是谷歌推出的最新 AI 视频生成模型,在Veo 3基础上进行了重大升级,带来更丰富的音频支持、更强的叙事控制及更逼真的质感还原。通过原生音频生成和更精细的编辑能力,Veo 3.1 让用户能直接在生成阶段完成视频创作,无需后期处理。模型支持多种输入类型,包括文本提示、图像和视频片段,能生成高质量的 720p 或 1080p 视频。Veo 3.1 的目标是简化创意生产流程,为创作者提供更强大的工具,适用于广告、虚拟内容制作等多种场景。Veo 3.1 模型可通过 Gemini API、Vertex AI 、FlowGemini 使用。

  • Veo 3.1是什么
  • Veo 3.1的主要功能
  • 如何使用Veo 3.1
  • Veo 3.1的项目地址
  • Veo 3.1的产品定价
  • Veo 3.1的应用场景
      • 📝 站长洞察 (Editor’s Insight)

Veo 3.1 此次更新带来了竖屏视频创作功能,现在可输出 4K 超清和 1080P 高清格式。新版本在元素融合与场景把控方面表现更出色,生成的视频内容能更精准地匹配用户的实际意图。此外,系统对文本指令的理解能力得到强化,视频的故事连贯性显著提升,整体操作流程也变得更加简单直观,无论新手还是专业创作者都能快速掌握。

Veo 3.1

Veo 3.1的主要功能

  • 原生音频生成:模型能直接生成与视频内容匹配的音频,实现音画同步,无需后期添加。

  • 视频扩展:用户能将之前生成的视频片段继续延长,模型从上一段视频的最后1秒开始生成新的内容。

  • 指定帧生成:用户只需提供开头帧和结尾帧,模型自动生成中间的过渡场景,实现无缝衔接。

  • 图片引导:支持用户上传最多三张参考图,模型在生成的视频中保持图像的风格和元素一致性。

  • 更精细的编辑能力:支持在视频中插入或移除物体、角色等元素,让创作更加灵活。

  • 高清画质:支持生成 4K 和 1080P 分辨率的视频,大幅提升画质清晰度。

  • 竖屏模式:原生支持 9:16 竖屏视频生成,适配短视频观看习惯,无需后期裁剪。

  • 元素融合与场景控制:可将角色、背景等元素无缝拼接,保持角色形象和场景风格的一致性,避免画面违和感。

如何使用Veo 3.1

  • 选择访问途径:根据不用需求用户可进行选择,开发者访问Gemini API、企业客户访问Vertex AI和个人用户访问Gemini ,以个人使用为例。
  • 访问 Gemini 官网:访问 Gemini 官网,完整账号注册和登录。
  • 选择Veo 3.1 模型:选择或创建项目,确保已启用 Veo 3.1 模型。

  • 使用 Veo 3.1 功能:输入提示词、上传参考图或视频片段,设置参数后点击生成。

  • 下载生成的视频:生成的视频在应用界面显示,点击下载按钮保存到本地。

Veo 3.1的项目地址

  • 项目官网:https://blog.google/technology/ai/veo-updates-flow/

Veo 3.1的产品定价

  • 标准模型(Standard Model):每秒视频 0.40 美元。

  • 快速模型(Fast Model):每秒视频 0.15 美元。

Veo 3.1的应用场景

  • 广告与营销:模型能快速生成高质量的视频广告,满足品牌宣传和产品推广的需求。

  • 内容创作:创作者制作创意视频、动画短片等,激发更多灵感。

  • 教育与培训:生成具有教育意义的视频内容,帮助制作生动的教学视频或培训材料。

  • 娱乐与影视:为电影、电视剧、短视频等提供创意素材,辅助制作特效或动画场景。

  • 企业宣传:制作企业介绍视频、产品演示视频等,提升企业形象和产品展示效果。

📝 站长洞察 (Editor’s Insight)

Veo 3.1的发布,清晰地勾勒出AI视频生成技术的下一个竞争维度:从单一的“视觉生成”转向“视听一体化叙事”。原生音频生成是核心突破,它解决了AI视频长期以来音画分离、依赖后期拼凑的尴尬,真正实现了端到端的创作闭环。同时,对4K和竖屏的原生支持,表明谷歌正以极强的行业敏锐度,直接对标短视频、社交媒体广告等最具商业价值的场景需求。这不再是一个实验室产品,而是一个明确瞄准生产流的商业工具。更深层次看,Veo 3.1代表了AIGC从“生成内容”到“生成体验”的范式转移。当模型能理解并执行复杂的场景控制、元素融合与叙事指令时,AI就不再是简单的素材生成器,而是进化为了具备“导演思维”的创意伙伴。这预示着,未来内容产业的竞争焦点,将从拥有多少素材,转向谁能用AI更高效、更精准地实现创意意图。谷歌此举,无疑将给Runway、Pika等玩家带来巨大压力,并可能加速整个影视、广告、教育行业的生产力重塑。