惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

S
SegmentFault 最新的问题
爱范儿
爱范儿
博客园 - 三生石上(FineUI控件)
Microsoft Security Blog
Microsoft Security Blog
Google DeepMind News
Google DeepMind News
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
GbyAI
GbyAI
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
V
V2EX
酷 壳 – CoolShell
酷 壳 – CoolShell
量子位
博客园_首页
T
Tailwind CSS Blog
aimingoo的专栏
aimingoo的专栏
A
About on SuperTechFans
T
The Blog of Author Tim Ferriss
Stack Overflow Blog
Stack Overflow Blog
Recent Announcements
Recent Announcements
P
Proofpoint News Feed
博客园 - 司徒正美
有赞技术团队
有赞技术团队
Engineering at Meta
Engineering at Meta
Last Week in AI
Last Week in AI
MongoDB | Blog
MongoDB | Blog

少数派

派早报:Google 发布 Fitbit Air 等 - 少数派 「新人报到」確認需求,再開始 - 少数派 从 SOLO 独立开发者社区,我看到了越来越多开发者开始做自己的产品 - 少数派 我怎么管理那些"不常做,但总会忘"的生活事项 - 少数派 人形机器人量产元年,数据才是具身智能的“生死线” - 少数派 BuhoLaunchpad 高度还原 Mac 启动台:开发历程与思考 - 少数派 五年陪伴依然不舍,DIY 换壳后让罗技 MX Master 3 继续服役 - 少数派 新玩意 240|少数派的编辑们最近买了啥? - 少数派 一日一技|为什么你应该关闭 iOS 的键盘声音 - 少数派 我做了个插件和 Skills,一键提取任何网站的设计规范 Design.md - 少数派 住在三四线城市的你,该开始录播客了 - 少数派 甘南秘境,大白高国 - 少数派 AI的审美:谁让把我变成川内倫子 - 少数派 返工怎能不烦恼,打工人片单总有一部是你的「嘴替」 - 少数派 为了让「上厕所」更健康,我做了一个小工具 - 少数派 AI + Skill,能够让生成的文章去除 AI 味吗? - 少数派 新玩意|韶音OpenDots ONE 耳夹式耳机 - 少数派 《美满》| 在每一个春天的晚上相爱(362) - 少数派 新玩意|优篮子 PS01 MagSnap 磁吸支架 - 少数派 自我整合手记 | 我开始早睡了:用稳定规则,为自由托底 - 少数派 用龙虾(OpenClaw)两个多月,我最深的12个体会 - 少数派 听歌时间到,12 张你可能错过的 2025 华语乐坛好专辑 - 少数派 承诺能追吗 - 少数派 macOS 26启动台没了? 我做了个不一样的App启动器 - Keboard - 少数派 《四海为家的人》| INTJ对话INTJ(361) - 少数派 你发过的那些黑历史,是时候一次清干净了 - 少数派 新玩意:安安静静玩,越玩越专注:计客密码机 - 少数派 iPad 用户首次体验 Android 平板:vivo Pad6 Pro - 少数派 数据逻辑强 - 少数派 极北行+ | 一路向北,探访日本至北之地 | 001 - 少数派
AI一键解说并剪辑视频,NAS部署NarratoAI高效内容创作 - 少数派
2026-04-08 · via 少数派

本次来介绍一款能够借助 AI 大模型,实现一键生成解说文案并自动剪辑视频的项目:NarratoAI。

在我身边,已经有朋友通过 AI 生成视频,剪辑后将内容投放到视频平台,成功实现了变现。当然,AI 生成视频的质量和最终呈现效果,并不是简单点一下按钮就能决定的,它通常受到提示词设计、底层模型能力、参考素材质量以及关键参数设置等多方面因素影响。此外,不同工作流的组合方式,以及生成时长带来的内容衰减问题,也都会对结果产生影响。

AI 最终做出来的内容,往往是千人千面的。同样的工具,不同的人去用,效果可能差别很大,所以这件事本质上还是需要不断理解、尝试和学习。

项目介绍

完整项目名:linyqh/NarratoAI,可于GitHub搜索。

NarratoAI是一款自动化影视解说,基于LLM实现文本编写、自动化视频剪辑、配音和字幕生成的一站式流程,助力高效内容创作。可接入 OPAI、DeepSeek、Gemini 兼容网关、Qwen、SiliconFlow、OpenRouter 等服务。

它更适合用来提升效率、搭建 AI 视频工作流,而不是替代专业剪辑软件去做特别复杂的后期。同时,这类项目也有比较强的可调性。不同的提示词、素材内容、模型能力和参数设置,都会直接影响最终效果,所以它既是一个工具,也带有一定的“调教”属性。

部署流程

以威联通NAS为例,通过Docker的方式进行部署。

不过本次作者并没有提供官方镜像,因此需要我们自行构建。

打开SSH工具连接你的NAS,依次输入以下指令:

# 进入常用Docker目录下
cd /share/Container

# Git 拉取
git clone https://github.com/linyqh/NarratoAI.git

# 进入文件
cd NarratoAI

# 修改文件名
cp config.example.toml config.toml

# 构建
docker compose up -d

关于config.toml,其中是API Key的相关配置。包含了 LLM 视觉、文本模型配置,TTS配置两项。这个没啥难度,选择好你的服务商平台,填入参数即可。项目作者也还另外推荐了一个开源的零样本TTS文本转语音服务,大家可以部署联动使用:index-tts/index-tts

截屏2026-03-31 13.47.09.png
截屏2026-03-31 13.17.01.png

关于docker-compose.yml文件简单给大家看下,没什么大差,想要修改端口号,可直接执行vim docker-compose.yml或者在Web端利用NAS自带的文本编辑器修改。

截屏2026-03-31 13.48.53.png

构建所花费的时间还是蛮久的,大概十分钟?大家耐心等待。

截屏2026-03-31 14.01.23.png

如果你创建启动失败,那大概率是文件权限问题,请给storage赋权。

使用展示

部署完毕后,浏览器输入NAS_IP:8501即可访问页面。如果你的页面是一堆红色报错,那概率可能是config.toml配置中的编码问题,文件必须保存成 UTF-8,可以将其中的所有中文注释删除,再跑一遍试试。

如下图左上角,可修改语言。其他配置写的也都很明确,大家自行查看。

截屏2026-03-31 15.44.52.png

普通的脚本、视频匹配,各自上传好后,脚本的文字会转为字幕,TTS转的语音都会在生成的视频中匹配上。

截屏2026-03-31 16.14.35.png
截屏2026-03-31 16.17.35.png

另外也可逐帧解说,通过抽帧,给出最终脚本。

截屏2026-03-31 16.28.34.png
截屏2026-03-31 17.28.17.png

短剧混剪和短剧解说者需要字幕文件,这里我便不做继续的测试了~

最后

总之,这类项目还是挺值得搭来玩玩的。它能不能真正做出像样的东西,既看 AI 行不行,也看人会不会用。工具越来越聪明了,但脚本怎么写、内容怎么讲、节奏怎么控,这些事很多时候还是得靠人。

感兴趣的朋友可以部署个试试。

感谢观看,本文完。