惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

云风的 BLOG
云风的 BLOG
M
MIT News - Artificial intelligence
Recent Announcements
Recent Announcements
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
Stack Overflow Blog
Stack Overflow Blog
J
Java Code Geeks
Microsoft Azure Blog
Microsoft Azure Blog
罗磊的独立博客
博客园 - 【当耐特】
H
Help Net Security
腾讯CDC
大猫的无限游戏
大猫的无限游戏
GbyAI
GbyAI
Last Week in AI
Last Week in AI
Jina AI
Jina AI
博客园 - 聂微东
Blog — PlanetScale
Blog — PlanetScale
A
About on SuperTechFans
Apple Machine Learning Research
Apple Machine Learning Research
P
Proofpoint News Feed
Y
Y Combinator Blog
C
Check Point Blog
博客园 - 司徒正美
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知

博客园_首页

Linux实操--组管理、权限管理和定时任务 Java + EasyExcel 实现单个接口导出多个Excel Mem0 源码解析系列(二):提示词工程的深度剖析 Openclaw TaskFlow究竟是什么?和普通Skill技能有什么区别 博文阅读密码验证 - 博客园 嘉立创开源:应该是全网MicroPython教程最多的开发板 Hermes Agent 集成实践:从协议到生产 2026年AI编程工具横评:Cursor、Codex、Claude Code、Zed、Windsurf Java程序员必看的RAG入门教程 2026 AI效率神器:Superpowers + Claude Code 保姆级教程 本地大模型部署全攻略:从 0 到 1 玩转 Ollama 【从0到1构建一个ClaudeAgent】内存管理-上下文压缩 .NET 高级开发 | 设计、实现一个事件总线框架 电子小白入门之NE555 3. WorkBuddy:隐藏玩法,一键召唤专家,让 AI 以"专家身份"给你干活 和AI一起搞事情#3:Claude Teammate 游戏开发翻车实录 【OpenClaw】通过 Nanobot 源码学习架构---(7)Memory C# .NET 周刊|2026年3月3期 我在 Debian 11 上把 K8s 单机搭起来了,过程没你想的那么顺(/opt 目录版) 深度学习进阶(七)Data-efficient Image Transformer CLI+Skill搭建浏览器AI自动化框架,告别一切重复枯燥任务 告别Token账单无底洞:OpenClaw本地部署,重塑企业数据主权的唯一解 FastAPI+Vue:文件分片上传+秒传+断点续传,这坑我帮你踩平了! SBTI 爆火后,我做了个程序员版的 CBTI。。已开源 + 附开发过程 多模态检索开始进入工程期:用 Sentence Transformers 搭建可落地的 Multimodal RAG 100多行代码实现一个最简单的Agent(用ReAct) Claude Code 通关手册(八):推荐 5 个 Hooks,代码质量提升 3 倍 老板:“有人截图了!”。安全部门:“收到,马上查暗水印!” - why技术 技术之外,皆是人间 C#/.NET/.NET Core技术前沿周刊 | 第 69 期(2026年4.01-4.12)
ffmpeg音频解码器的介绍和了解
HelloLLLLL · 2026-05-04 · via 博客园_首页

Audio Decoders

  AC-3(通常指 Dolby Digital)音频解码器主要用于处理 .ac3格式的音频流,常见于 DVD、蓝光及数字电视广播中。-drc_scale是该解码器用来控制动态范围压缩(DRC)强度的关键参数。AC-3 音轨在设计时为了兼顾影院级的动态范围(爆炸声很大,耳语声很小)和家庭观看需求,内置了动态范围控制(DRC)元数据。DRC能在解码时压缩音频的动态范围,让小声变大、大声变小,从而避免你在深夜观影时频繁调节音量。drc_scale参数决定了在解码过程中应用 DRC 的强度比例。它是一个浮点数,默认值通常为 1。drc_scale = 0,完全禁用 DRC。输出原始、未压缩的全动态范围音频。0 < drc_scale ≤ 1,启用部分压缩。数值越小,压缩越轻;数值为 1 时应用标准的完整压缩。drc_scale > 1,启用增强型压缩(非线性)。对大声压级信号进行更强力的限制,同时提升微弱声音。例子:​

ffmpeg -i input.mkv -c:a ac3 -drc_scale 0 output.wav # 禁用 DRC,保留原动态

ffmpeg -i input.ac3 -drc_scale 2.0 output.wav # 启用强力压缩,

flac

  FLAC audio decoder用于还原无损压缩音频的核心组件。能将 .flac文件精准还原为原始的 PCM 音频数据,有任何音质损失。FLAC 解码器核心特性有:1、无损还原:解码后的音频数据与编码前完全一致,常用于音乐存档、母带制作及 Hi-Fi 播放。2、广泛兼容:支持 FLAC 规范中的所有特性,包括高分辨率音频(最高 32-bit/655.35 kHz)、多声道(如 5.1/7.1)及元数据(如封面、CUE 章节)。默认行为:在 FFmpeg 中,只要使用 -c:a flac或默认的自动解码流程,即可调用此解码器。

参数:-use_buggy_lpc,用于解码从‌早期 FLAC 编码器(如 1.1.x 或更早版本)‌ 生成的文件,因为这个早期的编码器的一个算法上有缺陷,后来,新版的解码器修复了这个问题,导致旧版和新版的FLAC编码器的文件再解码时有兼容问题。ffmpeg 在使用这个参数时,就是为了兼容旧版本FLAC编码器编码的文件,开启这个参数,就用对应有缺陷的旧编码算法的解码算法,不开启这个参数,就说明是用的新与修复后的算法对应的解码算法来解码。如果当你发现在没开启这个参数时,解码出来的音频在合成后形成的音频文件出现了播放异常(如爆音、失真),但确认文件未损坏。就可以尝试开启这个参数。例如:

  # 仅在遇到“问题文件”时使用

  ffmpeg -i buggy_file.flac -c:a flac -use_buggy_lpc 1 fixed_output.wav

  # 正常情况下的解码(推荐)

  ffmpeg -i normal_file.flac output.wav

ffwavesynth

  音频也是可以像编程一样,通过特定的语法可以创建出能播放标准声音的脚本文件。这让我联想到一些ai模仿明星的说话的声音,就是因为其声音是可以通过编程来实现让人觉得ai的声音与真人声音听起来很相似。这意味着任何人的声音都在被这人的声音数据被收集齐备后,是可以通过编程来实现模仿这个人的说话声音。一些网络上的骗子就会使用有这种技术的软件。这是题外话。这个ffwavesynth,就可以把这些声音脚本文件,通常是.wave格式的文件,像我们的各种编程语言的编译器一样,解析“编译”脚本的语法,最后程序是生成可执行文件,而这个ffwavesynth组件就会合成出可以被音频设备,如:扬声器、耳机播放出声音的音频数据,它不直接生成文件,它是一个解码器,后续还需要把经过ffwavesynth处理的数据,复用后最终生成一个音频文件。

libcelt decoder wrapper

  ffmpeg里并没有libcelt解码动态库,需要我们自己准备好,而ffmpeg里的libcelt decoder wrapper是对真正的libcelt解码器的封装。libcelt库解码的对象是CELT​编码器编码的音频,CELT 编解码器的出现是为了实时的语言交互,它的延迟很低,但该编码器在2010年就没有人维护,取而代之的是Opus编解码器。针对CELT​编码器编码的这种音频,对使用的ffmpeg是有要求的,在编译ffmpeg源码时,要显示配置 --enable-libcelt,并且系统需预先安装好对应的 libcelt开发包(如 libcelt-dev),这个库我想的话要放到ffmpeg的音频解码器目录,在编译时,需要指定这个libcelt所在目录的路径,否则编译后会找不到此解码器,那编译出来的ffmpeg就无法处理这种音频了。它的使用命令:

  # 使用 libcelt 解码器进行转换

  ffmpeg -c:a libcelt -i old_voice.celt output.wav

  # 或者让 FFmpeg 自动探测(如果流标记正确)

  ffmpeg -i old_voice.celt output.wav

libcelt decoder wrapper

  这个跟libcelt decoder wrapper类似,也是要编译设置,也是一个适配器充当ffmpeg与真正的ibcelt decoder的“胶水”作用。开了ai的介绍,让我想到了以前2000年左右使用GSM电话卡,对没错,这个编码器就是可以用来编解码这种2G时代的手机通话语音的。

libilbc decoder wrapper

  这个也跟libcelt decoder wrapper类似,后面提到某某wrapper都是这个意思。它是用于实时语音通话,核心是为了实时传输中容错抗丢包,现在已被Opus编解码器替代。

libmpeghdec decoder wrapper

  libmpeghdec用于编解码高清广播流媒体领域,被视为杜比全景声(Dolby Atmos)的主要竞争对手。

libopencore-amrnb

  AMR-NB是2G/3G 时代的语音标准,也是早期手机录音(.amr文件)的通用格式。

libopencore-amrwb

  3G/4G 的高清语音编解码器

libopus

  它就是取代libilbc、libcelt的编解码器。