






























这组评论围绕一个用麦克风持续监听鸟类、再用机器学习识别鸟鸣的项目展开,相关工具里最常被提到的是 Cornell Merlin Bird ID app(Cornell Lab of Ornithology 的识鸟应用)和 BirdNET(基于鸟鸣识别的音频模型)。有人进一步提到 BirdNET-Pi / BirdNET-go 这类自托管方案,可在 Raspberry Pi 或普通机器上做 bird listening station(鸟类监听站)。讨论还延伸到 bioacoustics(生物声学)、spectrogram(声谱图)和 Nyquist Theorem(奈奎斯特采样定理)等基础知识,以及为 Rwanda、Príncipe 等地区手工标注录音、训练 custom classifier(自定义分类器)来弥补现成模型在高生物多样性地区的不足。评论中也出现了把同类方法迁移到车辆异响检测的想法,外加一段偏离主题的 kachō-e(花鸟画)提示词讨论,关注水彩效果与植物学准确性。
很多人把这个项目和 Cornell Merlin Bird ID app 联系起来,认为它很可能用的是同一类识别技术。有人把它当成日常观鸟工具,边散步边开着,能识别出不少意外的鸟类声音,甚至连 mockingbird 模仿别的鸟也能分辨出来。还有人推荐 BirdNET-Pi 的替代方案 BirdNET-go,强调它能在非 Raspberry Pi 设备上运行,而且维护活跃。整体上这一组评论更偏向“实用派”,关注现成工具和本地化部署。
另一些评论把话题带到 bioacoustics(生物声学)和模型训练本身。有人从研究鸟鸣的语法和声学基础入手,提到 spectrogram(声谱图)和 Nyquist Theorem(奈奎斯特采样定理)这类基础知识,并一路学到 Cornell 的 Conservation Bioacoustics 课程和讲座。最终目标是手工标注音频、为难以被 BirdNET 识别的物种训练 custom classifier(自定义分类器),尤其是 Rwanda 这类现成模型覆盖较弱的地区。另一位评论者补充说,在 Príncipe 做类似的 MSc 论文时也遇到同样问题,说明全球生物多样性最丰富的地方,往往也是模型最不可靠的地方。
有评论者把重点放在非常微弱、容易被背景噪声淹没的鸟类交流声上。ta 参与野生鸟类救护,也养过被放生的宠物鸟,发现它们会发出几乎贴着耳朵才能听见的细小声音,而这些声音未必会被现有模型识别成鸟鸣。ta 想离线分析 24 小时录音,找出背景噪声里的轻微变化,而不是要求实时识别,也明确表示自己刚接触音频分析。后续有人顺势问,这套思路能否迁移到车辆故障声检测,说明大家在思考“从鸟叫到机器异响”的通用音频异常识别。
还有一段评论明显偏离鸟鸣识别,转向一张 kachō-e(花鸟画)风格的提示词和生成效果。讨论重点是如何在锐利轮廓和水彩质感之间取得平衡,以及怎样处理植物形态的准确性。有人举了 cacao(Theobroma cacao,可可树)这种“果实长在树干上而不是枝头”的例子,说明 botany 细节会直接影响画面可信度。这个分支更像是对图像生成提示词和植物学准确性的较真。
BirdNET: 一个基于深度学习的鸟类鸣声识别系统,常用于自动分析录音中的鸟种。
Merlin Bird ID app: Cornell Lab 的观鸟识别应用,可通过声音或图像辅助识别鸟类。
bioacoustics: 利用声音研究、监测和识别生物的学科,常用于生态调查和物种监测。
spectrogram: 把声音按时间与频率展开的图,用来观察音频特征和做模式识别。
Nyquist Theorem: 采样率必须足够高,才能无失真重建原始声音的基本原则。
custom classifier: 用人工标注数据训练的专用分类模型,适合识别特定物种或特定场景。
BirdNET-Pi / BirdNET-go: 基于 BirdNET 的自托管鸟鸣监测方案,常用于本地长期录音分析。
此内容由惯性聚合(RSS阅读器)自动聚合整理,仅供阅读参考。 原文来自 — 版权归原作者所有。