惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

博客园 - Franky
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
美团技术团队
The Cloudflare Blog
量子位
酷 壳 – CoolShell
酷 壳 – CoolShell
博客园_首页
F
Fortinet All Blogs
J
Java Code Geeks
人人都是产品经理
人人都是产品经理
N
Netflix TechBlog - Medium
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
爱范儿
爱范儿
Apple Machine Learning Research
Apple Machine Learning Research
B
Blog RSS Feed
博客园 - 聂微东
Hugging Face - Blog
Hugging Face - Blog
WordPress大学
WordPress大学
小众软件
小众软件
Y
Y Combinator Blog
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
Vercel News
Vercel News
S
SegmentFault 最新的问题
有赞技术团队
有赞技术团队

峰峰的小窝

逆向提取软件数据库 照片高斯建模实现 从零开始的自动驾驶(六)无刷电调硬件改了又改 从零开始的自动驾驶(五)整体设计|峰峰的小窝 从零开始的自动驾驶(四)无刷电调硬件修改|峰峰的小窝 从零开始的自动驾驶(三)ROS2与雷达|峰峰的小窝 从零开始的自动驾驶(二)编译开发板Linux|峰峰的小窝 从零开始的自动驾驶(一)无刷电调硬件|峰峰的小窝 搭建代理服务器跳板|峰峰的小窝 迎接新的时代|峰峰的小窝 一段故事的结束|峰峰的小窝 AI全自动写小说|峰峰的小窝 桌面直播通话APP设计实现|峰峰的小窝 2025 年总结|峰峰的小窝 SPI串并转换模块|峰峰的小窝 一种另类的数据标注方法|峰峰的小窝 GPS定位模块设计|峰峰的小窝 STM32硬件和软件设计指南|峰峰的小窝 基于Docker的多实例管理系统|峰峰的小窝 Hello PCB|峰峰的小窝 Hello ESP8266|峰峰的小窝 实时语音智能体快速搭建|峰峰的小窝 Git自动化测试部署|峰峰的小窝 Docker镜像构建和部署|峰峰的小窝 Web应用私有化|峰峰的小窝 虚幻FFMPEG解码视频|峰峰的小窝 Fish-Speech的编译优化|峰峰的小窝 阶段总结|峰峰的小窝
正射影像拼接和AI实例分割系统设计实现
FFeng 我能想到的,最大的成功就是无愧于自己的心。 · 2026-09-07 · via 峰峰的小窝

有这样一个需求,我需要写一个有这些功能的简单平台:

  • 将航拍的正射影像拼接为一张底图

  • 在超大的一张地图上使用AI算法进行实例分割

我的最终实现中又多了这些功能:

  • 金字塔瓦片切分

  • 手动实例标注和修改

  • 导出切片数据集

正射影像拼接

目前存在相当多的库可以做正射影像拼接。

我把他们大致分为三类:

  • 无缝图拼接类:这类侧重于观赏性,不保证测绘准确性,适用于全景图拼接

  • 平面快速简单拼接类:这类拼接速度非常快,不进行图像对齐,不做边缘融合,适合实时看效果。

  • 三维点云重建:与三维重建类似,会经过图像对齐、点云生成等过程,但最终只输出高清俯视图。

试过简单拼接、试过结合无缝拼接,踩了很多坑后,最后决定使用最复杂、效率最低的三维点云重建方案。

这一类也有很多库,其中最著名的是 ODM(OpenDroneMap),AI跟我说用这个需要拉10个G的东西下来。

最终找到了 WebODM 这个工具,让 AI 解包了重建引擎,是 ODX ,所以最终采用了 ODX 进行正射拼接。

实例分割

接下来是接入 AI 能力。

像这种视觉任务,我第一个想到的当然是 YOLO 啦~

买了两个数据集,训练了 YOLO26n-seg 和 YOLO26s-seg,在数据集上的指标非常好(很大一部分原因是数据集是无人机连续拍摄的图片,有大量重复区域)

在其他地方买的两个业务需要的数据集训练模型后其实并不能很好泛化,最终手动标注了一部分数据,将应用先内测一段时间产生数据集。

实测对于本次切分田块的任务, 相比与 YOLO-seg 模型,SAM2 + YOLO26 目标检测能够更好地进行实例分割。

  • SAM2 是语义分割模型,不能进行实例分割

  • YOLO26 只检测目标的锚框

两者结合,先检测锚框,然后在锚框内进行语义分割。


大概是数据集的问题,模型最终效果其实并不太好:

后续会针对于模型做优化。

切片检测

将一张很大的图缩小之后给模型推理是效果很差的。所以需要将大图切片检测。

我的做法非常简单粗暴,切片之间保留一定的重叠率(参考值 50%),切片边缘丢弃一部分(参考值 10%),如果任意两个实例之间的重叠面积达到了较小实例的一定比例就合并为一个(参考值 60%)。

重叠率够大的情况下,能够弥补一部分模型的缺陷:


后续像 金字塔瓦片切分、数据集导出、编辑标注等功能在VibeCodeing时代就不多赘述啦。