惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

阮一峰的网络日志
阮一峰的网络日志
Last Week in AI
Last Week in AI
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
U
Unit 42
J
Java Code Geeks
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
罗磊的独立博客
月光博客
月光博客
腾讯CDC
Stack Overflow Blog
Stack Overflow Blog
小众软件
小众软件
B
Blog
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
美团技术团队
Y
Y Combinator Blog
T
Tailwind CSS Blog
宝玉的分享
宝玉的分享
酷 壳 – CoolShell
酷 壳 – CoolShell
博客园_首页
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
爱范儿
爱范儿
B
Blog RSS Feed
V
Visual Studio Blog
MyScale Blog
MyScale Blog

分享创造

[发 15 个码] 开发的 Mac 应用 分享 KCase 脑图测试用例生成平台(AI 辅助生成测试用例) 标签页囤积症自救:写了个插件 TabRack,主打快速检索、自动分类和 AI 摘要 [file-preview]一个比较全面的在线文件预览组件库-支持 react 和 vue 撸了个 iOS 小应用[极简水印相机],直接免费 做了一个 V2EX Skill 写了个 iOS 打码 App「遮鸭 Maskduck」,纯离线免费 35 岁前端,裁员失业后,我花 1 个月做了个 AI 生图网站 亲身经历猫咪急症,我做了一款猫狗疼痛检测工具,希望能救你家毛孩一命 如何用 AI 做比较酷炫的落地页? 求真!最近 AI 生图的能力强到可怕 开源一个查看 k8s 的菜单栏工具-kubebar Packpour:我做了个专门给 App Store Connect 填多语言元数据的小工具 面对 140 年一遇的超级厄尔尼诺,我做了个全球监测小站 做了一个自动翻译的 Hacker News 客户端 做了一个 AI 头像生成器,可以免费生成 2 次 [送码 50 个] 自己手搓了个高颜值的倒数日 App——拾光机,求 V 友们指点 一个将苹果健康 APP 数据导出的工具,然后把你的数据喂给 AI 分析 我做了一个叫「订阅斩」的 iOS App,专门对付那些悄悄扣钱的订阅 做了个草率的日麻互动漫画,听听反馈 喜欢自己洗车的朋友们,我用 ai 做了一款洗车小程序 -- 洗车志 感谢 V2EX 上各位 NAS🍆 和 Datahoarder 玩家的关注和真实反馈!作为个人开发者,能得到这么多硬核玩家们的讨论,我非常荣幸。 用 AI 开发熊孩子自律的小程序 用 OpenClaw 搭建个人运动助手 今天摸鱼给 NanaAI 也接入了 GPT-Image-2 [Video Companion]一个 chrome 插件,解决大多对视频操作的需求~欢迎使用提 bug AI 时代,做产品简单了,把产品推广出去却变的更难了~ bestskills.dev - Skills 精选和评测站点 免 ROOT 强力卸载安卓广告软件 一个 All In One 的运维工具,支持 SSH、数据库、Redis 管理
如果你做过 segmentation,可能默认用了太久 argmax
lev1s · 2026-04-20 · via 分享创造

最近 AI 圈聊 agent 、workflow 、MCP 聊得很热,我最近反而回头看了一个很土的地方:image segmentation 最后那一步,到底是不是应该那么理所当然地 argmax

如果你做过这类任务,流程基本都差不多:模型吐出 per-pixel logits 或 probability map ,插值回原图尺寸,然后 argmax 或 threshold 出 mask 。SegFormer 、DeepLab 、UPerNet 这类语义分割模型是这样,很多把 SAM 或别的视觉 backbone 接到语义分割结果上的链路,最后也还是这一步。写久了之后,很容易把它当成一个收尾动作,而不是一个值得单独优化的决策规则。

但 image segmentation 偏偏不是一个只看局部对错的任务。线上或者论文里真正看的,通常是 mIoU / mDice 这类整体 overlap 指标,而 argmax / threshold 更像是逐像素做贪心决策。每个 pixel 单独看都没问题,不代表整张 mask 的全局指标最优,尤其是小物体、边界、遮挡和一些碎区域,常常就是在最后这一步开始丢。

我最近在参与 RankSEG 这条线,做的事情其实很朴素:不改训练,不碰模型权重,只重写“怎么把概率图变成最终 mask”这一步。换句话说,就是把 pipeline 里默认的 probs.argmax(dim=1) 换成一个更贴 segmentation 指标的后处理。对已经有现成推理链路的人来说,改动点非常明确,不是另起一套系统。

这个项目我觉得值得发出来,也主要是因为它有点工程杠杆。现在 PyTorch native 的概率图流程可以接,Transformers 那种 processor -> model -> outputs -> postprocess 的链路也可以接。理论线也不是空口白话:原始工作是 JMLR 2023 ,RMA 加速版见 arXiv 2510.15362,仓库材料把它标成了 NeurIPS 2025 。公开材料里,VOC 上 SegFormer 相对 argmax 有 +1.02 mIoU,ADE20K 上 UPerNet 有 +0.98 mIoU,医疗分割里 LiTS / KiTS 还更明显。重点不在于“又多一篇分割论文”,而在于你不用重训,只是把最后一步重做一遍,就可能把已经训练好的模型再榨一点出来。

我把仓库、文档和可直接跑的入口放下面了。如果你正好做 segmentation ,可以很快试一下;如果你不做这个方向,我其实也更想聊另一个问题:你们自己的模型链路或者规则系统里,有没有这种“前面很复杂,最后一步却长期默认处理”的地方?

仓库:https://github.com/rankseg/rankseg

文档:https://rankseg.readthedocs.io/en/latest/

Colab:https://colab.research.google.com/github/Leev1s/rankseg/blob/feat/transformers-adapter/notebooks/rankseg_with_transformers.ipynb

Hugging Face Space:https://huggingface.co/spaces/statmlben/rankseg

如果想先看效果,大概是这种感觉: