惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

WordPress大学
WordPress大学
GbyAI
GbyAI
P
Proofpoint News Feed
B
Blog
MyScale Blog
MyScale Blog
V
V2EX
B
Blog RSS Feed
Microsoft Security Blog
Microsoft Security Blog
量子位
Jina AI
Jina AI
博客园 - 叶小钗
Recent Announcements
Recent Announcements
有赞技术团队
有赞技术团队
罗磊的独立博客
L
LangChain Blog
I
InfoQ
云风的 BLOG
云风的 BLOG
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
人人都是产品经理
人人都是产品经理
小众软件
小众软件
V
Visual Studio Blog
月光博客
月光博客
The Cloudflare Blog
雷峰网
雷峰网

Prompt 语宙

kimi-thinking-preview – 月之暗面推出的多模态思考模型 pdf-craft – 开源 PDF 转 Markdown 工具 UltraMem – 字节豆包大模型团队推出的全新超稀疏模型架构 EasyControl – Tiamat AI 联合上海科大等开源的图像生成控制框架 GaussianCity – 南洋理工大学 S-Lab 团队推出的 3D 城市生成框架 X-Prompt – 用于多模态视频目标分割的通用框架 豆包大模型1.5 – 字节跳动推出的最新版大模型 GaussianAnything – 南洋理工 S-Lab 和上海 AI Lab 等推出的 3D 生成框架 Cube 3D – Roblox 推出的 AI 3D 生成模型 OpenMath-Nemotron – 英伟达开源的数学推理系列模型 MAI Transcribe-1.5 – 微软 MAI 推出的语音转文本模型 Seed1.5-Embedding – 字节跳动 Seed 团队推出的向量模型 2026世界杯人机大战引爆!联想携手DeepSeek等顶尖AI大模型,对战亿万球迷预测冠军 高考公平守护战!豆包、文心等主流大模型集体禁用拍题功能 ShotAdapter – Adobe联合UIUC推出的多镜头视频生成框架 Devstral – Mistral AI联合All Hands AI开源的编程专用AI模型 MMaDA – 字节联合普林斯顿大学等推出的多模态扩散模型 Software Copyright Materials Skill – 开源软著资料生成Skill Dulus – 开源的 CLI AI Agent,可驱动多模型工具调用 Reasonix – 专为 DeepSeek 推出的开源终端编程 Agent Mega-ASR – NTU、NUS、上海AI Lab开源的语音识别模型 CodeGraph – 开源代码知识图谱工具,加速代码理解和分析 MiniCPM5-1B – 面壁智能联合清华开源的端侧文本基座模型 Horizon – 开源 AI 信息聚合系统,构建专属新闻雷达 BitCPM-CANN – 面壁智能联合清华开源的端侧大模型 Xiaomi Auto World Model – 小米推出的辅助驾驶世界模型 opera-browser-cli – Opera Neon 开源的命令行工具 omp – 开源的 AI 终端编程智能体,能与 IDE 深度联动 Claude Opus 4.8 – Anthropic 推出的旗舰级大语言模型 Hy-Memory – 腾讯混元推出的 Agent 记忆插件
香港中科院发布超声大模型「聆音EchoCare」:450万张影像训练...
站外新闻 · 2026-06-19 · via Prompt 语宙

💡 站外导读:医疗AI正经历从单点辅助到全流程赋能的范式跃迁,超声影像因实时性强、操作依赖医师经验、图像质量参差不齐,成为AI落地的关键场景与难点。如何用有限标注数据训练出泛化性极强的模型,是业界普遍痛点。中科院香港创新研究院推出的超声大模型聆音EchoCare,正是针对这一挑战给出的系统性解答——用450万张全球多中心数据与结构化自监督框架,重新定义超声AI的天花板。

聆音是什么

聆音(EchoCare)是中国科学院香港创新研究院人工智能与机器人创新中心(CAIR)推出的超声大模型。模型依托450万张超声影像数据集EchoAtlas进行训练,数据集涵盖5个大洲的23个临床中心、38种成像设备采集的图像,覆盖人体9大区域和52个解剖器官,是目前规模最大的超声影像数据集之一。EchoCare采用“结构化对比自监督学习框架”,通过图像掩膜重建、自适应困难图块挖掘等技术,显著提升了模型对超声影像深层语义的建模能力和泛化性能。在超声图像分割、分类、检测、回归、增强等七大医学任务中,性能均优于当前最优方法。

  • 聆音是什么
  • 聆音的主要功能
  • 聆音的技术原理
  • 聆音的项目地址
  • 聆音的应用场景
      • 📝 站长洞察 (Editor’s Insight)

EchoCare

聆音的主要功能

  • 超声图像分割:能精准地对超声图像中的不同组织和器官进行分割,帮助医生更清晰地识别病变区域和正常组织的边界,为诊断提供更准确的依据。

  • 病变分类:对超声图像中的病变进行分类,如区分良性和恶性肿瘤等,辅助医生快速判断病变的性质,提高诊断效率。

  • 器官检测与分割:不仅可以检测出图像中的器官位置,还能对器官进行精确分割,为后续的诊断和治疗提供详细的解剖信息。

  • 图像增强:对超声图像进行质量提升,改善图像的对比度和清晰度,使医生能够更清楚地观察到细微的结构和病变,减少误诊的可能性。

  • 报告生成:根据超声图像分析结果自动生成诊断报告,节省医生撰写报告的时间,提高工作效率,同时保证报告的准确性和一致性。

聆音的技术原理

  • 大规模数据集构建:依托450万张超声影像数据集EchoAtlas进行训练,数据集涵盖多中心、多设备、多民族的全球队列,覆盖人体9大区域和52个解剖器官,为模型提供了丰富的学习素材。

  • 结构化对比自监督学习框架:引入基于医学先验的层次化树形标签,实现多标签语义关系结构化学习与隐式编码,提升模型对超声影像深层语义的建模能力。

  • 图像掩膜重建技术:通过对图像进行掩膜重建,增强模型对图像局部特征的学习和理解,提高模型的鲁棒性和泛化性能。

  • 自适应困难图块挖掘技术:自动识别并聚焦于难以学习的图像区域,针对性地加强学习,提升模型对复杂图像的处理能力。

  • 渐进式训练策略:采用渐进式训练方法,逐步增加模型训练的难度和复杂度,帮助模型更好地适应不同类型的超声图像,提升整体性能。

聆音的项目地址

  • 项目官网:https://echocare.cares-copilot.com/
  • Github仓库:https://github.com/CAIR-HKISI/EchoCare
  • arXiv技术论文:https://arxiv.org/pdf/2509.11752

聆音的应用场景

  • 医院常规检查:在医院的日常超声检查中应用,能显著降低对专业人员的依赖,协助医生更高效、更精准地进行诊断,有效提升医疗服务效率,为医疗资源的优化配置提供更多可能性。

  • 疾病诊断与筛查:可用于多种疾病的诊断和筛查,如在山东大学齐鲁医院妇产科1556例卵巢肿瘤超声病例和中南大学湘雅医院1000余例甲状腺超声检查中的具体案例验证,其性能显著优于现有SOTA方法。

  • 心脏超声检测:在心脏超声主动脉瘤检测与分析方面,可进行回顾性验证,为心脏疾病的诊断提供有力支持。

  • 超声图像处理:包括超声图像分割、分类、检测、回归、增强等七大医学任务及十余项下游应用,如病变分类、器官检测与分割、图像增强等,提升超声图像的质量和诊断价值。

  • 临床适配与研究:基座模型计划开源供医疗机构使用,后续将分阶段推进前瞻性研究、急诊室场景应用及联合超声设备企业进行硬件集成。

📝 站长洞察 (Editor’s Insight)

聆音的发布标志着医疗大模型从自然语言处理向多模态医学影像的深度延伸。其核心突破有二:一是EchoAtlas数据集的全球化多中心构建,解决了医疗AI最棘手的数据偏倚与泛化难题;二是结构化对比学习框架,将医学先验知识(如器官层级关系)编码进模型,这比单纯堆算力更具范式意义。结合OpenAI、Google Health近期在病理与放射领域的布局,我们可以预见,2025年将是医疗基础模型的爆发之年。聆音选择基座模型开源并推动硬件集成,这一路径若走通,将大幅降低基层医院的超声诊断门槛,其商业化潜力与社会价值同样值得期待。对于关注医疗AI赛道的投资人与开发者,这篇论文的技术细节值得反复研读。