惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

博客园 - 叶小钗
Last Week in AI
Last Week in AI
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
V
V2EX
J
Java Code Geeks
The GitHub Blog
The GitHub Blog
博客园_首页
U
Unit 42
人人都是产品经理
人人都是产品经理
Engineering at Meta
Engineering at Meta
IT之家
IT之家
G
Google Developers Blog
L
LangChain Blog
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
爱范儿
爱范儿
罗磊的独立博客
博客园 - 三生石上(FineUI控件)
Martin Fowler
Martin Fowler
Jina AI
Jina AI
有赞技术团队
有赞技术团队
Apple Machine Learning Research
Apple Machine Learning Research
Vercel News
Vercel News
小众软件
小众软件
H
Help Net Security

InfoQ - 促进软件开发领域知识与创新的传播

Meta 收购 Manus 这事儿泡汤了 5.5万 Star 开源项目 Ghostty 被迫出走,GitHub 正在终结一代技术人的乌托邦 Slack 长时运行多智能体系统的上下文管理方案 从 T+1 到分钟级:金城银行基于 Apache Doris 构建高可靠、强一致的实时数据平台 谷歌云推出 Agents CLI,简化 AI 智能体开发全流程 Claude官方击穿高薪、高学历的安全防线!Anthropic点名10大高危职业,但有群人暂时稳了 亚马逊云科技终止 WorkMail 服务,并将 App Runner 转入维护模式 OPPO小布记忆:全模态碎片化内容的理解与智能整理实践|AICon上海 模力工场038周AI应用周榜:工具在消失,工作流在出现 Akamai CEO Tom Leighton:Agent 时代来临,云基础设施正从“中心化”转向“分布式边缘” 日均数百亿入库背后:从“人肉调度”到K8s弹性架构,度小满金融基于OceanBase重构入库架构实践 百度文库网盘发布GenFlow 4.0:月活用户超1亿,要把网盘变成全端AI工作台 Altman 投的 Agent 终端 Warp 开源了!斩获3.5万star 哪些客户需要拒, 敢让龙虾决定吗?_AI&大模型_InfoQ 中文站_InfoQ精选视频 从开发到生产:为什么越来越多的机器学习团队纷纷迁移到 Snowflake | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 探索多智能体工作流:LangGraph Snowflake Cortex AI | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 腾讯云分布式缓存数据库:AI Agent - 从提示词工程到 Harness 工程 | 腾讯云数据库 DBTalk_腾讯_凌敏_InfoQ精选视频 基于 Streamlit 为 CSV 数据构建分析智能体 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 AI 智能体:告别文档缺漏 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 构建 AI 驱动的数据管道:深度探讨 Snowflake Openflow 与非结构化数据 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 云端太贵、本地不够聪明,英特尔押注“端云混合AI”:智能体PC会替人完成工作 不到10%的存储投入,可能拖垮90%的GPU投资!IBM把AI Agent塞进存储系统,算清企业最容易忽略的一笔账 Snowpark 上手实战 | BUILD 2025_大数据_王玮_InfoQ精选视频 ClickHouse + Langfuse,构建 Agent 可观测基石 腾讯云分布式缓存数据库:Cluster Proxy 共享连接架构深度解析 | 腾讯云数据库 DBTalk_腾讯_凌敏_InfoQ精选视频 AI 写代码太烧钱了:Copilot、Claude 一起涨价,不如把程序员请回来? 英特尔发布至强600系列工作站处理器与锐炫Pro B70 GPU,全新AI工作站来了 腾讯云分布式缓存数据库:从 Redis 到 Valkey - 开源社区如何快速创新 | 腾讯云数据库 DBTalk_腾讯_凌敏_InfoQ精选视频 印奇这次要“从0重做”智驾模型!首谈阶跃和千里双公司布局:中国AI商业闭环要靠车跑出来 从Cursor返聘归来,90后华裔女高管带Claude开启日更模式:token成本比工程师工资低多了!
上海人工智能实验室青年科学家何聪辉确认出席AICon上海站,分...
AICon 全球人工智能开发与应用大会 · 2026-06-02 · via InfoQ - 促进软件开发领域知识与创新的传播

当前,以 Agent 为核心的新一轮技术浪潮正在席卷产业。那么,世界模型的下一个突破在哪?Agent 从 Demo 到工程化还差什么?研发体系不重构,还能撑多久?

6 月 26 日-6 月 27 日,AICon全球人工智能开发与应用大会将在上海举办。本次大会将围绕以上问题,邀请来自腾讯、阿里、快手、华为、飞猪等 50+头部企业的技术负责人、高校与科研机构的一线专家,分享 Agent 在真实生产环境中的落地经验与前瞻思考。深入探讨 Agent 从原型到量产的工程挑战、数据与记忆的基础设施底座、安全可信的落地保障,以及大模型推理优化、智算架构升级等关键命题。

上海人工智能实验室青年科学家何聪辉确认出席 “人工智能前沿技术探索” 专题,发表题为MinerU:面向 Agent 时代的文档解析基础设施演进与实践的主题分享。在 LLM 预训练与 RAG 规模化应用的今天,高质量文档数据的获取已成为制约 AI 能力突破的瓶颈。本次演讲将深度拆解开源文档解析基础设施 MinerU 的演进历程:从基于传统 OCR 与布局检测的 v1 Pipeline 方案,到引入解耦式多模态大模型的 v2.5 架构,再到最新突破性能天花板、纯数据驱动的 v2.5-Pro 范式。本次演讲将重点分享 MinerU 如何攻克公式识别(UniMERNet)、复杂布局检测(DocLayout-YOLO)及表格解析(OTSL)等核心硬核技术,并首次公开其背后的“数据炼金术”——包含多样性感知采样(DDAS)与跨模型一致性验证(CMCV)在内的三维协同数据引擎。最后,演讲将展示 AgenticOCR 与扩散并行解码等前沿探索,探讨文档解析如何从“静态提取”转向“动态智能体感知”。

何聪辉,清华大学计算机科学博士,上海人工智能实验室青年科学家、数据平台中心负责人。长期深耕高性能计算与人工智能交叉领域,谷歌引用超 1 万次,曾获 ACM 戈登·贝尔奖(超算领域最高奖)、ACL 最佳主题论文奖等国际顶级荣誉。在上海人工智能实验室组建 OpenDataLab 团队,专注于 AI 数据基础设施建设。团队研发的 MinerU 发布一年获 GitHub 6 万星标,调用量超 10 亿次,被 Google、华为、阿里等百家企业采用;所建立的评测基准被 Google Gemini 3 和 OpenAI GPT-5 官方采纳,是其中唯一来自中国团队的成果。他在本次会议的详细演讲内容如下:

演讲提纲:

  1. 时代背景:文档解析为何成为 AI 的“入场券”?

    演进脉络:从单一 OCR 任务到智能文档理解(IDP)的跨越。

    双轮驱动:LLM 预训练对海量高质量知识的渴求 vs RAG 系统对精准检索的刚需。

    竞争格局:OmniDocBench 时代的百家争鸣与 MinerU 的定位。

  2. 技术进化论:MinerU 的三个里程碑

    MinerU v1 (Pipeline):

    核心组件:UniMERNet 公式识别与 DocLayout-YOLO 布局检测

    工程化落地:四阶段处理流(预处理 -> 解析 -> 后处理 -> 格式转换)

    MinerU 2.5 (Decoupled VLM):

    架构创新:低分辨率全局布局(Stage I)与原分辨率局部识别(Stage II)的解耦

    效率突破:解决端到端模型 $O(N^2$ token 复杂度难题

    MinerU 2.5-Pro (Data-Centric):

    核心洞察:架构趋同下,性能瓶颈已转向训练数据的质量与分布

    数据驱动:同参数规模下的性能飞跃(Overall 92.98 -> 95.69)

  3. 算法深潜:攻克文档解析的“三座大山”

    公式之巅:UniMERNet 百万级数据集与 CDM 视觉级评测指标

    布局之变:统一 21 类细粒度标签体系与 PageIoU 评估标准

    表格之困:OTSL 压缩格式(28 -> 5 tokens)与旋转矫正流水线

  4. 数据炼金术:大规模数据工程的闭环(Pro 版核心)

    采样逻辑 (DDAS):视觉特征聚类与难度感知采样

    验证机制 (CMCV):异构模型交叉验证,精准定位模型短板

    标注闭环:Judge-and-Refine 自动校正与定向专家标注

  5. 未来探索:迈向 Agent 与 扩散模型

    AgenticOCR:按需动态解析,从“全量扫读”到“智能点读”

    MinerU-Diffusion:基于扩散模型的非自回归解码,实现 3.26x 速度提升

听众收益:

  • 以获得一套可直接落地的 RAG 数据清洗管线参考,了解如何处理公式、表格、阅读顺序等“硬骨头”。

  • 能够学习到如何构建百万级高质量数据集(UniMER-1M)以及如何设计多模型协同的数据引擎(Data Engine)方法论。

  • 通过 MinerU 的演进路线,可以清晰地看到文档解析技术从“拼凑工具库”到“垂直多模态大模型”再到“数据为王”的发展趋势,为企业数字化转型提供技术选型依据。

  • 了解到国产开源项目在登顶 GitHub Trending 背后,不仅有工程实现的努力,更有在顶级学术会议(CVPR 2025/2026)上的深度理论创新。

除此之外,本次大会还策划了端侧 AI、物理与数字空间智能化世界模型与多模态智能突破Agent 架构与工程化实践Agent 安全与可信治理企业级研发体系重构AI 原生数据工程AI 时代的个人提效与组织变革等 14 个专题论坛,届时将有来自不同行业、不同领域、不同企业的 50+资深专家在现场带来前沿技术洞察和一线实践经验。

更多详情可扫码或联系票务经理 13269078023 进行咨询。