惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Last Week in AI
Last Week in AI
有赞技术团队
有赞技术团队
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
人人都是产品经理
人人都是产品经理
博客园 - 司徒正美
博客园 - 聂微东
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
博客园 - 叶小钗
罗磊的独立博客
IT之家
IT之家
博客园 - 三生石上(FineUI控件)
V
Visual Studio Blog
T
Tailwind CSS Blog
大猫的无限游戏
大猫的无限游戏
Hugging Face - Blog
Hugging Face - Blog
H
Hackread – Cybersecurity News, Data Breaches, AI and More
N
Netflix TechBlog - Medium
MyScale Blog
MyScale Blog
J
Java Code Geeks
L
LangChain Blog
S
SegmentFault 最新的问题
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
Apple Machine Learning Research
Apple Machine Learning Research
G
Google Developers Blog

V2EX

我用 AI 写代码,但终端管理反而成了累赘——于是我做了 codux [调研] 各位在公司都用什么 ide 和 agent 写代码? 老运维 share 一个运维平台 新电脑 brew install node 之后,一个小设置可以提升对供应链投毒的防御 GLM-Coding 调用持续报错: z.ai 的 Lite 套餐几乎无法使用,官方 Pro/Max 是否稳定? 上海漕河泾内推,本组有 2 个 hc,一个后端,一个前端,预算都是 20k 左右,不打卡,氛围好 如果 V2EX 上有一组不永久保存聊天记录(比如只保存 7 天或者 24 小时)的聊天室,那么会开启哪些有用或者有趣的可能? gemini cli 貌似挂了,一直返回 403 第一次在自媒体上赚到钱 收集了最近在使用的低价 GPT, Gemini,邮箱等 AI 会员的小店合集 讨论个大实话:现在企业还在说 AI 编程提效 20%, 30%的,真的太落后,没用懂 AI。因为包括很多前沿公司,已经狂奔到提效 200%-500%的情况 [招聘][远程][币安] 前端/后端/QA/iOS/Android 至少 3 年以上经验 目前有大量 HC 欢迎投递 Chatgpt Pro 用量用不完的可以开这些设置 面试的时候好像遇到钓鱼了,给各位避个坑 cursor 年续费 22 号到期, 自动续费是否还是老的计次套餐呢 被两件破事毁掉的一下午,琐碎的内耗消磨人的精力 使用 Planet 存储 Codex 的会话或者重要信息 如果业务部门领导不要你开发功能,而是要求你教会它用 claude code 开发功能,你会怎么做? 分享一个 MacOS 接绿联 CM818 USB 转 DP 转接器使用感受 我的 HR 朋友 10 年老 Java ,非全大专,大家帮忙看看简历 开源了一个 AI 口语练习工具,音素级发音评分,完全免费可自部署 V2EX 上有哪些你觉得很有趣、印象深刻的妹纸? 字节为啥不出个国内版 Vercel? 有在大马的朋友吗? 问个运营商问题 你们在有领导的公司大群发过的最大胆的消息是什么 公司裁员,目前没有工作。想试试摆摊,做一个移动鲜啤打酒车 我的硬盘 Memblaze Pblaze 5 Linux 下不识别,给 Linux 内核提交了补丁, AI 说有望被合并 只有我一个人觉得 codex 不好用? 做了个 AI + 真人专家监督的广告投放平台 Auxora, 7 个品牌跑出 6x ROAS
分享一些处理大模型幻觉的心得
cxd8190102 · 2026-04-19 · via V2EX

上个月,我交给大模型几份报告,让它分析用户家庭符不符合签证办理条件,它只能给出前面男主人的分析结果,后面的女主人和儿子的情况完全被忘了。我想让大模型帮我填写一下签证申请表,结果它要么识别不了申请表的字段,要么就是填错了,根本没法用。

后面我研究了一下,简单来说就是,大模型在处理复杂表格时,对“值”的理解远优于对“结构/位置”的理解,这是其核心短板。如果你只是发给它一份方案、几份简历,那它的理解力确实不错,很快就能像讲故事一样把要点讲出来。但是,在工作中,我们遇到的文件往往没有这么简单,它们有不同的章节,不同的层级,还有不同的文件格式,互相嵌套。例如一份财务报告,就包含了 8 大章 24 节 68 小点,其中还有 32 张配图以及 10 张表格,如此复杂的文档,会加速破坏 AI 理解能力。

还有一个问题就是文章的篇幅。虽说现在大模型的上下文窗口,已经能容纳百万字的小说了,把《魔戒》三部曲放进去都不成问题,可“能容纳”跟“可理解”是两个问题。如今市面上大部分的模型,理解力都相当有限,篇幅一长,后面的内容它就读不进去了,或者读一半忘一半,这时候你让它写个人物小传,甚至问它一个事件评价,它的回答都是顾头不顾尾的。

所以,平时我让大模型给我填表的时候也是这样的,它能填对内容,但是容易填错位置,而且越长的表格,错误越多,填错一个位置,手动修改特别麻烦,不如人工填了。

而且,这种问题,还是“不分模型”的。市面上有名的模型我都尝试过,或多或少都存在这个问题,越是能力差的模型,到后面越明显。

https://imgur.com/a/Guu8GR2

问题说到这里,那该怎么解决呢?

指望大模型自己进化?那恐怕是指望不上了。识别结构和层级这种事情,跟大模型“Next Token Prediction”的底层范式不一致,无论怎么进化,大模型都是要从头到尾进行识别,而非基于结构层级。

使用传统软件解决方案?传统软件不够智能,成本对于小公司来说也太高了。而且,到目前我也没有找到特别合适的方案。

总不能回归人力手搓吧?

所以,我的解决方案就是,将计就计,根据大模型的这种特性,自己做了一个填表工具,去补齐它的短板。

思路是这样的:

首先,识别并拆分文档中的独立章节,然后分批将章节内容提交给大模型处理,避免大模型“理解力超载”。其次,填表工具会把“工作经历”、“学习经历”这种需要连续多行输入的区域给识别出来,并把它们跟其它部分拆开,避免大模型混淆。此外,填表工具还会根据用户画像(如基本信息等)自动判断哪些地方是需要填的,哪些地方不用填,提高干活的精确度。

以一张大约 200 个空格的用户信息表为例,有了工具的加持,现在大模型 1 分钟就填完了,比之前快了 5-6 倍,节省了大量的 Token ;准确率也达到 90%以上,秒杀单独使用大模型填表的时候。更不用说它还能识别不同类型的资料,省得我在不同的文档格式之间转来转去了。

大家觉得有用的话,可以试用一下: https://www.gosnapfill.cn/landing?utm_source=v2ex