惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

WordPress大学
WordPress大学
阮一峰的网络日志
阮一峰的网络日志
Jina AI
Jina AI
博客园 - Franky
U
Unit 42
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
宝玉的分享
宝玉的分享
B
Blog RSS Feed
雷峰网
雷峰网
D
DataBreaches.Net
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
I
InfoQ
美团技术团队
云风的 BLOG
云风的 BLOG
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
Martin Fowler
Martin Fowler
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
大猫的无限游戏
大猫的无限游戏
G
Google Developers Blog
T
Tailwind CSS Blog
P
Proofpoint News Feed
The GitHub Blog
The GitHub Blog
月光博客
月光博客
Engineering at Meta
Engineering at Meta

Java for You

《Java核心技术卷 2 高级特性》.PDF - Java for You - java4u 2.8万亿参数上云之后,Kimi K3的门槛变低了吗 - Java for You - java4u 平均延迟很快用户还在卡?用AIPerf看懂P99尾延迟 - Java for You - java4u AI越懂你越好吗?五天实验给出一个不舒服的答案 - Java for You - java4u Agent会互相调用了,但A2A 1.0真正解决的是协作边界 - Java for You - java4u AI写了80万行Rust,最值得学的却是它花十倍精力读代码 - Java for You - java4u 部署大模型别先选GPU,先回答你愿意承担多少运维 - Java for You - java4u 语音AI为什么总抢话?用VAD和打断机制做对实时对话 - Java for You - java4u AI每次提交都查漏洞,真正的升级是把证明链放进评审 - Java for You - java4u 把评测员请进AI实验室,独立性反而更难证明了 - Java for You - java4u 《深入分析Java Web技术内幕》.pdf - Java for You - java4u 《JAVA网络编程》.pdf - Java for You - java4u 《Java 工程师成神之路》.pdf - Java for You - java4u Copilot开始统计“真正用过什么”:AI落地终于不只看活跃人数 - Java for You - java4u 多Agent最怕的不是答错,而是崩溃后不知道做到哪一步 - Java for You - java4u Claude放宽生命科学限制:代价是验证、分级和30天留存 - Java for You - java4u Anthropic公开内部AI研发速度:真正该盯的是三个分母 - Java for You - java4u 4 bit模型为何不等于显存缩小四倍?量化账单这样算 - Java for You - java4u GPU抢不到就换一种:训练任务需要先声明可替代性 - Java for You - java4u Agent不是多想几步就能上线:用状态机管住自动行动 - Java for You - java4u 数据不能集中,算力也不统一:联邦学习终于面对运维现实 - Java for You - java4u OpenAI开始公开模型失配个案:真正重要的是这套报告制度 - Java for You - java4u 广告开始和你对话:Sponsored Agents改变的不是文案 - Java for You - java4u 语义相近却总找错资料?从Embedding看懂向量检索 - Java for You - java4u AI算力开始听电网指挥:比换GPU更现实的增产方法 - Java for You - java4u 票据抽取不一定要上最大模型:先看版式是否真的变化 - Java for You - java4u 临床AI别再只比像不像标准答案,先算医生少改了多少 - Java for You - java4u AI做长程科研,真正稀缺的不是更多Agent而是反证链 - Java for You - java4u AI代码审计最危险的不是漏报,而是团队开始不再相信它 - Java for You - java4u 100万Token不等于模型全记住:从KV Cache看懂长上下文成本 - Java for You - java4u
AI给面试打分不够,求职者更需要可核对的证据 - Java for You...
蜗牛 · 2026-09-20 · via Java for You

绿色代码雨

视频面试AI常给出一个分数,却说不清这个分数来自哪句话、哪次停顿或哪个画面。9月17日提交的E-AVI论文尝试把评分连接到带时间戳的文本、声音和视觉证据。它比“流利生成一段解释”更进一步,但距离可用于真实招聘的公平程序仍有很长一段路。

发生了什么

E-AVI先从视频、音频和转写中抽取结构化证据,每条包含模态、事件类型、起止时间和自然语言描述;随后,针对不同评分维度选择相关证据,并结合原始多模态嵌入给出分数。这个共享证据池还能生成反馈并回答追问,证据不足时会再次检查原视频。

研究使用公开RecruitView数据集和一个酒店业私有数据集。RecruitView含300多名参与者、2011段回答、76个问题与12维连续评分;私有数据来自中国南方三家酒店的101名一线员工。论文在参与者层面切分训练、验证和测试,避免同一人的视频泄漏到不同集合。

一手来源:arXiv摘要论文HTML全文。这是一篇预印本,尚不能视为经过同行评议或跨地区独立验证的招聘产品。

技术上,它把“解释”放进预测路径

很多系统先打分,再让语言模型编一段听起来合理的说明。这种事后解释可能与真实预测依据无关。E-AVI让证据进入评分器:每个评分维度都有查询向量,去关注证据条目与源级嵌入;训练还用弱监督规则鼓励“语速影响表达”“内容结构影响回答质量”等对应关系。

mermaid diagram

在RecruitView上,E-AVI把平均绝对误差从微调MiniCPM-o的0.641降至0.607,Spearman排序相关从0.440升到0.541;私有数据上的相关为0.639。论文也主动给出边界:私有测试集的提升只支持当前切分,不能证明换酒店、岗位或人群后仍稳定。

最值得看的是失败数据

两名标注者检查了50段视频中的870条证据:80.8%被认为完全受原始记录支持,12.1%部分支持或有过度概括,7.1%不受支持。文本证据的完全支持率89.5%,音频为74.8%,视频为77.4%。这意味着“显示证据”不自动等于证据可靠,特别是语气和行为解读更容易越界。

论文还检查了30个相对基线最困难的样本,其中25个问题与证据抽取错误或遗漏相关。删除高注意力证据比随机删除更伤排序性能,说明证据确实参与了预测;但源级嵌入仍贡献很大,所以可读证据并不是完整的因果解释。

一个真实风险是把“短暂停顿”解释为不自信。停顿可能来自网络、口音、思考习惯或无障碍需求。即使系统能标出12秒到14秒,时间戳只证明行为发生,不证明它该被转成能力分数。证据层解决了可检查性,却没有自动解决构念效度。

招聘团队还应把“证据完整”与“证据相关”分开。转写准确记录了一句话,只能说明系统没有听错;这句话是否与岗位胜任力有关,仍取决于经过验证的评分标准。否则系统可能非常忠实地放大一套不合理规则。

我的判断

高风险AI的解释标准不该是“能说理由”,而应是“理由能回到原始材料、能被质疑、能改变决定”。 E-AVI的重要贡献是把可核对证据做成中间表示;它暴露的问题同样重要:证据抽取仍是主要瓶颈,且评分还依赖人看不懂的源级表示。

招聘方如果采用类似系统,应把AI定位为结构化辅助,不是终局裁判。人类复核者要看到原片段、岗位相关评分规则和不确定性;求职者应能申诉错误转写、误判行为或无障碍因素。没有这些流程,所谓透明度可能只是把黑盒分数换成更有说服力的黑盒故事。

适用边界与风险

这项研究只覆盖有限数据集与预设评分维度,私有数据规模尤其小。教师模型生成了训练证据,比较的是完整系统,不是完全相同监督条件下的架构对照。跨语言、口音、肤色、神经多样性和设备质量的公平性并未被这组结果充分证明。

立即可执行的采购检查包括:要求供应商报告按人群分组的误差;随机抽取证据与原片段双人复核;禁止用表情、停顿等弱信号直接淘汰;保留人工推翻记录;给候选人数据更正与申诉入口;在每次模型更新后重跑岗位级验证。

如果面试AI给出低分,你认为求职者应有权看到原始片段、证据摘要,还是完整模型逻辑?

关注「蜗牛聊AI」,一起看懂技术变化背后的真正机会。


本文首发于 java4u.cn,转载请注明出处。