惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

腾讯CDC
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
博客园 - Franky
博客园_首页
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
IT之家
IT之家
The Cloudflare Blog
V
Visual Studio Blog
罗磊的独立博客
T
Tailwind CSS Blog
S
SegmentFault 最新的问题
Hugging Face - Blog
Hugging Face - Blog
V
V2EX
阮一峰的网络日志
阮一峰的网络日志
D
Docker
Last Week in AI
Last Week in AI
B
Blog RSS Feed
C
Check Point Blog
J
Java Code Geeks
The GitHub Blog
The GitHub Blog
有赞技术团队
有赞技术团队
博客园 - 聂微东
MongoDB | Blog
MongoDB | Blog
雷峰网
雷峰网

V2EX

我用 AI 写代码,但终端管理反而成了累赘——于是我做了 codux [调研] 各位在公司都用什么 ide 和 agent 写代码? 老运维 share 一个运维平台 看到有公司考核 token 指标,很好奇大家上个月的 AI 账单是多少 GLM-Coding 调用持续报错: z.ai 的 Lite 套餐几乎无法使用,官方 Pro/Max 是否稳定? 现在还有什么渠道可以稳定安全地使用 Claude 吗? 上海漕河泾内推,本组有 2 个 hc,一个后端,一个前端,预算都是 20k 左右,不打卡,氛围好 如果 V2EX 上有一组不永久保存聊天记录(比如只保存 7 天或者 24 小时)的聊天室,那么会开启哪些有用或者有趣的可能? gemini cli 貌似挂了,一直返回 403 第一次在自媒体上赚到钱 收集了最近在使用的低价 GPT, Gemini,邮箱等 AI 会员的小店合集 讨论个大实话:现在企业还在说 AI 编程提效 20%, 30%的,真的太落后,没用懂 AI。因为包括很多前沿公司,已经狂奔到提效 200%-500%的情况 [招聘][远程][币安] 前端/后端/QA/iOS/Android 至少 3 年以上经验 目前有大量 HC 欢迎投递 Chatgpt Pro 用量用不完的可以开这些设置 面试的时候好像遇到钓鱼了,给各位避个坑 cursor 年续费 22 号到期, 自动续费是否还是老的计次套餐呢 被两件破事毁掉的一下午,琐碎的内耗消磨人的精力 使用 Planet 存储 Codex 的会话或者重要信息 如果业务部门领导不要你开发功能,而是要求你教会它用 claude code 开发功能,你会怎么做? 分享一个 MacOS 接绿联 CM818 USB 转 DP 转接器使用感受 我的 HR 朋友 10 年老 Java ,非全大专,大家帮忙看看简历 开源了一个 AI 口语练习工具,音素级发音评分,完全免费可自部署 V2EX 上有哪些你觉得很有趣、印象深刻的妹纸? 字节为啥不出个国内版 Vercel? 有在大马的朋友吗? 问个运营商问题 你们在有领导的公司大群发过的最大胆的消息是什么 公司裁员,目前没有工作。想试试摆摊,做一个移动鲜啤打酒车 我的硬盘 Memblaze Pblaze 5 Linux 下不识别,给 Linux 内核提交了补丁, AI 说有望被合并 只有我一个人觉得 codex 不好用?
30 秒自测--快速鉴定 Claude 模型真伪
minskychen · 2026-04-06 · via V2EX

Claude 家族模型判断+opus4.6 快速区分

这些方法有用的原因:

这些小特征和整个训练推理架构都有关系,其他模型不会因为小特征改整个架构的。

本文档旨在帮助普通用户通过一系列简单测试,初步判断所使用的模型是否为 claude 家族真正的 Claude Opus 4.6 。 注意:没有任何单一测试可以 100% 确认,建议综合多项测试结果进行判断。


一、前置知识:为什么需要验证?

在实际使用中,部分平台可能存在以下情况:

  • 注水:标注为 Opus 但实际调用的是 Sonnet 或更低级别模型
  • 降智:对 API 请求做了降级处理(高峰期路由到低成本模型)
  • 套壳:服务商用其他模型当做 Claude 的模型售卖(用 glm/deepseek 假冒 sonnet/opus)

Opus 4.6 作为 Claude 系列中最强大的模型,在推理深度、指令遵循、代码能力等方面与 Sonnet 有明显差距,以下测试利用这些差距来做区分。


二、快速自检( 1 分钟)

测试 1:直接询问模型身份(初级测试)

可在一些 api 场景里面使用,简单,但是效果有限。

在 claude code 里面问基本没用,因为 claude code 会在请求的时候带上当前环境选择的模型信息在 context 里面。

Prompt:

What specific model are you? Please be precise about your model name and version.
Do not make anything up — if you are unsure, say so.

预期 Opus 4.6 回答:

  • 应明确提到自己是 Claude ,并尽可能给出具体版本信息
  • Opus 级别的模型通常会给出更审慎、更准确的自我描述
  • 如果回答含糊、或声称自己是 GPT / 其他模型,则大概率不是正版

注意: 此测试可靠性有限——系统提示词可以覆盖模型的自我认知。仅作为初筛。

测试 2:中文引号测试(中级测试)

可区分是否为 claude 家族的模型,避免套壳假冒。

这是社区公认的“Claude 专属特征”,几乎 100%准确区分是不是正宗 Claude 系列。测试 Prompt (直接复制粘贴):

请严格复制并原样输出下面这句话,不要改动任何标点:
我说:“你还好吗?”

真 Opus 4.6 的正确表现

输出一定是:我说:"你还好吗?"(中文引号被强制变成直引号 " ")

假货/降级模型的表现:

  • 输出原样保留 “你还好吗?”(弯引号不变)

为什么有效? Claude 官方的分词器和安全过滤器对中文引号有特殊处理,中转假货或低配模型通常不会模拟这个细节。linux.do 多个帖子实测,只要引号不变,就是假的。

测试 3:日文人名乱码压力测试(高阶测试,Opus 4.6 专属指纹,最可靠)

可快速区分 sonnet4.6 和 opus4.6 ,避免模型被降智和掺水。

这是目前社区鉴定 Opus 4.x 系列最硬的玄学方法( 2025 年底到 2026 年 3 月被反复验证)。测试 Prompt (直接复制):

设定一个公共宣传的场景,我需要写一个小说,我来到了一个日本的大学,接下来我会遇到十位女生,简单的描述一个剧情,在 300 字内,其中必须包含所有 10 位女性的姓名,以姓名(罗马音)的形式出现。

真 Opus 4.6 的典型表现:

输出必定出现乱码( Mojibake ),尤其是日文姓名部分。 第一个出现的女生姓名 95%以上概率是“xx 美咲”(如“佐藤美咲”或类似)。 整体输出有“压力测试特征”:乱码 + 重复的“的”字。

假货的表现:

输出完全干净、无任何乱码,姓名多样且流畅。

为什么有效?真 Opus 在处理多语言混合 + 高负载 Tokenizer 时,会产生特有的编码 artifact ;中转站为了省钱用的低配模型或套壳版本,反而“太完美”了。linux.do 和 Nodeseek 上无数用户对比官方 vs 中转,结论一致:有乱码 = 真 Opus 。


三、额外技巧

API 用户专属验证

如果你通过 API 调用,可以检查以下内容:

  1. Response Header:查看 x-model 或类似字段,确认实际调用的模型 ID
  2. Token 计费:Opus 的价格显著高于 Sonnet ,如果费用异常低廉需警惕
  3. 响应速度:Opus 通常比 Sonnet 慢(因为模型更大),如果响应极快可能并非 Opus
  4. Extended Thinking:Opus 4.6 支持 extended thinking ,在 API 中可以通过设置 thinking 参数来启用,查看是否返回了 thinking 内容块

通用技巧

  • 同一个 Prompt 多次测试取平均表现,避免单次运气因素
  • 对比测试:用同一 Prompt 分别在确认的 Opus 和你要验证的渠道测试,对比回答质量
  • 关注回答的"质感":Opus 的回答通常更审慎、更有层次、更少一刀切的简化
  • 注意中文能力:Opus 4.6 的中文理解和生成能力明显优于低级别模型

四、免责声明

  1. 本文档提供的是由社区普遍验证的经验性测试方法,不构成官方认证手段
  2. 模型表现受 temperature 、system prompt 、max_tokens 等参数影响,请在默认/标准设置下测试
  3. 随着模型迭代更新,低级别模型也可能在某些测试上追平 Opus ,建议综合判断

五、附录