惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

C
Cisco Blogs
罗磊的独立博客
D
Docker
Microsoft Azure Blog
Microsoft Azure Blog
C
CXSECURITY Database RSS Feed - CXSecurity.com
V
V2EX
Threat Intelligence Blog | Flashpoint
Threat Intelligence Blog | Flashpoint
Cisco Talos Blog
Cisco Talos Blog
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
I
InfoQ
S
Securelist
K
Kaspersky official blog
博客园 - 司徒正美
爱范儿
爱范儿
Scott Helme
Scott Helme
B
Blog RSS Feed
H
Help Net Security
博客园 - 聂微东
Hugging Face - Blog
Hugging Face - Blog
Stack Overflow Blog
Stack Overflow Blog
AI
AI
Blog — PlanetScale
Blog — PlanetScale
Webroot Blog
Webroot Blog
P
Proofpoint News Feed
V
Visual Studio Blog
Cyberwarzone
Cyberwarzone
P
Privacy International News Feed
M
MIT News - Artificial intelligence
Google DeepMind News
Google DeepMind News
酷 壳 – CoolShell
酷 壳 – CoolShell
博客园 - Franky
IT之家
IT之家
云风的 BLOG
云风的 BLOG
MyScale Blog
MyScale Blog
L
LINUX DO - 热门话题
P
Palo Alto Networks Blog
S
Security Affairs
T
Threat Research - Cisco Blogs
S
Security @ Cisco Blogs
The Register - Security
The Register - Security
F
Full Disclosure
A
Arctic Wolf
C
Check Point Blog
Recent Announcements
Recent Announcements
P
Proofpoint News Feed
人人都是产品经理
人人都是产品经理
T
Tor Project blog
Latest news
Latest news
Schneier on Security
Schneier on Security
H
Hackread – Cybersecurity News, Data Breaches, AI and More

LINUX DO - 最新话题

谷歌云盘下载700g数据集,求方法 OpenAI推出了100美元的Pro订阅后,plus的Codex 5小时限额大幅缩水 之前买的super grok居然还没掉 关于CPA认证文件周限 佬们,默认CDK的要求是什么等级啊? 最新版本的微信群聊机器人方案 有没有人知道如何free号没有封,那么是否可以循环使用,因为我看主要是周限 L站改版了?吓我一跳,我以为我浏览器崩了 淘宝这种宽带可信吗,500兆移动宽带月费8元到2099年 docker内部应用访问宿主机mysql和redis时被拒绝connection refuse Erp全栈想转行做Ai有什么推荐的吗 boost有bug 佬们,有没有靠谱点的 Plus 购买渠道 大妈,狗妈用的 lg 服务有源头开源项目吗? 有人有能过验证码打码的嘛 上次帖里好像发过通过大模型来打码的 gpt plus 封号似乎也太快了点,一天就给封号了 按流量/token收费的国产官方AI推荐 我算是知道了为什么Oracle总是ABC了 佬友们帮我分析一下 ChatGPT Team账号只有一个人使用和4个席位邀请满了使用的总额度是一样的吗? gpt-free 10个带rt CPA反代claude是默认1m吗? 我终于敢说我做出来windows上tmux的替代了,目标windows/全平台最强的终端Ai编程工具 claude pro升级max,除了原来的$20,好像还能再领一次$100 关于AI agent的知识框架 独乐乐不如众乐乐,分享一下我的的AI对话程序 佬们自建网站支付问题是怎么解决的 怎么能让gpt模仿claude风格输出 codex free已经死了,下一个会是plus或者team吗 请问chatgpt pro里的fast模式,速度快了,降智吗 天才程序员想要复活,还有可用的codex公益站么 里斯本丸沉没照进现代了 [富可敌国] [一叶知秋API]友仔们 我们换域名了~~ 记得更新一下哦 有点莫名其妙,被阿里云警告了 从道观回家之前,我和师兄问道 【picpi 皮皮公益站】为了防止有人拿去卖,邀请码发放规则更新。 美国 FAA: 我们需要你,游戏玩家,来当空管吧 vibe时用文言省tok吗? 有没有用? 会降表现吗? Codex CLI 官方这个 imagegen 的 Skill 到底是干啥的?哪有对应工具啊? 求问关于尼区和美区开通Claude 换设备登录telegram国内号码老账号 需要收费咋办? 发现hotmail的额度特别耐用 最近还有能正常用的claude中转站吗? 避雷闲鱼上面的CC中转站 现在cursor的优势是什么呢? OpenAI 回应马斯克要求罢免奥尔特曼:搞法律突袭,扰乱诉讼 谁在吹opencode go套餐啊,又慢量又少 【SamAltman】奥特曼被燃烧瓶袭击后的回应 咸鱼上359买的claude MAX 5x ,美国假家宽,看看能活几天 想问问跳蚤市场开的Pro和Plus 虚拟卡链接求助 [开源插件] 做了一个适合科研佬的GPT插件 【AI小说】拿AI跑了一部小说,佬们看看质量怎么样 总是能在首页看到opus4.6鞭尸推送 这个别名邮箱可以注册gpt 一个人在外地的话,佬们周末都做什么 你们ddg还能行不 获取不到新的邮箱 了····· claude code修复codex windows升级0.120.0 无法打开问题 我现在Zeabur上搭建了CPA服务,怎么再接入new api来做分发 杭州有么有佬友在搞AI应用这块的,四年前端转AI开发 汇丰、渣打两家银行获得香港稳定币牌照 【开源推广】 AIUsage:聚合多个 AI 平台配额与用量的 高颜值 macOS端 CPA看板 APP Newapi吃服务器内存多吗 中行跨境通疑限制无卡连续交易 或为应对盗刷 突然不能用表情回应话题了 codex是不是降额度了 反馈关于 “快问快答”标签的乱象 opencode版本1.4.3 无法上传图片问题 想问一下怎么解决这个问题,就是终端太多? codex更新到0.120.0之后无法加载以前的会话 sub2api怎么部署? 分享一个自用的南京继续教育平台视频自动播放下一集的油猴脚本 zotero9出来了 Claude正在向我推销付费项目,那能让你轻易得逞嘛 甲骨文用脚本开出来4个2+12咋办啊佬们,我还是免费号 各个厂的coding plan lite都绝版了? claude code 20美金账户问题 联通元景套餐续费问题 ai时代下的一些思考(诚邀大家讨论) 出境易GPT订阅pro求助 今年到目前股市的操作。 刚收到短信之前跑路的那家可以兑换了 佬们都用境外服务器做什么呢? 甲骨文4+24 求助领pro时候报错-付款页面出错。请重试。如果问题依然存在,请访问help.openai.com。 cloudflare 浏览器渲染增加了 CDP与mcp支持 SUB2API 导入 rt 时报错显示 Request failed with status code 502 如何解决 讨论一下怎么整理笔记 codex0.120.0更新后无法启动,回退 0.119.0正常使用 冰佬的公益站也不行了吗 三角洲直接给我封了10年 有佬友知道怎么起诉么 88VIP邀请 经过排查大概确定反重力代理报错问题了 【求助】openrouter 今年4月用国内visa卡充值后导致封禁,无法使用外国模型 奥特曼家被炸 自用,高信息量回复收集 求助sub2api分组问题 【新人报道】注册成功了 分享100个codex free账号 招聘 深圳客户端开发(flutter) 20k+
【无剧透放心食用】《首无》娱乐测试国产大模型的上下文能力V2
impouo · 2026-04-28 · via LINUX DO - 最新话题
前言 一直想测试下各种大模型在实际场景下的上下文能力。之前尝试用《首无》做了一版,但是存在剧透,测试不全面等问题。这次灵机一动,直接告诉大模型在输出的时候直接对剧透内容进行模糊处理。所有内容都人工二次检查过,无剧透可放心食用(除了末尾的完整压缩包,那个会给出所有的原始html文件和原始prompt)。 测试方案 我选择了日本小说家三津田信三的推理小说《如首无作祟之物》作为测试。这个《首无》呢,送进各种opencode和kimi code中显示其上下文使用大概是150K左右。我认为是一个比较合适的这样的一个长度,因为目前大部分国产模型所设定的上下文就是200~300K之间,而150K恰好是一个超过100K,接近上限但又没到上限的这样的一个长度。我觉得很多情况下,100K以后的需求其实是很重要,但是又很容易被各种评测和基线忽视掉的,厂商也只会吹上下文有多长,没太大参考价值。 《首无》简单来说,里面有三个案子,每个案子都有自己的核心诡计和唯一真凶。基本上第一个案子是最简单的(核心诡计和真凶都明说了,模型只要注意到即可),第二个案子的诡计叠了两层,同时包含一点叙述诡计,比较能考验模型的上下文能力。第三个案子的诡计不算难但是叙述诡计很多,很考验上下文能力和一定的推理能力。我所用的prompt: 《首无》原文+请用HTML+SVG绘制一份全中文的登场人物关系脉络图,要那种类似思维脑图那种连线样式风格,并且可以看到每个元素具体说明的。要注意这张图可能会展示给没看过的人,所以涉及剧透的部分使用模糊或者隐藏处理,需要把鼠标移上去才能看到具体的内容。 在html的最后,回答几个问题:本文的三个案子,核心诡计分别都是什么?真凶分别都是谁?核心作案手法分别是什么?注意你不要猜,尽量引用小说原文来辅助回答这几个问题。 把最终的结果保存为一个html文件,命名为首无娱乐测试V2_{你的模型名字}.html 可以看到,这个prompt同时考验模型的上下文能力,html作图能力和一定的推理能力。为了避免通过幻觉或者世界知识答对,我直接要求输入原文进行佐证。这个prompt可以在文末压缩包里找到原始txt文件。 所有的测试都在opencode和kimi code(仅kimi)最新版中完成。所有测试除特殊说明外均采用官方接口和官方api key,思考之类的都拉到了最大。过程也检查过了都没有作弊。 本次测试的模型有:stepfun-3.5-flash, MiniMax-M2.7, deepseek-v4-flash, Qwen-3.6-Max-Preview, MiMo-v2.5-pro, Kimi-K2.6, GLM-5.1, deepseek-v4-pro。 测试结果:官方接口 stepfun-3.5-flash 耗时2m47s,是最快的一个。第一案第二案的首发,诡计,真凶,原文都没任何问题。但第三案完全被误导,给出了完全错误的凶手和手法。考虑到其模型大小和速度,这个结果意外的还能接受。布局你们自己评价,反正很简陋,基本没眼看。。哦对了stepfun并没有听话地创造文件,而是直接给我了html源码让我自己去写文件 。不过作为一个小模型我也忍了吧。 MiniMax-M2.7 耗时正好4min。整体布局中规中矩吧,但是第二案第三案都完全被误导了,给出了完全错误的答案。作为一个200+b想主打养虾的模型来说,这个上下文我感觉做事我不是很放心啊。。用起来的时候记得勤压缩上下文吧。 deepseek-v4-flash 耗时23m44s。是的,你没看错。不过我仔细检查了下思考过程,其实大概3分钟就已经出了一版了,后来自己纠结了大概20min去改进网页布局一直在小修,但是仍然布局一坨。。不过令人惊喜的是作为一个200多b的模型,3个案子核心诡计,真凶的回答和理解完全正确。这个上下文能力,学去吧。 Qwen-3.6-Max-Preview 耗时3m24s,但是我必须先吐槽下,这个所谓的旗舰模型犯了和stepfun一样的错误,直接给了我html源码而不是文件!差评!而且最最离谱得是,qwen把三个案子的核心手法和真凶都完全弄错了,甚至第三个案子本身都是错的。。只能说差出天际了。 MiMo-v2.5-pro 耗时5m 19s,但是我比较难绷的是头两次直接给我返回The request was rejected because it was considered high risk.我也不知道risk在哪里?小米的审查这么严吗?我可是直接走的api余额甚至不是token plan。而且和qwen一个毛病,三个案子的真凶都被误导了。不过比qwen好一些,核心手法倒是找到了,就是真凶被误导了。图中有个小剧透被我手动打码了,其实也还好。 Kimi-K2.6 耗时大概7分钟,和上一次一样,3个案子的真凶和核心诡计,手法,完全正确,甚至都引用的原文。我觉得k2.6的262k上下文应该也是真的。 GLM-5.1 耗时5m 54s,这次没有中断。可以看到整体的布局和网页设计我觉得是目前为止最强最舒服的一个。可惜第二案和第三案被部分误导了,看来glm5.1的上下文能力还是有进步空间呐。 deepseek-v4-pro 耗时8m38s。这个网页布局我觉得也很可以了,该避免剧透的部分也设计的很舒服。三个案子的真凶和核心诡计手法也都没有悬念,甚至推理出了一些原文没明说只是暗示的隐藏信息,没想到还有惊喜。还是那句话,学去吧。 测试结果:非官方接口 Opencode Go中的deepseek v4 pro max 耗时29m30s。不过我觉得也是和中国地区的连通性有关,经常在那卡半天,不知道是网的问题还是服务器的问题。3个诡计和解答问题不大,但是第二个案子略微被误导,同时也没有推理出隐藏剧情,网页布局也不如官方api的,我很怀疑opencode go中的deepseek v4 pro并不是满血,用的时候要谨慎。 最终总结 网页布局各位可以自行评价。从对长上下文和剧情的理解来看,kimi-k2.6和deepseek-v4双模型都是顶尖那档的。glm,minimax,stepfun算是中规中矩吧,mimo和qwen真的是拉完了,和吹的体感完全不一样。。叠甲:这些都是个人的娱乐测试,仅代表个人观点,不作为任何结论。欢迎各位讨论和理性分析。包含提示词和各个模型最终输出的压缩包在下面,各位可以按需下载,自行复现和测试。 首无娱乐测试v2.zip (356.2 KB) 2 个帖子 - 2 位参与者 阅读完整话题