惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
V
Visual Studio Blog
IT之家
IT之家
博客园 - 聂微东
The Cloudflare Blog
月光博客
月光博客
阮一峰的网络日志
阮一峰的网络日志
S
SegmentFault 最新的问题
Apple Machine Learning Research
Apple Machine Learning Research
酷 壳 – CoolShell
酷 壳 – CoolShell
爱范儿
爱范儿
H
Help Net Security
博客园 - 叶小钗
V
V2EX
WordPress大学
WordPress大学
J
Java Code Geeks
Hugging Face - Blog
Hugging Face - Blog
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
博客园_首页
C
Check Point Blog
B
Blog
D
DataBreaches.Net
美团技术团队
罗磊的独立博客

LINUX DO - 最新话题

谷歌云盘下载700g数据集,求方法 OpenAI推出了100美元的Pro订阅后,plus的Codex 5小时限额大幅缩水 之前买的super grok居然还没掉 关于CPA认证文件周限 佬们,默认CDK的要求是什么等级啊? 最新版本的微信群聊机器人方案 有没有人知道如何free号没有封,那么是否可以循环使用,因为我看主要是周限 L站改版了?吓我一跳,我以为我浏览器崩了 淘宝这种宽带可信吗,500兆移动宽带月费8元到2099年 docker内部应用访问宿主机mysql和redis时被拒绝connection refuse Erp全栈想转行做Ai有什么推荐的吗 boost有bug 佬们,有没有靠谱点的 Plus 购买渠道 大妈,狗妈用的 lg 服务有源头开源项目吗? 有人有能过验证码打码的嘛 上次帖里好像发过通过大模型来打码的 gpt plus 封号似乎也太快了点,一天就给封号了 按流量/token收费的国产官方AI推荐 我算是知道了为什么Oracle总是ABC了 佬友们帮我分析一下 ChatGPT Team账号只有一个人使用和4个席位邀请满了使用的总额度是一样的吗? gpt-free 10个带rt CPA反代claude是默认1m吗? 我终于敢说我做出来windows上tmux的替代了,目标windows/全平台最强的终端Ai编程工具 claude pro升级max,除了原来的$20,好像还能再领一次$100 关于AI agent的知识框架 独乐乐不如众乐乐,分享一下我的的AI对话程序 佬们自建网站支付问题是怎么解决的 怎么能让gpt模仿claude风格输出 codex free已经死了,下一个会是plus或者team吗 请问chatgpt pro里的fast模式,速度快了,降智吗
自己vibe的研究内容小应用测试Minimax。opus评价M3不如M2.7。
milynn (Anan) · 2026-06-02 · via LINUX DO - 最新话题

**叠甲**:不评价minimax现在额度这块的消息,最终肯定会有个定论。:roll_eyes:

个人看法:跟之前一样minimax并不是很值得付费,仅能够当做龙虾玩具跑一些目标和流程比较具体小功能。

**裁判**:claude-opus-4.8 max

这次测试用的流程:

image

同一个问题使用这三个模型。。

image

首先耗时上,M3很慢。当然有可能是M3还没有highspeed模型。

image

然后是claude评判的结果。直接上对比总结表。

image

1. M3反直觉:最新的 M3 综合表现最差。 AI味重(57 分,两项高危),一个真实生成缺陷------第三章整章丢失、留了一句翻译模型的报错。。。而且耗时是高速档的 2.2 倍

文章开头的现状判断:四条主线的证据与边界是三篇里单段推理质量最高的。明确把已验证结论概念验证/预测分开。思考时间这么久这点优势没什么卵用。而且高质量内容并不稳定:开头还凑合,后半拉胯成模板套话。

2. M2.7 高速是综合最佳。 干净、连贯、数据扎实、AI 味最低(唯一通过硬闸门),至少这个流程上发挥还不错。整体偏保守。

3. M2.5 高速是最像真人专家的一篇。 TRL 路线图、具名武器系统、海面电磁传播物理、UNCLOS 法律维度------信息密度和专业纵深三篇里最高。代价是这种风格是幻觉高发区。。。

佬们。。虽然opus也被吐槽过4.7、4.8并没有比4.6强。。但这minimax搞了这么久吐出来的东西真的难顶。。

多模态,能读视频,能做音频口播什么的在这种模型能力下真的靠谱吗。。。:rofl:

xLilith (Lilith) 2

我这边体验上m3似乎是比m2.7懂多调用一点工具,m2.7很懒,就是m3现在对提示词的遵守似乎又有滑坡,开始怀念m2.5时代它比较听话了