惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Engineering at Meta
Engineering at Meta
J
Java Code Geeks
I
InfoQ
腾讯CDC
Vercel News
Vercel News
IT之家
IT之家
V
Visual Studio Blog
P
Proofpoint News Feed
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
G
Google Developers Blog
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
博客园 - 叶小钗
有赞技术团队
有赞技术团队
月光博客
月光博客
Martin Fowler
Martin Fowler
量子位
L
LangChain Blog
B
Blog
Last Week in AI
Last Week in AI
博客园 - 司徒正美
Microsoft Security Blog
Microsoft Security Blog
博客园 - 聂微东
Microsoft Azure Blog
Microsoft Azure Blog
A
About on SuperTechFans

LINUX DO - 最新话题

谷歌云盘下载700g数据集,求方法 OpenAI推出了100美元的Pro订阅后,plus的Codex 5小时限额大幅缩水 之前买的super grok居然还没掉 关于CPA认证文件周限 佬们,默认CDK的要求是什么等级啊? 最新版本的微信群聊机器人方案 有没有人知道如何free号没有封,那么是否可以循环使用,因为我看主要是周限 L站改版了?吓我一跳,我以为我浏览器崩了 淘宝这种宽带可信吗,500兆移动宽带月费8元到2099年 docker内部应用访问宿主机mysql和redis时被拒绝connection refuse Erp全栈想转行做Ai有什么推荐的吗 boost有bug 佬们,有没有靠谱点的 Plus 购买渠道 大妈,狗妈用的 lg 服务有源头开源项目吗? 有人有能过验证码打码的嘛 上次帖里好像发过通过大模型来打码的 gpt plus 封号似乎也太快了点,一天就给封号了 按流量/token收费的国产官方AI推荐 我算是知道了为什么Oracle总是ABC了 佬友们帮我分析一下 ChatGPT Team账号只有一个人使用和4个席位邀请满了使用的总额度是一样的吗? gpt-free 10个带rt CPA反代claude是默认1m吗? 我终于敢说我做出来windows上tmux的替代了,目标windows/全平台最强的终端Ai编程工具 claude pro升级max,除了原来的$20,好像还能再领一次$100 关于AI agent的知识框架 独乐乐不如众乐乐,分享一下我的的AI对话程序 佬们自建网站支付问题是怎么解决的 怎么能让gpt模仿claude风格输出 codex free已经死了,下一个会是plus或者team吗 请问chatgpt pro里的fast模式,速度快了,降智吗
『LDML主贴』用于讨论评价大模型能力的排行榜网站!!
markskz (马克MkSaMa) · 2026-05-27 · via LINUX DO - 最新话题

关于 LDML

LDML 全称 Linux Do Model Leaderboard 是一个大模型主观排行榜,能够得到大模型使用者最真实的反馈,而不是冷冰冰的评测数字。

  • 纯公益网站: 本站不会收到任何收益,保证每个大模型的评价都是最真实可信的
  • 信息集中: 所有人对于同一个大模型的评价都直接展现在你的眼前
  • 持续维护: 每天都会尽快上新最新的模型信息,并发布帖子邀请大家来参与讨论
  • 信息真实: 会随时检查所有的投票情况,针对不合理投票和不理智言论会进行清除

如何访问

本站目前的域名为 https://ld-ml.cn
使用说明公告:使用说明

实际网站由cloudflare+家里云搭建而成,如果出现无法访问的情况,请及时向我反馈,我会以最快速度回应并解决问题。

支持 LDML

本站虽是主观排行榜,但是为了保证结果的可靠性,需要足够多的数据来支持,希望大家多多投票多多评论,助力排行榜的建设。

同时如果大家愿意给 LDML的github项目 点个star,就太感谢各位了。

Q&A

Q: 会不会出现乱评分的情况
A: 我们欢迎佬友登录我们网站来互动交流,但是针对不合理投票我们会进行检查并清除这些无意义数据

Q: 网站会提供模型测试功能吗
A: 由于成本问题,我无法接出模型让大家测试,这里推荐大家上Chat with Multiple Frontier AI Models 网站自行测试

Q: 我并不清楚模型在这些维度上的情况如何怎么办
A: 我们不逼迫用户填写每个模型或者每个维度,你只需要对你熟悉的模型和维度进行评分和评论即可

Q: 有新的更好的模型了,旧的评分需要降低吗
A: 需要,用户填写的是当下对于这个模型的评价,实际计算会根据时间的长度来改变权重,越久的评分权重越低。所以用户需要更新以前的评分来保证自己评分的时效性,否则自己的评分会逐渐失效

先写这么多,后续有新的信息会继续更新

纯靠用户主管打分吗? :hushed_face:
不过也没毛病 毕竟是主观排行榜

PixPin2026-05-2718-31-01

这个是不是有点过于主观了()不同人的需求和执行方式都有差异,很多时候是人的智力限制了大模型使用方式真实的任务没有那么高复杂度。

太主观了,多人多面,有的人可能使用AI并不参与代码生成,可能对某一项没概念,但在主观意识上可能会取其中,评分主观性太大了,纯想哪个点哪个,而且某ai便宜,对于某ai支持率可能也比较高,

其实解决方法是,几天出一次多轮、难度面大,复杂型的题,附题和答案,然后在网站上放效果,让用户盲投票,这样比较公正,专业

ldnazk (ldnazk) 5

感觉这样的话和竞技场的排行榜性质一样了(不过楼主也说了,是讨论评价)

markskz (马克MkSaMa) 6

纯主观其实问题并不是很大,从侧面反映的其实就是模型的支持率,不过你的方案不错,可以作为附加活动来开展,同时记录

Kasidia (繁星之子卡萨蒂亚) 7

福建地区 链接 closed 无法打开

markskz (马克MkSaMa) 8

大概率是cloudflare抽风了,我刚刚ping了一圈没看到问题,你再试试?