← AI行业风向

模型与Agent能力评测与排行榜之争

模型与智能体能力评测进入密集迭代期,各类基准与排行榜快速更新。Grok 4.5在多项评测中表现突出,GPT-5.6 Sol登顶物理研究基准CritPt。同时,对基准有效性的质疑增多,OpenAI审计发现SWE-Bench Pro约三成任务存在缺陷,已撤回推荐。模型个性与策略开始出现显著分化,评测焦点从静态得分转向长任务、真实工作能力检验,但基准是否衡量真智能、静态数据集局限等争论持续
7月18日
Fable 5 在 RLI 基准中达成 16.1% 自动化率,较八个月前提升六倍
Remote Labor Index(RLI)衡量 AI 智能体完成 240 个付费自由职业项目(总值 14.4 万美元)的专业质量比例。
7月17日
DAA:智能体时代的核心指标
这里快速补充一个指标新词:DAA。 全称 Daily Active Agents(每日活跃智能体),相当于智能体时代的 DAU。
7月12日
Grok 4.5 被独立研究评为最政治中立 AI 模型
Elon Musk 发推称 Grok 是"最政治中立、最客观求真"的 AI。
7月12日
GPT 5.6 sol 驱动的模型 PK 擂台上线
开发者用 GPT 5.6 sol 构建了一个在线模型评测对比工具"模型PK擂台",支持一键对比不同模型的文本输出和前端网页样式等简单任务。
7月11日
Grok 4.5 评测发布,性能表现引关注
Grok 4.5 评测
7月11日
GPT 5.6 Sol Ultra与Fable XHigh应用对比实测
我让新的 GPT 5.6 Sol Ultra 和 Fable XHigh"创建一个应用,用于比较不同时间段内增长最快的股票"。 以下是结果。
7月10日
实验室应发布新模型易对比视图
实验室应该推出一些易于查看的新模型对比:向我们展示 Luna xHigh、Terra Medium 和 Sol Low(或类似 Haiku、Sonnet…
7月10日
主流模型个性与策略首次显著分化
主流模型的个性与策略首次出现显著分化,且随着任务时间跨度拉长,这些判断与处理方式的差异会被放大。你真的需要为自己或公司亲自测试这些模型
7月10日
Grok-4.5 在实测中领先 OpenAI 新模型
Grok 正在闭环真实世界用例
7月10日
Grok 4.5 免费版在三个浏览器物理演示中达到 GPT-5.6 Sol 水平
在 atomic_chat 桌面应用中,Grok 4.5 免费版在机器人对战、液压机压碎和卡车跳峡谷三个浏览器物理演示中达到 GPT-5.6 Sol 水…
7月10日
Gemini在DeepSWE评测中表现惨淡
看DeepSWE评测,Gemini是真的惨。 谷歌到底出了啥问题
7月10日
GPT-5.6 编排与验证能力惊人出色
好吧,这对我来说现在是大获全胜。 惊讶于 GPT-5.6 在验证/建议以及所有高级编排能力方面表现得如此出色
7月10日
GPT-5.6 Sol 登顶物理研究基准 CritPt
GPT-5.6 Sol (max) 在 CritPt 基准测试中成为新领先者,该基准测试的是未发表的研究级物理问题。
7月10日
Eric Mitchell 谈 Goblinbench 讨论不足
没有发布是没有退步的。 看到时间线上对 Goblinbench 的讨论不足
7月9日
开始正式评测 Grok 4.5 ,让它开发一个大模型评测Case网站。 目前看,Skill调用准确率不错,看网站开发出来怎么样
开始正式评测 Grok 4.5 ,让它开发一个大模型评测Case网站。 目前看,Skill调用准确率不错,看网站开发出来怎么样
7月9日
SpaceXAI仅3年,Grok 4.5多项基准第一
真不敢相信SpaceXAI才成立3年。 Grok 4.5已经在多项基准测试中超越那些开发AI多年的公司,位居第一。
7月9日
OpenAI审计:SWE-Bench Pro约30%任务有缺陷
OpenAI审计SWE-Bench Pro,发现约30%任务存在致命缺陷,撤回此前对该基准的推荐。
7月9日
OpenAI 指摘 SWE-Bench Pro 约 30% 任务存在缺陷,撤回采用建议
OpenAI 在 7 月 8 日博文中称,Scale AI 的编程评测基准 SWE-Bench Pro 约 30% 任务存在缺陷,
7月9日
OpenAI 发现约 30% 的热门 AI 编码测试任务有缺陷
OpenAI 审查 SWE-Bench Pro 后发现约 30% 的任务存在缺陷,已撤回支持。
7月9日
Grok与Opus对比,百万上下文窗口将至
Grok 与 Opus 的有趣对比 1M+ 上下文窗口即将推出
7月9日
Grok 4.5 在 SWE 马拉松排名第一
Grok 4.5 也在 SWE 马拉松中排名第一
7月9日
AI 大模型周榜:claude-fable-5 蝉联榜首,国产模型稳定中上游
Arena 公布 6 月 29 日-7 月 5 日大模型周榜。
7月8日
智谱GLM-5.2 Epoch指数152,开源最高
3 Pro等模型,后者已发布超过7个月
7月8日
对比一下 GPT-5.5 的设计效果和 Opus 4.8 的设计效果
宝玉对比了GPT-5.5与Opus 4.8的设计能力,认为Opus 4.8效果远优于GPT-5.5。
7月8日
OpenCode开源模型统计:deepseek-v4-flash惊喜
OpenCode上开源模型的使用情况有不错的统计数据。
7月8日
GPT-4霸榜Epoch指数352天
OpenAI的GPT-4在2023年3月发布后,引领Epoch能力指数长达352天,远超此后任何模型。 第二长的领先属于OpenAI的o1,为98天
7月8日
Epoch能力指数方法更新精度提升
Epoch能力指数现在置信区间略微更紧密,得益于我们用于计算它们的方法更新
7月8日
Artificial Analysis 发布 Controlled Voice Arena 排行榜
Artificial Analysis 推出 Controlled Voice Arena,通过声音克隆标准化评估文本转语音模型。
7月7日
文本退化:多数基准测试未追踪的生产故障模式
Dharma-AI在Hugging Face发布博文指出,当前大语言模型在生产环境中普遍存在"文本退化"现象,表现为输出内容重复、不连贯或逻辑混乱。
7月7日
开源模型LongCat-2.0在Duck Hunt编程测试中与GPT-5.5表现相当,成本为零
开源模型LongCat-2.0在Duck Hunt游戏编程测试中与GPT-5.5表现相当,但成本为零。
7月7日
Stanford、NVIDIA与UC Berkeley提出无需训练的连续校准验证器
Stanford、NVIDIA和UC Berkeley构建了无需训练的验证器,直接从评分token的logits读取连续校准分数,取代离散等级。
7月7日
MiniMax M3 与 Kimi 模型挑战世界杯预测
Kilo's WorldCupBench 测试了 MiniMax 与 Kimi 的开放权重模型对世界杯结果的预测能力。
7月7日
Artificial Analysis 发布 AA-Briefcase 智能体知识工作基准测试
Artificial Analysis 发布 AA-Briefcase 基准测试,测试模型在多周项目语境下生成财务模型、董事会演示等交付物。
7月6日
科研人员:训练5e27 GPU小时,评估1e-2小时
研究人员在模型训练上花费了5e27 GPU小时 而在评估上只花了1e-2小时
7月6日
用Fable探索能力边界要有更大野心
我基本上可以保证,你分配给Fable的任务还不够有野心。 开始要求最大可能的事情,以探索它能力的最远边界。
7月6日
基准测试应报告效率分数
将基准测试结果报告为标量数字,例如"XYZ 上 75%",目前完全无意义。你应该总是报告效率分数,例如"每任务成本 $10 下 75%"
7月6日
Snowflake CEO 实测:GLM-5.2 与 Opus 4.7 编程能力接近,成本仅为几分之一
Snowflake 内部基准测试显示,在每项任务三次尝试下,GLM-5.2 解决 66% 的编程问题,
7月6日
OpenAI 发布最权威基准测试
我的 OpenAI 哥们刚刚发布了最权威的基准测试
7月5日
DiscoBench:腾讯混元和清华联合推出的AI搜索智能体模糊查询基准
DiscoBench由腾讯混元与清华大学开发,测试AI搜索智能体在模糊查询时是否主动向用户澄清。基准包含211个任务、463个歧义点,涵盖四种歧义类型。
7月5日
CAIS与Scale发布RLI新结果:Fable 5自动化16.1%远程工作项目
CAIS和Scale发布Remote Labor Index新结果:Fable 5可自动化16.1%的真实远程工作项目(约2倍于Opus 4.8的8.3…
7月3日
英国 AI 安全研究所:标准基准测试系统性低估 AI 智能体能力
英国 AI 安全研究所(AISI)研究显示,标准基准测试在计算预算有限时会低估 AI 智能体真实能力。
7月3日
字节跳动Seed发布EdgeBench基准
字节跳动Seed推出EdgeBench基准,专门测试AI智能体在12-72小时长时间任务中的学习能力。
7月3日
PerceptionRubrics 校准多模态评估至人类感知
PerceptionRubrics 校准多模态评估至人类感知
7月3日
Fable 5 仅回退少量编码任务至 Opus 4.8
Testing Catalog 引用 @trq212 澄清更新后的分类器:并非所有编码任务都会从 Fable 5 路由到 Opus 4.8,
7月2日
Fable恢复后早先安全护栏待观察
Fable非常棒,在获得早期访问后又被拿走,导致我手头的一些工作延迟,并让我推迟了其他工作直到它恢复。
7月2日
EBR-bench:即时学习能力基准测试
介绍 EBR-bench,我们用于衡量即时学习的新基准。
7月1日
GLM-5.2/Fugu Ultra/Fable 5 同提示对比
谁做得最好? GLM-5.2(左)| Fugu Ultra(中)| Fable 5(右) 同样的一次性提示。 最后那个是我的最爱!
7月1日
Fable早期访问印象:长难任务出色
自从它回归以来,这里是我几周前作为早期访问用户使用Fable后的印象(是的,它确实非常令人印象深刻,但在更长、更困难的任务中表现最佳)
7月1日
Fable-5 RLI得分16.10%,GPT-5.6下周发布传闻
Fable-5在Remote Labor Index(RLI)取得16.10%分数,领跑公开排行榜。
7月1日
Epoch AI新增13项评测基准,7项纳入ECI
我们最近开始在评测中枢跟踪13项新基准。其中7项已被纳入Epoch能力指数(ECI)
6月30日
Qwen3.7-Max 登顶 OpenRouter 热门大模型榜
Qwen3.7-Max 以 77.3B tokens 的使用量登顶 @OpenRouter 热门大语言模型榜单。 而我们才刚刚开始。
6月29日
LLM-as-a-Judge 10分钟快速入门
LLM-as-a-Judge 在约10分钟内解释完毕。 学会构建AI验证器和裁判是当今最重要的新兴AI技能之一。
6月29日
Arena AI排行榜年营收达1亿美元
Arena 的 AI 排行榜从 UC Berkeley 研究项目起步,通过让用户匿名对比两个模型答案并投票,积累了大规模人类偏好数据集。
6月29日
AA-Briefcase评估揭示开放模型差距
根据@ArtificialAnlys的AA-Briefcase评估(让AI执行多周咨询任务),@emollick绘制了开放与封闭模型的前沿曲线,
6月28日
PlanBench-XL:评估LLM智能体在大规模工具生态中的长程规划能力
论文提出PlanBench-XL基准,包含327个任务和1,665个工具,测试LLM智能体在工具难以发现时完成长程工具使用任务的能力。
6月27日
OpenRouter 基准探索器:10项帕累托曲线
使用我们的基准探索器,为10个不同基准绘制帕累托曲线。
6月26日
MirrorCode:AI软件工程能力达数周
AI能执行的最大软件工程任务是什么? 为此,我们构建了MirrorCode,一个长期SWE基准测试,允许AI一次自主编程数天。
6月26日
静态基准测记忆而非智能
如果你的基准测试依赖于静态数据集或从训练时已知的静态分布中采样,那么它本质上衡量的是记忆/检索。
6月26日
Epoch AI 与 METR 发布 MirrorCode 基准:AI 模型需从头重新实现完整程序
Epoch AI 与 METR 发布新基准 MirrorCode,要求 AI 模型在无源程序代码的情况下从头重新实现完整程序。
6月24日
开源模型创ARC-AGI-2最强成绩
这是迄今为止开源模型在ARC-AGI-2上取得的最强表现
6月24日
GLM再添胜绩,开源模型仍有短板
为GLM再添胜绩。该模型有一些脆弱的特性,在这方面被闭源模型压制,但我们应该预期开源模型更加参差不齐,你可以根据任务使用多个模型。
6月22日
HAKARI-Bench:统一条件下比较检索架构与效率设置的轻量级基准
HAKARI-Bench 是一个轻量级检索基准,将现有检索套件重建为小型数据集(Nano-sets),
6月16日
伯克利RDI发布Agents' Last Exam基准
2026年6月,伯克利RDI发布Agents' Last Exam(ALE)基准,包含1,500余项源于真实工作的任务,覆盖55个非体力职业。
6月8日
精确性不等于忠实度:完整Oracle下的覆盖感知接地生成评估
无参考忠实度度量仅衡量精确率(陈述是否被支持),鼓励模型少说甚至不说以获得高分。
6月7日
别只看基准测试,要看全面表现
不要只依赖基准测试;要看全面情况! 试试我们的新比较页面,
6月5日
腾讯混元联合人大开源PlanningBench评估框架
腾讯混元(Tencent Hunyuan)与中国人民大学高瓴人工智能学院合作,
6月4日
EVA-Bench Data 2.0 发布:覆盖三大领域、121 个工具、213 个场景
EVA-Bench Data 2.0 将评估范围从单一企业领域扩展至航空公司客户服务管理(CSM)、企业 IT 服务管理(ITSM)和医疗 HR 服务交…
5月31日
定位何处:基础模型能否通过主动探索达到目标视角
研究提出目标视角复现任务(TVR)与模拟基准TVRBench,评估基础模型在3D环境中主动调整视角以匹配目标图像的能力。
5月31日
ChartArena:跨语言、场景与格式的图表解析基准测试
ChartArena 是一个旨在系统评估图表解析模型的双语基准测试。
5月22日
图灵测试 76 年后首现 AI 通过实证:GPT-4.5 以 73% 判定率超越真人
加州大学圣地亚哥分校研究首次实证现代AI可通过图灵测试。
5月20日
SpecBench:测量长期编码代理中的奖励黑客行为
长期编码代理在优化测试通过时可能偏离用户真实目标,导致奖励黑客现象。
5月19日
开源古代汉字视觉感知评估基准Chronicles-OCR
开源了评估视觉大语言模型(VLLM)对古代汉字视觉感知能力的基准测试Chronicles-OCR。