AI 快讯列表

AI 快讯列表关于 基准测试

时间 详情
2026-07-25
04:41
BenchBenchBench揭示AI基准元分析

据emollick称,Codex生成BBBBB,用于验证AI编写的度量一致性套件。

2026-07-24
17:47
Claude Opus 5 突破半价胜对手

据TheRundownAI称,Anthropic推Claude Opus 5,性能超4.8并优于Fable,且价格减半。

2026-07-17
09:18
Moonshot Kimi K3刷新多项基准仍落后

据@CNBC称,Kimi K3在部分基准胜过OpenAI与Anthropic,但总体仍落后。

2026-07-16
22:46
GPT5.6 Sol Pro横扫prinzbench 91分

据gdb称,GPT5.6 Sol Pro在prinzbench得分91/99,基准已饱和。

2026-06-26
22:15
智谱AI逼近Anthropic与OpenAI

据CNBC称,智谱GLM凭开源与政策红利追赶美系模型,商业化与融资加速。

2026-06-17
01:26
GLM5.2 Max对决Fable诗歌表现

据emollick称,GLM5.2擅长约束合规,Fable以主题化消失元音取胜。

2026-06-16
17:23
OpenAI评测改革引领新基准

据OpenAI于X称,将改进评测以预测模型进展并应对基准饱和与投机。

2026-06-15
15:44
Claude3.5横扫新基准榜单

据God of Prompt称,Anthropic在新基准上领先,显示Claude3.5推理评测优势。

2026-06-11
17:35
Claude3深度解析柯勒律治续写挑战

据emollick称,Claude续写古舟子思考10分钟,链式推理复杂但偏直白。

2026-06-11
14:17
Hugging Face重启Papers With Code数据集

据KyeGomezB称,Hugging Face收购域名与数据集,平台回归可用于基准与检索。

2026-06-10
12:54
Project Tapestry联结开放AI研究

据@ylecun称,该计划号召研究者共建开放基准与工具。

2026-06-09
18:10
Claude Fable5 领跑基准大跃升

据karpathy称,Fable5在多项基准SOTA,长时复杂任务表现出色,并基于Mythos加入更强安全防护。

2026-06-09
18:10
Claude Fable 5拿下SOTA基准

据karpathy称,Fable 5在多项基准达SOTA,并在长时复杂任务上大幅领先。

2026-05-30
23:34
OpenAI与Anthropic加速模型突破

据@emollick称,两家公司模型多次在Artificial Analysis指数提升3分以上。

2026-05-20
18:27
机器人基准月球漫步测试受挫

据TheRundownAI称,该月球漫步基准仍在开发中。

2026-05-19
17:59
Gemini 3.5 Flash极速突破

据sundarpichai称,新模型上线且较前沿模型快4倍,并超越3.1 Pro基准。

2026-05-19
17:53
Gemini 3.5 Flash 重磅超越3.1 Pro

据@OriolVinyalsML称,3.5 Flash更快更强,基准大多胜过3.1 Pro。

2026-05-09
01:32
Claude Mythos评估达16小时窗口

据@emollick称,METR评估Claude Mythos任务中位时长16小时,处于可测上限。

2026-05-05
23:10
GPQA基准显示GPT 5.5 Instant跃升

据emollick称,OpenAI免费GPT 5.5 Instant在GPQA达晚2025付费水平。

2026-05-03
22:10
人工分析指数引发2026争议

据emollick称AA指数不适合趋势;chatgpt21保守推演GPT至2029年达90分。