AI 快讯列表关于 基准测试
| 时间 | 详情 |
|---|---|
|
2026-07-25 04:41 |
BenchBenchBench揭示AI基准元分析
据emollick称,Codex生成BBBBB,用于验证AI编写的度量一致性套件。 |
|
2026-07-24 17:47 |
Claude Opus 5 突破半价胜对手
据TheRundownAI称,Anthropic推Claude Opus 5,性能超4.8并优于Fable,且价格减半。 |
|
2026-07-17 09:18 |
Moonshot Kimi K3刷新多项基准仍落后
据@CNBC称,Kimi K3在部分基准胜过OpenAI与Anthropic,但总体仍落后。 |
|
2026-07-16 22:46 |
GPT5.6 Sol Pro横扫prinzbench 91分
据gdb称,GPT5.6 Sol Pro在prinzbench得分91/99,基准已饱和。 |
|
2026-06-26 22:15 |
智谱AI逼近Anthropic与OpenAI
据CNBC称,智谱GLM凭开源与政策红利追赶美系模型,商业化与融资加速。 |
|
2026-06-17 01:26 |
GLM5.2 Max对决Fable诗歌表现
据emollick称,GLM5.2擅长约束合规,Fable以主题化消失元音取胜。 |
|
2026-06-16 17:23 |
OpenAI评测改革引领新基准
据OpenAI于X称,将改进评测以预测模型进展并应对基准饱和与投机。 |
|
2026-06-15 15:44 |
Claude3.5横扫新基准榜单
据God of Prompt称,Anthropic在新基准上领先,显示Claude3.5推理评测优势。 |
|
2026-06-11 17:35 |
Claude3深度解析柯勒律治续写挑战
据emollick称,Claude续写古舟子思考10分钟,链式推理复杂但偏直白。 |
|
2026-06-11 14:17 |
Hugging Face重启Papers With Code数据集
据KyeGomezB称,Hugging Face收购域名与数据集,平台回归可用于基准与检索。 |
|
2026-06-10 12:54 |
Project Tapestry联结开放AI研究
据@ylecun称,该计划号召研究者共建开放基准与工具。 |
|
2026-06-09 18:10 |
Claude Fable5 领跑基准大跃升
据karpathy称,Fable5在多项基准SOTA,长时复杂任务表现出色,并基于Mythos加入更强安全防护。 |
|
2026-06-09 18:10 |
Claude Fable 5拿下SOTA基准
据karpathy称,Fable 5在多项基准达SOTA,并在长时复杂任务上大幅领先。 |
|
2026-05-30 23:34 |
OpenAI与Anthropic加速模型突破
据@emollick称,两家公司模型多次在Artificial Analysis指数提升3分以上。 |
|
2026-05-20 18:27 |
机器人基准月球漫步测试受挫
据TheRundownAI称,该月球漫步基准仍在开发中。 |
|
2026-05-19 17:59 |
Gemini 3.5 Flash极速突破
据sundarpichai称,新模型上线且较前沿模型快4倍,并超越3.1 Pro基准。 |
|
2026-05-19 17:53 |
Gemini 3.5 Flash 重磅超越3.1 Pro
据@OriolVinyalsML称,3.5 Flash更快更强,基准大多胜过3.1 Pro。 |
|
2026-05-09 01:32 |
Claude Mythos评估达16小时窗口
据@emollick称,METR评估Claude Mythos任务中位时长16小时,处于可测上限。 |
|
2026-05-05 23:10 |
GPQA基准显示GPT 5.5 Instant跃升
据emollick称,OpenAI免费GPT 5.5 Instant在GPQA达晚2025付费水平。 |
|
2026-05-03 22:10 |
人工分析指数引发2026争议
据emollick称AA指数不适合趋势;chatgpt21保守推演GPT至2029年达90分。 |
