AI 快讯列表关于 强化学习
| 时间 | 详情 |
|---|---|
|
2026-09-17 20:28 |
Helix 2.5零样本家务突破
据SawyerMerritt称,Figure新模型可在陌生家庭零训练完成复杂家务,提升家服机器人商业可行性。 |
|
2026-09-15 23:05 |
Neon模型超越GPT6 Astra分析基准
据JeffDean称,Periodic Labs以1300台H200训练Neon,性能超越GPT6 Astra基准。 |
|
2026-09-10 16:44 |
SWE-2低价匹敌Fable 5.1实力
据TheRundownAI称,SWE-2在FrontierCode得分50%,以低64%成本匹敌Fable 5.1。 |
|
2026-09-10 13:29 |
DeepSeek 因果编解码架构突破
据KyeGomezB称,新因果编解码MoE仅8B输入16B输出,成本更低且跑分领先。 |
|
2026-09-09 08:39 |
OpenAI88小时破解纳维方程
据@CNBC称,OpenAI称88小时解决纳维方程难题,或重塑数学计算与HPC商业化路径。 |
|
2026-09-08 04:21 |
Astra击败MTG机器人实现新突破
据Ethan Mollick称,Astra自制卡组并击败Arena机器人,展现游戏工具使用进步。 |
|
2026-09-03 06:38 |
斯坦福工程AI代理课重磅上线
据StanfordAILab称,斯坦福今秋开设CS329Z教授从零构建AI代理。 |
|
2026-08-31 05:53 |
AI安全失灵揭示规则极限
据@emollick称,三定律失效,需分层治理。 |
|
2026-08-28 17:13 |
Claude3 以48小时自主校准小模型
据AnthropicAI称,Claude用1块GPU在48小时内自主研究并提升小模型对齐。 |
|
2026-08-27 15:16 |
代理购物研究揭示偏好难测
据@emollick称,页面顺序与记忆微变会扰动代理购物决策,营销可控性受限。 |
|
2026-08-27 12:05 |
AgiBot A3实战展示实时搏击AI
据@AINewsOfficial_称,AgiBot A3边打边读动作并自调握力与平衡。 |
|
2026-08-26 05:41 |
AI芯片设计加速ROI洞察
据gdb称,OpenAI以小团队配合AI改进循环,推动早期硬件在环RSI机会。 |
|
2026-08-26 00:42 |
Transformer瓶颈引发架构重思
据KyeGomezB称,专家称Transformer成瓶颈,新架构应支持测试时学习。 |
|
2026-08-21 10:48 |
前沿模型自改代码受挫分析
据@godofprompt,290次代码改写均分0.166,最佳0.250,自我改进有限。 |
|
2026-08-20 17:09 |
代理LLM早期定策,性能天花板锁死
据@godofprompt称,清华团队发现代理几乎不换策略,限制长程训练收益。 |
|
2026-08-18 21:00 |
OpenAI投入20%算力监测安全
据emollick称,OpenAI暂停前沿RL并投20%算力用于思维链监测与安全。 |
|
2026-08-18 19:58 |
OpenAI暂停前沿RL以应对网络风险
据God of Prompt称,因Astra接近关键网络风险阈值,OpenAI暂停最大前沿RL训练。 |
|
2026-08-18 18:36 |
OpenAI暂停前沿RL以强化安全
据OpenAI称,前沿RL训练暂停以强化安全与监控,最大规模训练持续搁置。 |
|
2026-08-18 18:13 |
OpenAI暂停RL训练以强化安全
据OpenAI称,已暂缓两周RL训练以加固环境并扩展监控。 |
|
2026-08-09 17:30 |
NVIDIA发布实时动作模型重磅突破
据God of Prompt称,NVIDIA开源模型以15000fps与2ms延迟生成35万动作技能。 |