AI 快讯列表关于 不确定性
| 时间 | 详情 |
|---|---|
|
2026-03-23 14:46 |
塔尔图大学实证:两次采样混合法显著优于自洽法 84.2 AUROC 测不确定性|2026 深度分析
根据推特账号 God of Prompt 引用塔尔图大学评测结果,两次采样的“口头置信度+自洽一致性”混合法在17项数学、STEM与人文任务上优于业内主流的自洽法,在数学领域达到84.2 AUROC,而八次采样的单一方法仅为79.4–81.4(来源:God of Prompt,塔尔图大学)。据该帖报道,单次询问模型自报置信度即可在数学上取得71.3 AUROC,超过K=2自洽法的70.5,且算力成本更低(来源:God of Prompt)。依据该总结,两次采样后边际收益迅速衰减,在数学仅增约4.2 AUROC,在STEM与人文约增2,提示在医疗、法律与金融等高风险推理应用中应以混合法在K=2部署以获得最佳性价比与更可靠不确定性校准(来源:God of Prompt,塔尔图大学)。 |