OpenAI推出GeneBench-Pro测试AI在生物学领域的能力
realtime news Jul 09, 2026 17:59
OpenAI的GeneBench-Pro评估AI处理复杂基因组学和生物研究任务的能力,通过129个人造问题测试其在真实世界中的决策能力。
OpenAI发布了GeneBench-Pro,这是一项针对计算生物学、基因组学和转化医学领域的AI性能的前沿基准测试。该工具于2026年6月30日发布,旨在推动AI超越常规数据处理,进入依赖判断的真实科学推理领域。
GeneBench-Pro基于早期的GeneBench框架,现针对129个精心设计的复杂任务。这些任务模拟了真实场景,需要AI系统分析混乱的数据集、修订假设并进行迭代决策——这些任务反映了人类研究者复杂的工作流程。根据OpenAI的说法,这项基准测试旨在评估“研究品味”,即在模糊的科学环境中做出明智判断的能力。
与传统基准测试不同,GeneBench-Pro通过合成构建具有已知因果结构的数据集,避免了诸如随意评分等陷阱。这使得评分具有确定性,并确保解决方案依赖于稳健的分析推理,而不是捷径或随意选择。问题涵盖了十个领域和21个子领域,从基因组学到转化医学,反映了计算生物学挑战的广度。
AI性能与挑战
初步结果揭示了进展和局限性。OpenAI的GPT-5.6 Sol模型在最高推理层次的通过率为28.7%,相比于较早版本如GPT-5(在类似任务中的得分低于5%)有了显著提高。在启用Pro模式后,通过率提升至31.5%。这些数据突显了尖端模型的快速发展,但基准测试的内在难度表明仍有很大改进空间。
人类评审员估计,解决一个典型的GeneBench-Pro问题需要专家花费20至40小时,人工成本每个问题超过4,000美元。相比之下,AI推理成本每个问题仅需几美元,这表明即使是部分自动化也可能带来显著的经济和科学价值。然而,当前模型仍在“闭合推理循环”上遇到困难,这种失败模式类似于新手研究人员,他们能够识别模式但缺乏将发现有效置于背景中的经验。
验证与未来应用
GeneBench-Pro问题经过严格验证,包括由领域专家(如人类遗传学领域的研究生和教授)进行的外部审查。评审员对基准测试的现实性给予了高度评价,指出其与实际生物研究中混乱且迭代的性质一致。来自UCLA的助理教授Alexander Strudwick Young表示,这些问题需要“深思熟虑且反思性的数据分析”,而不仅仅是将标准方法应用于干净的数据集。
OpenAI已在Hugging Face上开源了10个具有代表性的问题,并计划通过Artificial Analysis发布50个问题的子集用于独立基准测试。这些步骤旨在促进合作和透明性,同时加速AI驱动的科学研究的进展。
更广泛的影响
随着测序成本的大幅下降和大规模生物库数据集日益可得,生物学中的瓶颈已从数据生成转向数据分析。准确且高效的AI系统可以通过自动化假设检验、实验设计和数据解读来改变这一格局。UCLA人类遗传学博士候选人Jennifer Grundman指出,能够在GeneBench-Pro任务中表现出色的模型可以“大大提高研究的速度、彻底性和可重复性”。
GeneBench-Pro代表了构建能够协助甚至主导复杂科学工作流程的AI系统的重要一步。尽管当前系统还远未能取代人类专业知识,但其处理依赖判断任务的能力让我们一窥AI加速医学、生物学及其他领域发现的未来。
Image source: Shutterstock