The most capable models available in the world are using Terminal-Bench-Science to show it (just one...
Stanford AI Lab宣布Terminal-Bench-Science基准在发布一周后被OpenAI的GPT-6 Astra采用,性能提升42.2%。
入选理由:Terminal-Bench-Science基准发布一周后即被OpenAI集成到GPT-6 Astra模型中
概念
由Stanford AI Lab开发的AI科学能力评估基准
已跟踪 2 条高相关材料
最近变化
2026-09-03 · Terminal-Bench-Science基准发布一周后即被OpenAI集成到GPT-6 Astra模型中
为什么值得关注
Terminal-Bench-Science 被反复提及时,通常意味着它正在影响产品路线、开发者工作流或 AI 产业判断。这个页面把分散材料合并成一个可持续更新的观察入口。
The most capable models available in the world are using Terminal-Bench-Science to show it (just one...
Stanford AI Lab(@StanfordAILab) · 8.5 分
Stanford AI Lab宣布Terminal-Bench-Science基准在发布一周后被OpenAI的GPT-6 Astra采用,性能提升42.2%。
Terminal-Bench-Science is out!
Stanford AI Lab(@StanfordAILab) · 6 分
斯坦福AI实验室发布Terminal-Bench-Science基准,用于评估AI代理在科研工作流程中的表现。
已收录 2 条与 Terminal-Bench-Science 相关的内容,按评分排序。
Stanford AI Lab宣布Terminal-Bench-Science基准在发布一周后被OpenAI的GPT-6 Astra采用,性能提升42.2%。
入选理由:Terminal-Bench-Science基准发布一周后即被OpenAI集成到GPT-6 Astra模型中
斯坦福AI实验室发布Terminal-Bench-Science基准,用于评估AI代理在科研工作流程中的表现。
入选理由:Terminal-Bench-Science是首个针对科研工作流的AI代理评估基准