T
traeai
登录

概念

SWE-bench Verified

别名:SWE-bench

软件工程智能体基准测试

已跟踪 4 条高相关材料

TraeAI 观察

相关材料

已收录 4 条与 SWE-bench Verified 相关的内容,按评分排序。

If AI writes your code, why use Python?

如果AI写你的代码,为什么还要用Python?

Hacker News Best1704 字 (约 7 分钟)
87

AI已让Rust、Go等系统语言开发效率飙升,使Python的生态优势被削弱,开发者需重新评估语言选型策略。

入选理由:2026年GPT-5.5等模型在SWE-bench Verified上达到80%以上通过率,标志着AI已能高效编写系统级代码。

精选文章#AI编程#Rust#Go#系统编程#大模型英文
Orchard: An open framework for scalable agentic AI

Orchard: An open framework for scalable agentic AI

Microsoft Research Blog1851 字 (约 8 分钟)
85

微软发布Orchard开源框架,通过Orchard Env环境服务支持多领域智能体训练,30亿参数模型在SWE-bench测试中达到69.7%性能。

入选理由:Orchard框架支持软件工程、网页导航等多类型智能体训练

精选文章#AI框架#开源#智能体AI#微软研究英文
英伟达推出 AI 框架 Polar,让 Codex 跑分暴涨 594.74%

英伟达推出 AI 框架 Polar,让 Codex 跑分暴涨 594.74%

AI HOT 精选907 字 (约 4 分钟)
85

英伟达推出开源框架 Polar,显著提升 Codex 等智能体的性能和效率。

入选理由:Polar 框架让 Codex 在 SWE-Bench Verified 测试中的 pass@1 分数提升了 594.74%。

精选文章#英伟达#Polar#AI 框架#Codex#强化学习中文

跨材料问答 · SWE-bench Verified

回答基于:SWE-bench Verified 相关 4 条材料
    0 / 500

    AI 可能会生成不准确的信息,请核实重要内容