Introducing Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber
Google DeepMind 推出 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber,分别在效率、速度和网络安全应用方面有显著提升。
入选理由:Gemini 3.6 Flash 相比 3.5 Flash 输出令牌减少 17%,部分基准测试提升达 65%。
产品
别名:deep swe
专家级代码数据集
已跟踪 11 条高相关材料
最近变化
2026-08-08 · AI自信错误时用户跟随率高达80%,远高于正确时的92.7%
为什么值得关注
DeepSWE 被反复提及时,通常意味着它正在影响产品路线、开发者工作流或 AI 产业判断。这个页面把分散材料合并成一个可持续更新的观察入口。
Kimi K3 vs Claude Fable 5 on DeepSWE: Cost and Coding
Together AI Blog · 8.5 分
Kimi K3在DeepSWE基准测试中以1/3成本超越Claude Fable 5,多次尝试后性能反超,但后者可靠性更高。
You should probably go give @poolsideai a follow on Hugging Face. These folks are on a roll, releas...
Thomas Wolf(@Thom_Wolf) · 8.5 分
Poolside AI的Laguna S2.1是当前在本地运行的最佳编码模型之一,其在Terminal-Bench 2.1和DeepSWE基准测试中表现优异。
Introducing Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber
Google DeepMind Blog · 8.5 分
Google DeepMind 推出 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber,分别在效率、速度和网络安全应用方面有显著提升。
已收录 11 条与 DeepSWE 相关的内容,按评分排序。
Google DeepMind 推出 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber,分别在效率、速度和网络安全应用方面有显著提升。
入选理由:Gemini 3.6 Flash 相比 3.5 Flash 输出令牌减少 17%,部分基准测试提升达 65%。
Kimi K3在DeepSWE基准测试中以1/3成本超越Claude Fable 5,多次尝试后性能反超,但后者可靠性更高。
入选理由:Kimi K3单次任务成本仅4.65美元,为Claude Fable 5的1/3
Poolside AI的Laguna S2.1是当前在本地运行的最佳编码模型之一,其在Terminal-Bench 2.1和DeepSWE基准测试中表现优异。
入选理由:Laguna S2.1在Terminal-Bench 2.1得分70.2,超越5-25倍参数量的模型
Kimi K3在软件工程任务中性能与Claude Fable 5相当,但价格仅为后者35%。
入选理由:Kimi K3价格仅为Claude Fable 5的35%但性能相同
DeepSWE 是一个全新的编程基准测试,涵盖多种语言和真实世界复杂度,参考解决方案平均需要修改 668 行代码。
入选理由:DeepSWE 是一个全新的编程基准测试,涵盖多种语言和真实世界复杂度。
AI模型在达到高准确性后可能引发人类信任偏差,80%的用户会跟随其错误建议。
入选理由:AI自信错误时用户跟随率高达80%,远高于正确时的92.7%
Claude Opus 4.8是Anthropic对4.7版的快速修正,重点提升对模糊指令的理解能力以回归4.6的“用户友好”风格;虽在官方基准测试中表现优于GPT-4.5,但真实世界工程基准DeepSWE显示GPT-4.5当前更胜一筹,且4.8尚未参与该测试。
入选理由:Opus 4.8通过增强歧义理解能力修正了4.7过度字面化的问题,目标是恢复4.6版本广受好评的‘vibes’体验。
AI Engineer World's Fair 2026的Agentic Engineering Track展示AI工程领域最新动态,涵盖代码生成、多智能体协作等方向,但缺乏技术细节。
入选理由:DeepSWE数据集由@shiqyy和Datacurve团队开发
GLM-5.2 在 DeepSWE 排名第一,但文章信息密度低,缺乏技术深度。
入选理由:GLM-5.2 在 DeepSWE 排名第一,pass@1 得分为 44%。
Fable在设计和创意任务中表现优异,但在软件工程任务中性价比不高。
入选理由:Fable在设计和创意任务中表现突出。
DeepSWE 评测显示 Opus 4.8 性能优于 4.7,成本更低、效率更高,但远逊于 GPT-5.5;作者仍用更便宜的 4.6,因价格优势;并质疑 Benchmark 可信度,更信真实用户反馈。
入选理由:Opus 4.8 性能强于 4.7,同时具备更低推理成本与更高效率,但未达 GPT-5.5 水平。