宝玉(@dotey)
我一直觉得这种测试只能测试 SVG 画图能力,并不太能体现智能水平,或者有什么理由通过这个测试能反映智能水平?
6.0内容质量

TL;DR · AI 摘要
该测试可能无法有效评估模型智能水平,更多反映SVG绘图能力,但通过调整推理模式可显著提升表现。
核心要点
- DeepSeek-V4-Flash-0731模型在默认推理模式下表现不佳,但调高后显著改善
- 测试可能更反映SVG绘图能力而非智能水平
- OpenRouter平台支持调整推理模式参数
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- AI测试有效性争议
- 测试局限性
- 仅评估SVG绘图能力
- 模型表现
- DeepSeek-V4-Flash-0731默认模式差
- OpenRouter调参后改善
金句 / Highlights
值得收藏与分享的关键句。
Got a disappointing pelican from DeepSeek-V4-Flash-0731 at default reasoning mode - on the left - but then I bumped reasoning up to high (via OpenRouter) and got the much better one on the right
我一直觉得这种测试只能测试 SVG 画图能力,并不太能体现智能水平
19.4K Views 46 3 47 8
#AI测试#模型评估#SVG绘图#推理模式
打开原文宝玉 on X: "我一直觉得这种测试只能测试 SVG 画图能力,并不太能体现智能水平,或者有什么理由通过这个测试能反映智能水平?" / X
宝玉
@dotey
我一直觉得这种测试只能测试 SVG 画图能力,并不太能体现智能水平,或者有什么理由通过这个测试能反映智能水平?
Simon Willison
@simonw
Aug 1
Got a disappointing pelican from DeepSeek-V4-Flash-0731 at default reasoning mode - on the left - but then I bumped reasoning up to high (via OpenRouter) and got the much better one on the right
6:59 PM · Aug 1, 2026
19.4K
Views
46
3
47
8