T
traeai
登录

概念

MMLU

别名:Model Multiple Choice

主流的模型基准测试榜单

已跟踪 5 条高相关材料

TraeAI 观察

相关材料

已收录 5 条与 MMLU 相关的内容,按评分排序。

Ethan Mollick(@emollick) 图标

Paper: https://t.co/RbOLdingA0

Ethan Mollick(@emollick)64 字 (约 1 分钟)
85

LLMs在基准测试中表现提升显著,但商业学科应用仍存在明显短板,需更贴近实际场景的评估体系。

入选理由:LLMs在事实记忆类任务准确率已达92%,但商业策略分析仅达67%

精选推文#AI#LLMs#商业应用#arxiv#基准测试英文
Hugging Face Blog 图标

Featuring Every Eval Ever Results on Hugging Face Model Pages

Hugging Face Blog1461 字 (约 6 分钟)
85

Hugging Face整合EVE与Community Evals,统一AI模型评估数据格式,提升结果可比性和可信度。

入选理由:EEE采用统一JSON schema记录评估元数据,解决数据分散问题

精选文章#AI评估#Hugging Face#模型基准#EEE英文
模型好不好用,谁说了算?从榜单崇拜到自建评测

模型好不好用,谁说了算?从榜单崇拜到自建评测

阿里云开发者58 字 (约 1 分钟)
70

文章批判盲目依赖模型榜单,主张建立自适应评测体系,强调工程实践中的模型评估应结合业务场景。

入选理由:模型榜单存在指标单一、场景适配性差的问题

精选文章#AI模型#评估体系#阿里云#机器学习中文
1,000 Tokens Per Second_ Diffusion Text Models Go Blazing Fast

1,000 Tokens Per Second_ Diffusion Text Models Go Blazing Fast

Last Week in AI209 字 (约 1 分钟)
65

该视频展示了谷歌推出的新型扩散模型,其推理速度达到每秒1,000个token,但不适用于大规模云部署。

入选理由:谷歌的新扩散模型推理速度达到每秒1,000个token,是现有模型的11倍。

精选视频#AI#扩散模型#谷歌#推理速度英文
1,000 Tokens Per Second_ Diffusion Text Models Go Blazing Fast

1,000 Tokens Per Second_ Diffusion Text Models Go Blazing Fast

Last Week in AI209 字 (约 1 分钟)
65

该视频展示了基于扩散模型的文本生成技术,可在单设备上实现每秒1,000个token的生成速度,但不适用于大规模云部署。

入选理由:单设备推理速度可达每秒1,000个token,比Opus快11倍。

精选视频#AI#扩散模型#文本生成#Google#云部署英文

跨材料问答 · MMLU

回答基于:MMLU 相关 5 条材料
    0 / 500

    AI 可能会生成不准确的信息,请核实重要内容