T
traeai
登录

概念

speculative decoding

别名:投机解码

通过预测多个token来加速LLM推理的技术。

已跟踪 2 条高相关材料

TraeAI 观察

相关材料

已收录 2 条与 speculative decoding 相关的内容,按评分排序。

I've seen some confusion online on how to run llama.cpp with MTP (Multi-token prediction) in the sim...

如何在llama.cpp中运行MTP(多token预测)

Julien Chaumond(@julien_c)255 字 (约 2 分钟)
75

MTP是llama.cpp内置的投机解码新特性,可将大多数用例的token生成速度提升约2倍,通过Dense 27B模型可达~30 tok/sec,MoE模型可达~100 tok/sec。

入选理由:MTP是内置于模型本身的投机解码新特性,可将token生成速度提升约2倍

精选推文#llama.cpp#MTP#投机解码#Qwen#大模型推理优化英文
RL post-training is hitting a rollout bottleneck. 

This new paper from #NVIDIAResearch shows how sp...

NVIDIA 研究提出将 speculative decoding 引入 NeMo-RL + vLLM 架构,实现 RL 后训练 rollout 阶段无损加速:8B 模型吞吐提升 1.8 倍,235B 模型端到端预计提速 2.5 倍。

入选理由:RLHF/RLAIF 后训练的 rollout 阶段已成为性能瓶颈

精选推文#RLHF#speculative decoding#vLLM#NeMo-RL#NVIDIA中英混合

跨材料问答 · speculative decoding

回答基于:speculative decoding 相关 2 条材料
    0 / 500

    AI 可能会生成不准确的信息,请核实重要内容