T
traeai
登录

概念

DPO

别名:Direct Preference Optimization

直接偏好优化训练方法

已跟踪 8 条高相关材料

TraeAI 观察

相关材料

已收录 8 条与 DPO 相关的内容,按评分排序。

Fireworks AI(@FireworksAI_HQ) 图标

Fireworks AI 现已支持 DeepSeek V4 Flash 0731 模型的微调训练,提供 SFT/DPO/RL 三种训练方式,适用于编码代理和高并发场景,成本较传统方案降低 70%。

入选理由:DeepSeek V4 Flash 0731 可通过 Fireworks API 进行 SFT/DPO/RL 训练

精选推文#Fireworks AI#DeepSeek#模型微调#SFT#DPO英文
Apple Machine Learning Research 图标

Understanding Alignment in Multimodal LLMs: A Comprehensive Study

Apple Machine Learning Research519 字 (约 3 分钟)
85

苹果提出多模态大模型对齐新方法BDHS,无需额外标注即可提升模型性能,揭示离线与在线对齐方法结合的有效性。

入选理由:BDHS方法通过偏差驱动幻觉采样,无需外部模型或人工标注

精选文章#多模态LLM#对齐方法#Apple#DPO#PPO英文
How LLMs Learn to Be Helpful (RLHF vs DPO)

How LLMs Learn to Be Helpful (RLHF vs DPO)

ByteByteGo Newsletter2425 字 (约 10 分钟)
85

本文对比RLHF与DPO两种方法,揭示大语言模型如何通过偏好学习提升帮助性,解析训练三阶段及技术局限性。

入选理由:模型训练分三阶段:预训练、监督微调(SFT)、偏好教学(RLHF/DPO)

精选文章#LLM#RLHF#DPO#模型训练英文
Direct Preference Optimization Beyond Chatbots

Direct Preference Optimization Beyond Chatbots

Hugging Face Blog2903 字 (约 12 分钟)
85

本文介绍了DPO(Direct Preference Optimization)技术,它通过使用模型自身失败时产生的拒绝对来优化文本生成,从而显著减少了文本退化率。DPO在OCR(光学字符识别)任务中特别有效,因为它可以作为直接的失败模式缓解工具,而无需依赖于主观的人类判断。

入选理由:DPO技术通过使用模型自身失败时产生的拒绝对来优化文本生成,显著减少了文本退化率。

精选文章#Direct Preference Optimization#OCR#text generation#model training中文
GLM 5.1 from @Zai_org is now available on @FireworksAI_HQ Training Platform across the Managed and T...

Fireworks AI 平台正式支持智谱 GLM 5.1 模型,提供 SFT/DPO 微调能力、200K 超长上下文窗口,专为长周期智能体编程微调优化,RL 训练即将上线。

入选理由:GLM 5.1 已集成至 Fireworks AI 托管与 API 训练工作流

精选推文#GLM#Fireworks AI#大模型微调#SFT#DPO中文

跨材料问答 · DPO

回答基于:DPO 相关 8 条材料
    0 / 500

    AI 可能会生成不准确的信息,请核实重要内容