Project
商品销售模型微调
SFT + DPO 与 RAG 协同的销售话术模型训练链路
项目介绍
基于审核后的销售对话数据构建微调流程,让模型学习表达风格,同时把课程、价格和优惠等变化频繁的事实继续交给 RAG 管理,形成风格与知识的职责分离。
Before
模型表达风格不稳定,知识更新和模型重训耦合在一起
After
微调负责表达风格,RAG 负责动态知识,客服链路可以独立迭代
关键结果
- SFT 保持多轮话术风格,RAG 管理课程、价格和优惠等动态事实
- 本地 QLoRA 快速验证数据质量,再进入生产级 LoRA 训练流程
- Cross-Encoder 精排将知识命中率从约 72% 提升到 89%
- 人工盲评风格一致性从约 2.1 提升到 4.3 / 5
架构链路
- 审核数据→
- SFT / DPO→
- 微调模型→
- RAG 检索→
- 咨询 Agent
技术栈
QLoRASFTDPOLLaMA-FactoryQwenRAG
核心功能
- 数据分流
- QLoRA 验证
- 偏好对齐
- 精排检索
- 客服回流
我的职责
- 把审核数据按多轮话术和结构化知识分流,分别服务 SFT 与 RAG
- 使用 QLoRA 快速验证数据质量,再进入生产级 LoRA 训练流程
- 规划 SFT 到 DPO 的偏好对齐路径,改善回答风格和策略表达
- 通过向量粗召回与 Cross-Encoder 精排提高知识命中质量