徐强

Project

商品销售模型微调

SFT + DPO 与 RAG 协同的销售话术模型训练链路

商品销售模型微调 screenshot

项目介绍

基于审核后的销售对话数据构建微调流程,让模型学习表达风格,同时把课程、价格和优惠等变化频繁的事实继续交给 RAG 管理,形成风格与知识的职责分离。

Before

模型表达风格不稳定,知识更新和模型重训耦合在一起

After

微调负责表达风格,RAG 负责动态知识,客服链路可以独立迭代

关键结果

  • SFT 保持多轮话术风格,RAG 管理课程、价格和优惠等动态事实
  • 本地 QLoRA 快速验证数据质量,再进入生产级 LoRA 训练流程
  • Cross-Encoder 精排将知识命中率从约 72% 提升到 89%
  • 人工盲评风格一致性从约 2.1 提升到 4.3 / 5

架构链路

  1. 审核数据
  2. SFT / DPO
  3. 微调模型
  4. RAG 检索
  5. 咨询 Agent

技术栈

QLoRASFTDPOLLaMA-FactoryQwenRAG

核心功能

  • 数据分流
  • QLoRA 验证
  • 偏好对齐
  • 精排检索
  • 客服回流

我的职责

  • 把审核数据按多轮话术和结构化知识分流,分别服务 SFT 与 RAG
  • 使用 QLoRA 快速验证数据质量,再进入生产级 LoRA 训练流程
  • 规划 SFT 到 DPO 的偏好对齐路径,改善回答风格和策略表达
  • 通过向量粗召回与 Cross-Encoder 精排提高知识命中质量