返回项目列表

销售语料治理与专属模型微调

|

ETLDataFilterShareGPTOpenAI JSONLLLaMA-FactoryQLoRALoRADPO
00
📋

项目概述

作为客服、微调、考核、素材与直播业务的数据总线,将销售对话整理为可审核、可训练、可检索、可回灌的高质量数据资产。

00
👨‍💻

我的职责

负责销售语料治理系统、数据分层、脱敏与审核、训练数据导出、知识资产加工、本地模型验证、云端 LoRA 微调和 RAG Pipeline。

00
💼

核心业务

解决销售话术风格不稳定、数据质量不可控、知识更新依赖重训等问题,用“微调管风格、RAG 管知识”的职责分离降低长期维护成本。

00

项目亮点

  • 1从本地聊天数据库抽取消息,完成通讯录映射、群消息发送者解析、时间过滤和基于 session / timestamp / content 的去重
  • 2按 ETL、原始库、暂存区、人工审核、多下游组织数据链路,raw_chats 作为不可变原始库保留审计基础
  • 3DataFilter 按 9 级优先级过滤噪声,并对手机号、身份证、银行卡、邮箱、API Key 等敏感字段做清洗时、写入时、导出时三重脱敏
  • 4通过 5 分钟时间窗构建可审核对话块,合并同角色连续消息并自动预标注分类、质量分、Q&A、敏感标记
  • 5同一份 approved 数据导出 ShareGPT、Alpaca、OpenAI JSONL 与 RAG CSV,分别服务微调和知识库
  • 6本地 LLaMA-Factory + Qwen2.5 执行 QLoRA 快速验证数据质量,通过后再进行生产级 LoRA;规划 SFT 到 DPO 的训练演进路径
  • 7构建 Embedding、向量检索、Cross-Encoder Rerank 三阶段 RAG Pipeline,使知识命中率从 72% 提升至 89%
00
🛠

技术方案

核心技术包括 SQLite 数据抽取、PostgreSQL、ETL、DataFilter、正则脱敏、ShareGPT、Alpaca、OpenAI JSONL、RAG CSV、DashScope Embedding、knowledge_chunks、knowledge_articles、LLaMA-Factory、Qwen2.5、QLoRA、LoRA、SFT、DPO 与 Cross-Encoder Rerank。