Project
AI 数据中台
从聊天数据清洗到 RAG、微调与考核的全链路数据平台
项目介绍
将原始聊天记录加工成可训练、可检索、可评估的数据资产,形成原始库、暂存区、人工审核、多格式导出和下游回流的统一数据链路。
Before
聊天数据分散且混杂噪声,难以直接用于知识库和模型训练
After
一份审核后的数据资产同时服务检索、微调、考核和内容应用
关键结果
- 清洗时、写入时、导出时三重脱敏,价格和敏感字段从数据源头隔离
- 一份审核数据同时导出 ShareGPT、Alpaca、OpenAI JSONL 和 RAG CSV
- 直播转写、素材增强和业务反馈持续回流,形成数据驱动的应用闭环
架构链路
- 原始聊天→
- ETL 清洗→
- 审核暂存区→
- RAG / 微调数据→
- 业务应用回流
技术栈
PythonETLSQLitePostgreSQLRAGData Masking
核心功能
- 消息抽取
- 多级清洗
- 三重脱敏
- 会话切分
- 多格式导出
我的职责
- 从本地消息库抽取并解析会话,完成发送者映射、时间过滤和去重
- 构建手机号、身份证、银行卡、邮箱和 API Key 等敏感信息脱敏规则
- 按时间窗构建对话块并预标注分类、质量分、问答和敏感信息
- 统一输出 ShareGPT、Alpaca、OpenAI JSONL 和 RAG CSV 等下游格式