返回技能市场
数据分析 安全

合成数据生成器

@bailian/synthetic-data-generator

为大模型训练/评估自动化生成高质量合成样本,弥补真实数据稀缺、隐私敏感场景的数据缺口。

阿里云百炼 热度 244v1.0

合成数据生成器

用途

为大模型训练/评估自动化生成高质量合成样本,弥补真实数据稀缺、隐私敏感场景的数据缺口。

何时使用

  • 需要冷启动 SFT 数据集且无标注人力
  • 真实数据涉及 PII/隐私无法直用
  • 需要覆盖长尾场景与边界 case

输入要求

  • 目标 schema / 字段定义
  • 种子样例 5-20 条
  • 生成规模与分布约束

执行步骤

  1. 澄清任务类型(分类/抽取/生成/对话)与评估口径
  2. 按 schema 构造 prompt 模板,先跑 20 条抽样人工核验
  3. 设置生成参数(temperature、多样性、种子轮换)扩量到目标规模
  4. 去重(MinHash/embedding)+ 偏差校验(类别分布、长度分布)
  5. 输出 train/dev/test 拆分与数据卡片

常见陷阱

  • 模板过窄导致同质化
  • 忽略负样本/难例
  • 未对齐真实分布做 A/B 校验

验收标准

在下游任务上 vs 真实数据对齐比较 AUC/F1,差距 <5% 视为可用。

qianwen skills install @bailian/synthetic-data-generator