🧊 前沿科技知识库
全部 / 人工智能(AI)

合成数据与数据引擎

2026-09-26 · 人工智能(AI)
最后更新:2026-09-26 | 领域:AI·前沿方向与风险 | 说明:信息来源为公开网络资料,详见文末参考来源

概述

合成数据(Synthetic Data)指由模型而非人工生成、用于训练的数据。据 2026 年的行业总结,合成数据已成为几乎所有专用模型的默认监督来源:Tülu、OpenHermes、Llama-3-Instruct 等开放权重指令模型高度依赖合成数据,定制的 reranker、分类器与 embedder 也以合成语料为主,根本原因是人工标注是瓶颈,而 LLM 能大规模生产(Synthetic Data Generation)。生成 1 万条样本从数周缩短到数小时,使合成数据成为 2024–2025 年多数微调项目的默认起点;整个「生成—训练—评测—迭代」的实验循环因此大幅加速(What Is Synthetic Training Data? Using LLMs to Train LLMs)。

最新进展(2025–2026)

从 Self-Instruct 到自验证蒸馏

基础方法为 Self-Instruct:从少量种子指令出发,让强模型生成相似的新指令与答案,把几条样例扩展为数千条指令—答案对;Evol-Instruct 进一步「进化」已有样例,使其更复杂、更深入(Fine-Tuning with Synthetic Data: Self-Instruct, Distillation, and the Model Collapse Risk)。

2026 年的新进展强调「自我验证」与质量过滤。Self-Verified Distillation 让模型对种子问题生成候选解,用基于提示的自验证过滤,并通过「循环一致性—事实性」等多阶段级联筛选,再用自筛选数据集训练(Self-Verified Distillation: Your Language Model Is Secretly Its Own Synthetic Data Pipeline)。通义 DeepResearch 技术报告则给出端到端合成数据方案:通过随机游走构建高度互联的知识图谱,生成复杂、高不确定性、超人类水平的问答对,全流程无需人工干预(Tongyi DeepResearch Technical Report)。

模型崩塌与缓解

模型崩塌(Model Collapse)最早由 Shumailov 等(2024)提出,指模型在多代训练于自身生成输出后性能显著下降(What happens when generative AI models train recursively on each others' outputs?)。2025–2026 年研究细化了机理:

合成数据用于低资源与多语言

激活引导也被用于合成数据生成:有工作以「某语言平均激活减去其他语言平均激活」构造 steering vector,隔离语言身份,用于低资源语言生成(Want Better Synthetic Data? Steer It)。

数据飞轮与验证管线

自蒸馏加验证的核心是「生成—过滤—训练」闭环:模型先对种子问题生成候选解,再用基于提示的自验证与多阶段级联(如循环一致性、事实性)筛选,最后在自筛选数据集上训练(Self-Verified Distillation)。典型合成数据管线覆盖指令扩增、答案生成、质量过滤与去重等环节,以便把少量种子快速扩展为数千条指令—答案对(Fine-Tuning with Synthetic Data: Self-Instruct, Distillation, and the Model Collapse Risk)。在 agent 场景中,通义的端到端方案先用随机游走构建高互联知识图谱,再生成复杂、高不确定性、超人类水平的问答对,全程无需人工干预(Tongyi DeepResearch Technical Report)。

核心技术与关键概念

从既有研究看,缓解模型崩塌的手段可归为三类:数据侧(熵选择、提高真实数据配比)、模型侧(提升模型多样性、用冻结模型重标注)与损失侧(置信度感知的损失设计)(Multimodal Model Collapse、Entropy-based selection、ForTIFAI)。

代表性项目 / 公司 / 产品

关键数据与评测结果

事项结论来源
生成 1 万条样本耗时数小时(相比人工数周)What Is Synthetic Training Data?
多模态崩塌缓解手段增加解码预算、模型多样性、冻结模型重标注Multimodal Model Collapse
崩塌驱动指标合成数据熵下降A Closer Look at Model Collapse
抗崩塌损失Truncated Cross Entropy 显著延缓崩塌ForTIFAI

趋势与争议

  1. 默认化:合成数据成为专用模型的默认监督来源,但也带来同质化与偏差放大风险(Synthetic Data Generation)。
  2. 崩塌是否必然:早期观点认为递归训练必然崩塌,新研究强调通过数据比例、熵选择、置信度损失与模型多样性可缓解,争议在于所需真实数据的比例(Preventing Model Collapse、ForTIFAI)。
  3. 验证成本:过滤与级联验证提升了质量,也引入额外算力与可能被利用的 judge 噪声(Self-Verified Distillation)。
  4. 验证器噪声传导:合成数据的最终质量高度依赖验证管线,而验证器(尤其是 LLM judge)本身存在噪声,这与 RLVR 面临的验证器问题同源(Self-Verified Distillation、Rate or Fate? RLVεR)。
  5. 合规:合成数据的版权、来源标注与训练合规尚无统一标准,属行业持续讨论议题(本条未在上述检索结果中确认具体条款,暂不展开)。

参考来源

← 检索深入:稀疏、稠密、混合检索与向量搜索(Retrieval & Vector Search)分词与嵌入 →