返回研究成果

行业研究

真实数据之外:数据合成如何打开新空间

发布时间:2026-07-28T15:16:00栏目:行业研究
真实数据之外:数据合成如何打开新空间研究成果配图

一、数据合成技术概述

(一)什么是数据合成?

数据合成技术(Synthetic Data Generation)是指通过算法、统计模型或生成式人工智能等方法,生成与真实数据具有相似统计特性和分布的虚拟数据。这些合成数据在保持原始数据规律的同时,避免了使用真实数据可能带来的隐私和安全问题。比如,在医疗领域,患者的健康数据通常包含敏感信息。研究人员可以使用数据合成技术,生成具有相同统计特性的虚拟健康数据,用于开发和测试医疗算法。这样既确保了患者隐私,又提供了足够的数据支持算法的优化和验证。

(二)数据合成的应用价值

赛智产业研究院数据产业研究所所长陈文静认为,在数据安全约束强化与高质量数据需求增长的双重驱动下,数据合成技术具有显著的应用价值:一是扩充大模型训练数据集。当前,大模型对于数据量的需求呈指数级增长,合成技术生成的数据样本,弥补了真实数据稀缺性问题,缓解了大模型训练的数据枯竭风险,提供了稳定的训练数据来源。二是提升大模型训练数据质量。数据合成技术可以针对特定场景生成精确的多样化数据,避免了数据偏差问题,提升了模型的整体准确性。如,在医疗领域,心脏病数据集中男性患者占比高,女性患者数据量不足,合成女性患者数据能够平衡数据集,提升对女性患者病情的预测准确性。三是增强大模型场景覆盖能力。数据合成技术可以模拟现实难以采集的边缘场景,如自动驾驶中的极端天气、罕见病研究中的患者数据、金融风控中的异常交易模式等,使模型在训练和测试环节涵盖了各种可能输入,学习到更全面的特征和模式,提高应对真实生活中复杂情况的适应能力。四是规避隐私与合规风险。合成数据通过脱敏生成,满足《通用数据保护条例》(General Data Protection Regulation,GDPR)等法规要求,避免了直接使用真实个人数据可能带来的隐私泄露风险。比如,利用差分隐私(Differential Privacy, DP)技术,在数据结果中添加随机扰动,即“噪声”,在保留原始数据分布特征的同时,模糊掉单个个体的特征,使得输出结果中无法识别单个个体的信息,达到保护个人隐私的目的。

(三)数据合成的发展瓶颈

当前,全球数据合成技术已进入规模化应用阶段,但共性技术研发仍面临很多瓶颈,也存在一些技术上的不成熟。一是技术碎片化,不同领域(如文本生成和3D仿真)各自采用不同的技术体系,缺乏统一的技术方法与框架,可复用的合成方法和工具较少,导致难以协同整合与跨域迁移。二是数据质量标准缺失,合成数据质量评估缺乏通用指标,导致合成数据互认互通水平不足,共性开发受限。三是知识产权保护与技术共研共用矛盾,共性技术知识产权确权与保护机制尚不完善,限制了共性技术的发展。四是模型生成数据的幻觉问题突出,仍需精细化校验。

二、主要数据合成技术

(一)数据合成技术演变路径

数据合成技术的发展经历了从传统的统计方法到现代生成模型的演进。早期的数据合成主要依赖于统计学方法,对真实数据进行统计分析,依据数据的统计性特征构建模型,生成具有相似分布特征的合成数据。随着深度学习(Deep Learning)的不断发展,大语言模型(Large Language Models,LLMs)、生成对抗网络(Generative Adversarial Networks,GANs)、变分自动编码器(Variational Autoencoders,VAEs)等技术为数据合成提供了更为先进的生成模型,差分隐私(Differential Privacy, DP)、联邦学习(Federated Learning, FL)等隐私技术的协同应用为数据合成提供了更加成熟的隐私保护手段。近年来,随着大模型的广泛应用和对数据需求的激增,数据合成技术的重要性进一步凸显,成为解决数据稀缺和隐私问题的关键手段。

(二)数据合成的关键技术

1.模型合成技术。大语言模型(LLMs)、生成对抗网络(GANs)和变分自动编码器(VAEs)等深度学习模型能够自动从数据中学习数据特征,生成与原始数据相似的合成数据,提高了数据合成效率,为模型训练提供了更加多样、更高质量的合成数据。例如,Meta利用大语言模型Llama 2生成的合成数据训练Llama 3;OpenAI使用GPT-4和o1模型生成的合成数据来训练Orion模型。

2.自我进化合成技术。创新自进化合成框架,将数据生成与模型训练闭环,形成自我优化的技术路径。例如,中国科学技术大学与华为诺亚方舟实验室联合开发的工具调用数据合成框架ToolACE,设计了模拟用户的用户智能体(User Agent)来提出需求、充当助手的助手智能体(Assistant Agent)来响应用户需求、作为执行者的工具智能体(Tool Agent)按照“助手”的要求模拟输出执行结果,实现模拟真实场景下的“对话”,生成高质量、多样化的数据。

3.多模态数据合成创新技术。随着对文本、图像、音频和视频等多模态数据的需求增加,合成技术也在向多模态方向发展。例如,英伟达Omniverse Replicator可以生成包含三维空间信息的图像数据,在虚拟仓库场景中生成包含叉车的图像数据,训练机器人识别和避开叉车叉齿,提高导航安全性。北京大学与51Sim合作生成带有多模态数据标注的合成场景数据集,涵盖了不同天气、光照和交通状况,为自动驾驶和机器人等领域的研究提供丰富的训练数据。

三、数据合成技术开源工具

开源数据合成技术工具是指公开源代码、允许用户自由使用、修改和分发的数据合成技术工具。这些工具的出现,降低了技术使用门槛,为开发者和研究人员提供了便捷的数据合成手段,促进了数据合成技术的普及、迭代与应用。

(一)SDG

SDG(Synthetic Data Generator)由哈工大数据安全研究院开源,主要用于生成结构化的表格数据。该工具还集成了大模型的仿真技术,能够在无原始数据的情况下,仅凭元数据生成符合自然世界特征的数据表,显著节省时间和人力成本。 

(二)Synthetic Data Showcase

Synthetic Data Showcase由微软开发,旨在生成合成数据和用户界面,以支持隐私保护的数据共享和分析。该平台提供了一个免费使用的网络应用程序,允许用户在不暴露真实数据的情况下发布私人数据,帮助用户在保护隐私的前提下,充分利用数据的价值,支持各种数据驱动的应用和研究。

(三)SDV生态系统

  • SDV(Synthetic Data Vault)

SDV由原麻省理工数据至AI实验室(Data to AI Lab)研发,现由衍生公司DataCebo维护,旨在满足对高质量和多样化合成数据日益增长的需求。SDV的核心是结合生成对抗网络(GANs)、变分自动编码器 (VAEs) 等多种模型和技术,以确保生成的合成数据在统计特性、分布和变量关系方面与现实世界数据非常相似。通过利用这些先进技术,SDV可以捕获数据中的复杂模式和结构,从而生成既多样化又一致的合成数据。

  • TGAN(Tabular GAN)

TGAN利用生成对抗网络(GANs)来处理具有高维特征的表格数据,在金融、医疗保健和电子商务等领域具有较大应用空间。TGAN利用生成对抗网络(GANs)中的生成器和鉴别器的对抗工作,利用生成器创建与真实数据分布非常相似的合成数据样本,鉴别器则区分真实样本和合成样本,在生成真实且多样化的合成样本的同时保持原始数据的统计特性。

  • CTGAN(Conditional Tabular GAN)

CTGAN主要用于生成高度逼真且连贯的结构化表格数据。该工具擅长处理复杂数据集,能够捕获复杂的数据分布特征,利用对抗训练程序,在保留真实数据集的基本统计属性的前提下,生成合成数据。

(四)DoppelGANger 

DoppelGANger由研究人员Zinan Lin、Alankar Jain、Chen Wang等提出,使用生成对抗网络(GANs)合成时间序列数据。该工具能够有效学习并再现时间序列数据中的长期依赖关系和复杂的多维度关系,在金融和物联网(IoT)等需要实现长期监测与趋势分析的领域具有重要的应用价值。

(五)Synthea

Synthea由Synthetic Health团队研发,现由美国非营利性技术研发机构MITRE Corporation进行维护,旨在合成虚拟患者,用于医疗保健研究和模拟。它可以创建逼真的患者叙述、医疗诊断和使用药物,合成具有复杂病史和临床数据的庞大而多样的虚拟患者群体,并通过模拟复杂的患者病程、刺激慢性疾病的进展,捕捉生活方式因素的影响。Synthea帮助研究人员和临床医生在保护患者隐私的前提下,对患者病情进行全面研究,完成医疗保健模拟和干预措施测试。

(六)MirrorDataGenerator

MirrorDataGenerator由Data Responsibly项目团队开发,是一种优先考虑隐私保护的工具。该工具能够保留原始数据集统计属性和关系,创建在实用性和结构方面与原始数据集非常相似的合成数据,使其适用于各种下游任务,例如模型训练、测试和分析。同时,该工具专注于隐私保护,拥有可自定义的控件,遵循严格的隐私与合规性标准。

四、数据合成技术未来发展方向

赛智产业研究院数据产业研究所所长陈文静认为,数据合成技术未来发展主要聚焦于以下四个方面。

(一)提升合成数据的真实性

研究更先进的生成模型,优化数据合成过程,提升合成数据真实性。例如,利用扩散模型(Diffusion Models),在正向的扩散过程中,通过逐步添加噪声来降低真实数据的真实性,然后逆转正向扩散过程,学习从噪声中恢复原始数据,最终使模型能够从随机噪声中生成逼真的数据样本,提升合成数据的真实性。

(二)增强合成数据的可控性

在实际应用中,生成数据需要满足特定的需求和约束。为此,可以将强化学习(Reinforcement Learning, RL)与生成模型相结合,通过设计学习奖励机制,不断引导生成模型朝着预定目标生成数据,如特定风格、主题或结构的数据内容,提高数据的实用性和针对性。

(三)完善隐私保护技术

在数据合成过程中,保护用户隐私和数据安全至关重要。采用“差分隐私+联邦学习”的技术组合,使用差分隐私(DP)在数据中添加噪声,确保单个数据点的贡献不会被识别,从而保护个体隐私;同时,联邦学习(FL)则允许模型在多个设备或服务器上训练,数据无需离开本地,进一步减少了数据泄露的风险。将这两种技术结合,可以在保证数据隐私的前提下,进行高效的数据合成和模型训练。

(四)优化数据合成计算效率

数据合成过程往往需要大量的计算资源,因此需要探索低计算成本的数据合成技术。例如,利用“轻量级生成模型”,通过减少模型参数和计算量,保持模型性能的同时降低资源消耗;利用“模型压缩技术”,通过缩小模型规模,提高运行效率。这些方法的应用,使得数据合成技术在资源受限的环境中也能高效运行。