清华微软用合成数据训练AI模型超越大模型

立即订阅亚视新闻 YouTube,即时掌握时事发展。

中国清华大学与微软研究人员近日开发出一条名为 SynthSmith 的合成数据训练管道,可在无需真实世界数据的情况下训练人工智能(AI)模型,并使用了英伟达(Nvidia)最新芯片助力实验。

研究显示,通过SynthSmith训练的70亿参数X-Coder模型,在主要编码测试中表现超过了参数量达到140亿的模型,即便使用的数据量更少且完全来自合成数据。研究团队表示,这一成果有望缓解AI模型训练中真实数据稀缺的瓶颈。

实验过程中,团队在监督微调阶段使用了128块Nvidia H20芯片,耗时220小时;强化学习阶段则使用32块H200芯片,耗时7天。研究人员指出,AI行业正向“智能代理推理模型”发展,这类模型可在生成输出前“思考”,并完成长时间任务,这也使得模型部署阶段的算力需求显著增加。

论文第一作者、清华大学硕士生吴杰表示,SynthSmith尚未扩展到上百亿参数甚至万亿参数的大模型,主要受限于算力,而非方法本身。通过开源管道,研究团队希望降低训练成本,让更多科研人员能够进行相关探索。值得一提的是,特朗普政府在Nvidia游说下已放宽出口管制,中国公司现可使用H20与H200芯片进行AI模型训练和推理。

相关新闻:

你可能也喜欢

Back to top button