跳到正文
原文
Hugging Face Blog·AI 评分34

PRX Part 4:我们的数据策略

PRX Part 4: Our Data Strategy

AI 导读

PRX 系列第 4 篇披露其数据策略:预训练数据由公开与内部数据集混合组成,用 VLM 重新生成图像描述,再转为可流式训练的语料。团队改用 Qwen3-VL 在训练中实时计算文本 latent,实测吞吐损失约 3–4%(30 天训练多约 1 天),并采用 Lance 构建、MDS 流式的双格式方案。

来源:Hugging Face Blog · huggingface.co