跳到正文

数据与训练

训练侧的门道:数据集构建、合成数据、预训练与后训练方法、算力与训练成本。

最新精选

第 1–3 条 · 共 3 条
9月29日周二
  1. Hugging Face Blog62

    NVIDIA 发布表格基础模型 Kumo Tabular,在四个基准排名第一

    NVIDIA 发布开源表格基础模型 Kumo Tabular,面向表格分类与回归,给定带标签的行即可在单次前向传播中预测新行标签,无需训练、调参和特征工程。模型提供 28M 到 215M 三种规模,仅用人工合成表格预训练,通过开源库 structured-data-models 运行,采用 OpenMDW-1.1 许可可商用。

    推荐理由:原文给出模型规模、训练数据来源与四个基准排名,可据此判断表格基础模型相对梯度提升树的工作流差异。

  2. Microsoft Research62

    微软研究院发布 Quine:面向生物学复杂性的 AI 研究系统

    微软研究院发布 Quine,一个面向生物学复杂性的 AI 研究系统,由跨序列、结构、功能、细胞状态和成像等多模态数据联合训练的生物学世界模型,以及连接模型、科学工具、文献与实验人员的交互式 harness 组成。

    推荐理由:微软研究院公开 Quine 的生物学世界模型与实验闭环设计,并给出胰腺癌化合物筛选的湿实验验证结果。

9月4日周五
  1. Google Research62

    Google 与 HHMI Janelia 等发布雄性果蝇完整脑连接组图谱

    Google 与 HHMI Janelia、剑桥大学等合作在 Cell 发表论文,发布雄性果蝇脑与中枢神经系统的完整连接组图谱,包含超过 166,000 个神经元和 1.25 亿个突触连接,是迄今按神经元数量计最大的脑图谱。

    推荐理由:Google 与 HHMI Janelia 等合作发布迄今神经元数量最多的雄性果蝇完整连接组,并说明 AI 重建方法如何降低人工校对成本。