Google 用冻结多 Token 预测加速 Pixel 上的 Gemini Nano
Google Research 发布一种新架构,将多 Token 预测(MTP)头接到已冻结的 Gemini Nano v3 模型上,已在 Pixel 9 和 10 系列上线。
推荐理由:原文给出冻结主干加 MTP 头的端侧加速方案,读者可了解其零拷贝 KV 缓存设计与 Pixel 上的实测提速。
值得读的 AI 论文与研究成果:架构创新、训练方法、能力测量与理论进展的精选解读。
Google Research 发布一种新架构,将多 Token 预测(MTP)头接到已冻结的 Gemini Nano v3 模型上,已在 Pixel 9 和 10 系列上线。
推荐理由:原文给出冻结主干加 MTP 头的端侧加速方案,读者可了解其零拷贝 KV 缓存设计与 Pixel 上的实测提速。
Google DeepMind 公布在塞拉利昂开展的预注册随机对照试验结果,使用 Guided Learning 的学生数学成绩比对照组提升 0.258 个标准差,相当于八周内取得约 1.2 至 1.7 年的常规学习进度。
推荐理由:Google DeepMind 在塞拉利昂的预注册随机对照试验给出了 AI 辅助教学的具体量化结果与使用行为数据。
Google Research 在 Nature 发表研究,提出 PHRM 系统,利用手机前置摄像头在面部解锁后的数秒内拍摄视频,通过深度学习在后台估算心率和静息心率。
推荐理由:Google 用手机前摄在解锁后被动测心率,并公开最大规模手机视频数据集与预训练模型,可看 rPPG 的肤色公平性进展。
Google 公布 Empirical Research Assistance(ERA),一款用 Gemini 编写和优化科学代码的研究工具,相关论文今日发表于 Nature。
推荐理由:原文给出 ERA 在 Nature 发表的跨学科基准表现与八篇应用手稿,读者可据此判断 AI 辅助科学编码的落地范围。
Google DeepMind 介绍生物学家 Omar Abudayyeh 和 Jonathan Gootenberg 的实验室使用 Co-Scientist 加速衰老研究。
推荐理由:原文给出 Co-Scientist 在衰老研究中的具体产出与验证结果,可了解 AI 辅助科研从假设生成到数据分析的落地方式。
Google DeepMind 在 Nature 发表 Co-Scientist 研究,这是一个基于 Gemini 构建的多智能体 AI 系统,可迭代生成、辩论并演化科学假设。
推荐理由:原文披露了多智能体系统的分工与辩论式排序机制,并给出多个实验室的实际应用反馈。
Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者诊疗。在 98 个真实初级保健查询的盲评中,该系统 97 例无关键错误,医生更偏好其回答而非主流证据综合工具。
推荐理由:原文给出AI co-clinician在临床证据问答与实时多模态远程问诊中的评测结果,读者可据此了解医疗AI当前能力边界与协作定位。
Google DeepMind 发布论文提出 Decoupled DiLoCo 分布式训练架构,将训练拆分为解耦的计算岛屿并异步传输数据,从而隔离局部硬件故障。
推荐理由:原文给出分布式训练新架构的带宽、容错与跨代硬件实测数据,可据此判断大规模预训练基础设施的演进方向。
Google Quantum AI 发布白皮书,称未来量子计算机破解保护加密货币的椭圆曲线密码所需的量子比特和门数比此前认为的更少。
推荐理由:Google Quantum AI 给出破解 ECDLP-256 所需量子资源的新估算,并说明如何在不泄露攻击细节的前提下公开漏洞。
Google 发布 TurboQuant 压缩算法,用于解决向量量化中的内存开销问题,并同时提出 QJL 与 PolarQuant 两种配套方法,三篇工作将分别发表于 ICLR 2026 和 AISTATS 2026。
推荐理由:Google 提出的向量量化方法在 KV cache 压缩与向量搜索上的实测数据,可供关注推理成本与长上下文部署的读者参考。
Google Research 与多家 NHS 机构合作在 Nature Cancer 发表两项研究,评估 AI 乳腺癌检测系统在筛查流程中的表现。
推荐理由:两项 Nature Cancer 研究给出 AI 作为第二读片人的前瞻部署数据,可了解其在真实筛查流程中的表现与局限。
Google Research 与 Beth Israel Deaconess Medical Center 合作开展了一项前瞻性单中心可行性研究,让对话式诊断 AI AMIE 在门诊预约前为患者采集病史,全程由医生通过视频通话监督。
推荐理由:原文给出 AMIE 在真实门诊的前瞻性可行性数据,读者可据此了解对话式医疗 AI 的安全监督方式与诊断表现。
Qwen 团队提出 Group Sequence Policy Optimization(GSPO)算法,基于序列似然定义重要性比率并做序列级裁剪、奖励和优化。
推荐理由:原文给出 GSPO 与 GRPO 在训练稳定性、效率和 MoE 场景下的对比,读者可据此理解 RL 扩展的算法取舍。
Qwen 团队发布 Chinese CLIP,采用两阶段预训练方法将 CLIP 迁移到中文,使用 LAION-5B 中文部分、Wukong 等公开数据集,图文对总量达 2 亿。
推荐理由:原文给出两阶段预训练方法和跨模态检索对比结果,读者可据此了解中文 CLIP 的迁移路径与数据构成。
Qwen 团队提出 OFA(One-For-All),一个统一理解与生成任务的统一多模态预训练模型,采用基于指令的多任务预训练,并开源了预训练和微调模型。OFA 统一了模态、架构和任务,用 VQ token 表示图像、用 bins 离散化边界框,预训练涵盖 8 个任务,包括视觉定位、图像描述、VQA、图文匹配、检测、图像补全和文本补全。
推荐理由:原文给出 OFA 的统一框架设计与 5 个尺寸的开源模型,读者可据此了解多模态统一模型的早期技术路线。