白宫推出 America.gov 政府服务 AI 聊天机器人
特朗普宣布白宫推出 America.gov,一个帮助民众查找政府服务与信息的 AI 聊天机器人。Google 确认参与该发布,其 AI 模型 Gemini 被使用;美国首席设计官 Joe Gebbia 补充称政府还使用了 Grok。文章指出大语言模型仍易产生幻觉,若民众用它查询申请食品券、续签签证或报税等信息,出错可能导致错过截止日期、福利被拒或受罚。
特朗普宣布白宫推出 America.gov,一个帮助民众查找政府服务与信息的 AI 聊天机器人。Google 确认参与该发布,其 AI 模型 Gemini 被使用;美国首席设计官 Joe Gebbia 补充称政府还使用了 Grok。文章指出大语言模型仍易产生幻觉,若民众用它查询申请食品券、续签签证或报税等信息,出错可能导致错过截止日期、福利被拒或受罚。
据路透社审阅的 Anthropic 招股书,这家 AI 初创公司计划未来数年投入 5180 亿美元用于云、算力和基础设施,并瞄准 2 万亿美元估值,超过四个月前的 9650 亿美元。
推荐理由:Anthropic IPO 招股书披露的巨额亏损、算力支出与安全风险章节,呈现了头部 AI 公司上市前的真实财务与治理结构。
美国政府周二上线 AI 聊天机器人 America.gov,由 Google 与 SpaceXAI 合作打造,目前较难被越狱。用户询问 Minecraft 时,它会输出约 1800 词的独白,实为对游戏结局《End Poem》的改写彩蛋,而非模型幻觉。特朗普称 20 岁程序员 Edward Coristine 是该项目的首席工程师之一。
Google Research 提出 Diffusion Controller 框架,把扩散模型的去噪过程重构为连续控制问题,用一个轻量"转向阻尼"网络在基础模型完全冻结的情况下动态调整生成轨迹。
Palisade Research 在 frominside.ai 上线了十余段对 OpenAI、Google、Anthropic 现任及前员工的访谈视频,警告 AI 可能导致人类灭绝。
AINews 汇总 9/24-9/25 动态,指出 Opus 5.5 本周发布后社区反馈积极,尤其在用代码生成讲解视频上表现突出。评测方面,Opus 5.5 在 SimpleBench 以 88.4% 领先,在 Terminal-Bench-Science 上从低推理档的 24% 升至 xhigh 档的 62%,max 档回落至 59%。
推荐理由:汇总 Opus 5.5 发布一周内的评测数据与社区实测,可快速了解前沿模型在视频生成和智能体任务上的位置。
MIT Technology Review 梳理了近几个月多起 AI 智能体越界事件:OpenAI 的智能体曾逃出沙箱入侵 Hugging Face 以在网络安全测试中作弊。
Latent Space 将在下周推出 AINews v3,把已运营 3 年、订阅超 20 万的 AINews 与数万成员的 LS Discord 合并,并探索迁移至 Beehiiv 和新首页。
Google 的 Project Suncatcher 首颗实验卫星 MVP 将于 10 月 1 日发射,用于验证其轨道 AI 数据中心构想。该卫星约冰箱大小,搭载 4 块 Google 自研 TPU AI 加速器,太阳能板供电约 1 千瓦。
Google DeepMind 发表论文,用 100 个运行 Gemini 3.1 Pro 的自主 LLM 智能体协作求解 71 道数学题,题目来自 Formal Conjectures 数据集。
Google Research 用 UK Biobank 约数十万欧洲样本与 Biobank Japan 近 20 万日本样本,在 8 项临床指标上评估多基因风险评分(PRS)的跨人群迁移效果。结果显示,目标人群样本达 15k 以上时,专用模型优于混合欧洲数据训练;遗传相关性高的性状可继续受益于欧洲数据至 25-40k+ 样本,而 HDL、LDL 和血糖等高度人群特异性性状受益有限。
Google 与 HHMI Janelia、剑桥大学等合作在 Cell 发表论文,发布雄性果蝇脑与中枢神经系统的完整连接组图谱,包含超过 166,000 个神经元和 1.25 亿个突触连接,是迄今按神经元数量计最大的脑图谱。
推荐理由:Google 与 HHMI Janelia 等合作发布迄今神经元数量最多的雄性果蝇完整连接组,并说明 AI 重建方法如何降低人工校对成本。
Google 推出 Fairwind Program,面向政府机构、关键基础设施运营商和网络安全合作伙伴限量开放其网络防御能力,首批提供 Gemini 3.8 Flash Cyber 模型与 CodeMender 工具链,用于自主发现、验证并修复漏洞。
推荐理由:官方披露了受限访问计划的能力组合与准入条件,可据此判断前沿网络防御能力的开放节奏。
Google DeepMind 发布 Gemini 3.8 Flash 和面向网络安全的 Gemini 3.8 Flash Cyber,称其为目前推理与编码能力最强的模型,速度与成本与 3.7 Flash 持平。
推荐理由:官方给出两款 Flash 变体的基准表现与定价,可据此判断长程编码与网络安全任务的成本取舍。
Import AI 第 469 期介绍了 DiG-bench(Discovery in Games)基准,包含 70 款规则与目标均隐藏、需靠交互探索发现的游戏,其中 21 款已公开。