原文发布 7月17日 23:00
Google DeepMind 发布 Gemini 3.5 Flash Cyber 网络安全模型
Google DeepMind 发布 Gemini 3.5 Flash Cyber,一个基于 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞,在 CyberGym 等基准上以多次调用取得接近更大模型的表现。
推荐理由:原文给出轻量网络安全模型在多个基准和 Google 内部代码库的实测结果,读者可据此判断专用小模型在漏洞挖掘上的性价比。
AI 安全与对齐:越狱与防御、模型行为研究、安全评测与治理框架的进展。
原文发布 7月17日 23:00
Google DeepMind 发布 Gemini 3.5 Flash Cyber,一个基于 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞,在 CyberGym 等基准上以多次调用取得接近更大模型的表现。
推荐理由:原文给出轻量网络安全模型在多个基准和 Google 内部代码库的实测结果,读者可据此判断专用小模型在漏洞挖掘上的性价比。
原文发布 7月16日 08:00
Hugging Face 披露本周检测到一起针对其部分生产基础设施的入侵,该攻击由一套自主 AI 智能体系统端到端驱动,通过数据集处理中的两条代码执行路径获得初始访问,随后提升权限、窃取云和集群凭证并在周末横向移动至多个内部集群。
推荐理由:Hugging Face 披露一次由自主 AI 智能体端到端驱动的入侵,并说明用开源模型做取证的原因。
原文发布 6月16日 23:46
Google DeepMind 发布 AI Control Roadmap,一套用于构建和管理 Google 内部部署的高级 AI 的框架,采用纵深防御思路,在模型对齐之外增加系统级安全层。
推荐理由:Google DeepMind 公开内部 AI Control Roadmap,说明如何在模型对齐不完美时用系统级监控兜底。
原文发布 5月17日 21:43
Google 宣布把内容透明度与验证工具扩展到 Search、Gemini、Chrome、Pixel 和 Cloud。SynthID 已为超过 1000 亿张图片和视频、6 万年音频加上水印,Gemini 应用中的 SynthID 验证已被使用 5000 万次,并将在未来几周进入 Search 和 Chrome。
推荐理由:Google 把 SynthID 与 C2PA 验证铺到搜索、Gemini 和 Chrome,读者可了解内容溯源工具的实际覆盖范围。
原文发布 3月31日 10:03
Google Quantum AI 发布白皮书,称未来量子计算机破解保护加密货币的椭圆曲线密码所需的量子比特和门数比此前认为的更少。
推荐理由:Google Quantum AI 给出破解 ECDLP-256 所需量子资源的新估算,并说明如何在不泄露攻击细节的前提下公开漏洞。
原文发布 9月23日 04:00
Qwen 发布 Qwen 系列首个安全护栏模型 Qwen3Guard,基于 Qwen3 基础模型微调,可对提示词和回复做安全检测并给出风险等级与分类。它提供 Qwen3Guard-Gen 和 Qwen3Guard-Stream 两个变体,后者通过 Transformer 末层两个轻量分类头实现逐 token 的实时流式检测,两者均有 0.6B、4B、8B 三种规模。
推荐理由:原文给出两种安全护栏变体的能力差异与开源入口,读者可据此判断流式审核在部署中的取舍。