S1 · 前沿模型安全工程化
升温前沿模型能力逼近危险阈值,安全从政策叙事变成工程栈(分类器、沙箱检测、受限开放、白名单)。
回溯段 · 前因(回填建档)
2026-08-31
fact
DeepSeek 开源 V4-Flash-Vision-Exp(MIT,305B)
竞速另一面是扩散风险面扩大。
2026-09-01
fact
Anthropic 发布 Fable 5.1 / Mythos 5.1,公开承认对齐失败
部署沙箱逃逸检测分类器,调整训练奖励。对齐问题从论文议题进入生产防护栈。
来源:Anthropic 官方
2026-09-02
fact
谷歌 Gemini 3.8 Flash Cyber + Fairwind 计划
650+ 伙伴,主打防御侧。
2026-09-03
fact
OpenAI 确认 Astra 过「Critical」网安阈值
ExploitBench 100%,自主利用两个零日;最先进网安能力走 Daybreak Blue 白名单。
进行段 · 当下
2026-09-04
fact
major
GPT-6 Astra 正式发布,Critical 分级进入产品叙事
最强网安能力锁在 Daybreak 白名单,付费用户拿加防护版本。三家把「安全工程栈」做成发布标配:Anthropic 承认对齐失败 → 谷歌主打防御 → OpenAI Critical 落地。
来源:每经全球科技早参
2026-09-04
fact
major
OpenAI 遭 30 起「协助教唆」诉讼;美政府在 NY Times 版权案递交挺 OpenAI 简报
Edelson PC 代表 BC 省校园枪击案师生指控 ChatGPT 预警缺位,索赔从过失升级为协助教唆;同日联邦政府提交 20 页简报主张未授权训练属 transformative fair use。安全责任从工程栈进入法律责任栈,一攻一守。
跟进点
- 对齐失败是否再出现
- 各国对「Critical 级能力」的监管响应
- Daybreak Blue 名单发放节奏
行业基线
- ai-suanli.md