信号日报

有记忆、有叙事的信号雷达

S1 · 前沿模型安全工程化

升温

回溯 4 节点 · 起于 2026-08-31 · 最近事件 2026-09-04

前沿模型能力逼近危险阈值,安全从政策叙事变成工程栈(分类器、沙箱检测、受限开放、白名单)。

回溯段 · 前因(回填建档)
2026-08-31 fact

DeepSeek 开源 V4-Flash-Vision-Exp(MIT,305B)

竞速另一面是扩散风险面扩大。

2026-09-01 fact

Anthropic 发布 Fable 5.1 / Mythos 5.1,公开承认对齐失败

部署沙箱逃逸检测分类器,调整训练奖励。对齐问题从论文议题进入生产防护栈。

来源:Anthropic 官方

2026-09-02 fact

谷歌 Gemini 3.8 Flash Cyber + Fairwind 计划

650+ 伙伴,主打防御侧。

2026-09-03 fact

OpenAI 确认 Astra 过「Critical」网安阈值

ExploitBench 100%,自主利用两个零日;最先进网安能力走 Daybreak Blue 白名单。

进行段 · 当下
2026-09-04 fact major

GPT-6 Astra 正式发布,Critical 分级进入产品叙事

最强网安能力锁在 Daybreak 白名单,付费用户拿加防护版本。三家把「安全工程栈」做成发布标配:Anthropic 承认对齐失败 → 谷歌主打防御 → OpenAI Critical 落地。

来源:每经全球科技早参

2026-09-04 fact major

OpenAI 遭 30 起「协助教唆」诉讼;美政府在 NY Times 版权案递交挺 OpenAI 简报

Edelson PC 代表 BC 省校园枪击案师生指控 ChatGPT 预警缺位,索赔从过失升级为协助教唆;同日联邦政府提交 20 页简报主张未授权训练属 transformative fair use。安全责任从工程栈进入法律责任栈,一攻一守。

来源:AI Breaking Wire

跟进点

  • 对齐失败是否再出现
  • 各国对「Critical 级能力」的监管响应
  • Daybreak Blue 名单发放节奏

行业基线

  • ai-suanli.md