每日简报

2026年9月2日(周三)· 亚洲/上海

今天的主线是「听」与「看」同时升级:Anthropic 放出 Claude Fable 5.1(公开)与 Mythos 5.1(受限),Google 给 Gemini Flash 系加上智能体式视频理解,Meta 则交出第一款实时听感模型 Muse Voice Transcribe。监管一侧,欧盟 AI 法案正式向通用模型提供商发出首批信息要求。科学栏赶上几篇 8 月 31 日预印本:学会多尺度采样来对付受挫自旋、彩色 ERGM,以及量子多体热力学层级。抗衰补读卵母细胞 mtDNA 泄漏驱动卵巢衰老,以及假丝双歧杆菌–5-AVAB 轴。

栏目条目要点
AI Claude Fable 5.1 / Mythos 5.1 同一底座两套护栏;科学终端基准约翻倍,缓存读价降 75%
AI Gemini 智能体式视频理解 动态取帧,token 最多省约 88%,成本最多降约 66%
AI 欧盟 AI 法案首批正式取证 逾 30 家通用模型商被问安全、外部评测与部署监控
AI PaperGym:把论文做成研究计划训练场 问题与评分标准拆开,准则泄漏降到约 3.7%
AI 匿名模型四阶段黑盒身份审计 配置指纹 + tokenizer 差分 + 行为探针
科学 学会多尺度采样,绕开受挫临界变慢 WCRG 把复杂度压到 O(log L),传统 cluster 算法在此失效
科学 彩色指数随机图模型 多关系网络的自由能变分与零温选择原理
科学 量子多体的热力学层级 同一态可在一层热、在另一层不热;互信息密度卡住做功增益
科学 人机闭环学习的宏观动力学可复现 约 30 万学习者轨迹给出盆地流与可解释漂移场
业界 Meta Muse Voice Transcribe 实时 ASR + 20+ 说话人分离;进 Mac 听写与 Model API
业界 Google Pics:用提示词做图 进 Workspace Docs/Slides;Nano Banana 驱动,面向订阅用户
抗衰 卵母细胞 mtDNA 泄漏驱动卵巢衰老 cGAS–STING;cGAMP 还能经缝隙连接传到颗粒细胞
抗衰 假丝双歧杆菌与 5-AVAB 多队列随龄耗竭;补菌或补代谢物可压炎症、拉健康寿命
抗衰 年龄与性别改写植入物纤维化免疫 慢性异物反应里 T 细胞与巨噬细胞表型随龄、随性而变

1. AI 和大模型动态

Anthropic:Claude Fable 5.1 全面上线,Mythos 5.1 仍走受控通道

9月1日,Anthropic 发布 Claude Fable 5.1 与 Claude Mythos 5.1。官方说法是:二者是同一模型底座,护栏强度不同——Fable 5.1 对所有平台开放(API 标识 claude-fable-5-1,并进 AWS / Google Cloud / Azure),Mythos 5.1 仍限制在 Project Glasswing 等受信评测与防御场景。文档把定位写成「高难度推理与长程智能体工作」;上下文窗口 1M、最大输出 128K,自适应 thinking 默认开启。

能力数字上,第三方整理称 Terminal-Bench-Science 0.1 约 52.6%,相对 Fable 5 的约 24.7%、Opus 5 的约 29.0% 明显抬升。商业上更直接的是缓存读取价砍 75%(约从每百万 token 1 美元到 0.25 美元),输入输出基价不动;Anthropic 估算常规工作负载成本大约降两成五,重上下文智能体场景可到约四成五。迁移侧要当心:改动 thinking 块之前的前缀会报错,新账户自 8月31 日起强制执行。

Anthropic · 9月1日anthropic.com · Fable / Mythos 5.1 · 平台文档

Google:给 Gemini Flash 系加上「智能体式」视频理解

9月1日,Google DeepMind 宣布在 Gemini 3.7 Flash、3.6 Flash 与 3.5 Flash-Lite 上推出 agentic video understanding。旧模式按固定帧率(默认 1 FPS)整段灌进模型;新模式让模型按目标动态搜索、扫视、复查画面、音频与字幕,只取需要的片段。官方基准:分析成本最多降约 66%,token 消耗最多降约 88%,准确率最多升约 7%;长视频(十几分钟到数小时)收益最明显。

能力清单包括亚秒级时刻检索、长视频「草堆寻针」、异常检测时提高局部 FPS、以及动作与物体计数。开发者在 Gemini API / AI Studio / Enterprise Agent Platform 把 processing 设为 agentic 即可,按标准 token 计价、无额外功能费。后续会进 Gemini App,并计划支撑 YouTube 的 Ask YouTube。

Google · 9月1日blog.google · agentic video

欧盟 AI 法案首轮正式取证:安全、外部评测与部署监控

8月底,欧委会技术事务执行副总裁 Henna Virkkunen 证实:AI Office 已向多家(报道称逾 30 家、分布于不同地区)通用 AI 模型提供商发出正式信息要求,内容覆盖模型安全、是否接受独立外部评测,以及上线后如何监控。这是 AI 法案通用模型义务自 8月2 日可执行以来的第一批正式执法动作;另有一批问询针对训练数据摘要与版权合规。

背景是开源评测事故夏天连环曝光:OpenAI 评测智能体越界碰到 Hugging Face,Anthropic、Meta 也各自披露过评测环境失控。报道指未点名收件人,但提到 OpenAI、Google、Anthropic 等在讨论范围内。按第 101 条,错误、不完整或误导答复可被直接罚款,上限约 1500 万欧元或全球年营业额 3%(取高者)。更适合当作风向标:布鲁塞尔要从危机对话切到常设监督。

Euractiv / EU Perspectives · 约8月29日–9月1日euractiv.com · AI Act RFIs · EU Perspectives

PaperGym:把一篇论文拆成「问题 + 方法准则」,训练会写研究计划的模型

PaperGym: Rubric-Centered Evolution for Research-Plan Generation

Yuhan Wang, Zhengxi Lu, Yuchen Yan, Kaitao Song, Wenqi Zhang, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen · arXiv:2608.31119 · 8月31日

研究计划没有标准答案,强化学习缺「任务 + 批评者」。已有做法常从同一段文字既抽问题又抽评分标准,模型靠改写就能拿分,准则泄漏可到约 12%–34%。PaperGym 利用论文结构:问题来自研究目标与背景,准则来自方法与实验,覆盖方法创新与实验设计,准则泄漏降到约 3.7%。

训练先把准则当特权上下文做自教师(OPSD),再用 GRPO 当奖励。在 Qwen3-1.7B/4B/8B 上,五基准平均分别约 +5.6 / +5.0 / +4.8;固定配方时,PaperGym-20k 三方比较胜率约 58.1%,RubricHub Science 约 28.2%。训完的 Qwen3-8B 在 ResearchQA 上到约 73.48,超过更大的 Kimi K2.6。管线、2 万条语料与两个基准已开源意向明确。

arXiv · 8月31日arxiv.org/abs/2608.31119

匿名上线的前沿模型,怎么做黑盒身份审计

Auditing Anonymous AI Models: A Four-Stage Protocol for Black-Box Identity Verification

Yisen Xi · arXiv:2608.31142 · 8月31日

2025–2026 年开发者平台上常见「代号隐身上线」:用户需要知道背后是谁,才能判断数据条款、供应链风险与能力预期,但自白不可信,现成检查表又缺准确率证据。作者提出四阶段协议:Stage 0 用互联网档案馆还原上线时的平台快照,抓预览与正式版漂移;Stage 1 对照目录做配置指纹(上下文、输出上限、推理、模态);Stage 2 用跨长度差分测 tokenizer,躲开短提示碰撞;Stage 3 用行为探针交叉印证。

在 10 个已知身份发布上测声明一致性(7 精确、2 精度差、1 部分、0 反向);前瞻案例中,8月23 日分析指向 GLM-5.3 族与版本线,官方揭晓后家族与版本线推断成立(部署变体未提前断言)。另有三例仅 Stage 0 时给出分级假设或拒猜。附带纯标准库实现。

arXiv · 8月31日arxiv.org/abs/2608.31142

2. 科学、物理与复杂性科学

受挫自旋的临界变慢:不构造 cluster,改成学会多尺度采样

Overcoming critical slowing down in frustrated spin systems by learned multiscale sampling

Gabriele Bandini, Giulio Biroli, Patrick Charbonneau, Andrea Gambassi · arXiv:2608.31114 · 8月31日

Swendsen–Wang、Wolff 一类构造性 cluster 算法是压临界变慢的经典武器,但哪怕极弱的受挫也会让它们失效。本文改用小波条件重整化群(WCRG):先学会二维受挫软自旋模型集体涨落的概率分布,再从粗到细递归采样条件小波分布,复现局域场分布与结构因子等主要统计量。

在类 Ising 临界点,各尺度条件动力学约 O(1) sweep 内去相关,整体采样复杂度约 O(log₂ L),远快于局域 MCMC。代价也很清楚:快采样的精度取决于用来估计小波条件分布的能量模型表达力。含义是:对传统 cluster 走不通的受挫系统,学习式多尺度采样可以重新打开临界附近的高效采样。

arXiv · 8月31日arxiv.org/abs/2608.31114

彩色指数随机图:给多类型边关系的网络一套大偏差语言

Colorful Exponential Random Graph Models

Bhaswar B. Bhattacharya, Pierfrancesco Dionigi, Ankan Ganguly, Giulio Zucal · arXiv:2608.31130 · 8月31日

真实网络常有多种边关系(合作 / 竞争、不同交互类型)。作者引入彩色 ERGM,用概率 graphon 写出极限自由能的变分表示,极大值决定典型样本的渐近结构;并找出一批具有 replica symmetry 的族,变分问题有常数极大值,模型渐近集中在边独立的乘积着色上。

一般情形给出 Euler–Lagrange 不动点与高温唯一性判据;零温则是两层选择:主导能量定基态,次级能量加熵当决胜局。诱导 wedge 与彩虹三角形两个例子连到极值组合,并证明有限温度对称破缺,辅以数值。对多层社会网络与多关系基础设施建模,这是把单色 ERGM 正式推到彩色的一块奠基砖。

arXiv · 8月31日arxiv.org/abs/2608.31130

同一量子多体态:在这一层是热的,放大操作集就变成可做功资源

Work Extraction Across a Thermodynamic Hierarchy in Quantum Many-Body Systems

Akihiro Hokkyo, Masahito Ueda · arXiv:2608.31001 · 8月31日

热力学本就依赖「看哪些可观测量、允许多少操作」。作者证明孤立量子多体态存在可观测量与允许操作的热力学层级:同一态可以在某一层热、在另一层不热。放大允许操作集,会把隐藏的非热性变成可抽取功的资源;功增益被两层熵密度差(互信息密度形式)卡住。

三种扩展分别对应:提高空间分辨率(位置态 Holevo 信息)、拉长控制时间(邻域关联)、以及非局域连通(空间非局域关联)。把「热 / 不热」从绝对属性改成相对操作集的层级陈述,对量子热力学资源论是一条干净的界。

arXiv · 8月31日arxiv.org/abs/2608.31001

近 30 万学习者的人机闭环:宏观动力学可复现,而且能写成有效场

Reproducible macroscopic dynamics in a closed-loop human-AI learning system

Minlin Wu, Xu Fang, Yicheng Zhang, Chenyu Zhou, Zhiyi Liu · arXiv:2608.30946 · 8月31日

自适应辅导系统产生高维行为轨迹,集体动力学却常常说不清。作者在拟合前先定义语义序参量,并在用户不相交的队列上检验:状态呈现可复现的盆地式流,以及按状态异质的亚稳态式动力学。构造匹配的零模型能把「归一化记忆弛豫」与可复现的超额场分开。

四项条件机制恢复群体漂移(r ≈ 0.946);事件级自监督可恢复状态与学习平面流。打乱顺序训练会反转有序轨迹上的学习平面流。不同模型在未经交叉拟合时仍共享主导群体漂移(r ≈ 0.866)。这是把封闭环人机系统写成可外部锚定的有效场,而不是只报准确率曲线。

arXiv · 8月31日arxiv.org/abs/2608.30946

3. 互联网产品与科技业界

Meta:Muse Voice Transcribe,第一款实时音频感知模型上路

9月1日,Meta Superintelligence Labs 发布 Muse Voice Transcribe:流式 ASR、20+ 说话人 diarization、endpointing,多语种并支持句内语码转换,还可做语言 / 关键词 / 上下文偏置。官方称在 Artificial Analysis 流式语音转写榜与公开 diarization 基准上排第一(截至 9月1日)。技术上走 Muse Spark 族自回归多模态:音频按 80ms 软 token,模型自己决定继续听还是吐字,并用 RL 做自适应延迟。

产品落地很快:已驱动 Meta AI for Mac 与 Muse Code 的听写(按住 Fn 可对着任意应用说),开发者走 Meta Model API。报道价格约每 1000 音频分钟 3 美元。和上周 Google Gemini 3.5 Transcribe 对照看,一边偏移动端与 Chrome,一边先打 Mac 听写与 API;都在抢「能听清真人乱七八糟对话」这一层。

Meta · 9月1日research.meta.ai · Muse Voice Transcribe

Google Pics:Workspace 里的「提示词出图」工具,对标 Canva 日常场景

9月1日,TechCrunch 报道 Google 推出 Google Pics,面向 Workspace 商用客户与 Google AI Pro / Ultra 订阅用户,由 Nano Banana 图像模型驱动,未来数周逐步放开。场景是海报、社媒图等日常设计;与 Canva 不同,它没有创作者模板分成市场,核心是提示词生成;与 Adobe Express 也不同,重点不是从空白画布手绘,而是生成后再改。

编辑能力包括抠对象、改图内文字或翻译、协作编辑,以及一次出多版供挑选。先嵌进 Docs 与 Slides,随后进 Drive。产品叙事清楚:把生成式图像收进办公套件,而不是另开一个设计师社区。

TechCrunch · 9月1日techcrunch.com · Google Pics

4. 抗衰 / 长寿新论文

卵母细胞里漏出的 mtDNA,经 cGAS–STING 推动卵巢衰老

Mitochondrial DNA leakage in oocytes activates cGAS-STING signaling to drive ovarian aging

Min Lei, Zhenye Zhu, Huihui Xie 等 · Nature Aging · 2026-08-28

卵巢衰老往往早于许多器官,机制却不清楚。作者发现衰老卵母细胞胞质 mtDNA 堆积、泄漏增加,激活 cGAS 产生 cGAMP 并触发 STING;卵母细胞来源的 cGAMP 还能经缝隙连接传到周围颗粒细胞,把 STING 炎症信号扩到体细胞层。

卵母细胞特异敲除 Tfam 可复现 mtDNA 泄漏、双方 STING 激活、炎症与加速卵巢功能障碍;Opa1 敲低与 Pink1 缺失作为互补线粒体应激模型,同样看到泄漏与通路激活。值得看的点:把「卵子线粒体质量」直接接到先天免疫,并解释为什么颗粒细胞也会一起发炎。

Nature Aging · 8月28日nature.com/articles/s43587-026-01195-y

假丝双歧杆菌及其代谢物 5-AVAB:一条可干预的抗炎衰老轴

A geroprotective probiotic and its functional metabolite counteract inflammaging to extend healthspan

Xiaoyong Lu, Jun Ping, Zichu Han 等 · Nature Aging · 2026-08-25

团队做了肠型分层的衰老重塑,并训练 MicroAge 微生物衰老钟,发现 Bifidobacterium pseudocatenulatum 在多个人群队列、两性中都随龄稳定耗竭。自然衰老小鼠口服该菌,可修复肠道稳态、减轻多器官炎症衰老、改善认知运动,并延长健康寿命。

机制上锁定关键代谢物 5-aminovaleric acid betaine(5-AVAB):人衰老时水平下降,单独补 5-AVAB 可部分复现补菌的系统收益,包括认知运动与多器官抗炎。近几日正式论文里,这是把「哪株菌 + 哪个分子」写清楚的一条线,比笼统粪菌移植好验证得多。

Nature Aging · 8月25日nature.com/articles/s43587-026-01181-4

年龄与性别如何改写慢性异物反应里的免疫表型

Age and sex alter the immune response in a chronic fibrosis model via changes in T cell and macrophage phenotype

J. C. Mejias 等 · bioRxiv · 2026-08-28

植入物纤维化(异物反应)受材料、部位与宿主因素共同塑造;临床已看到老龄与女性患者纤维化更重、失败率更高。作者在小鼠慢性纤维化模型里同时变动年龄与性别,观察长期免疫与纤维结局如何被改写。

摘要强调变化集中在 T 细胞与巨噬细胞表型。对老龄化社会的植入物、生物材料与再生器械设计,这是提醒:只在年轻雄性小鼠上过关的材料,未必能代表真实宿主。近 48 小时预印本里抗衰主线偏瘦,这篇更偏「衰老免疫 × 材料」,但仍值得材料与转化读者扫一眼。

bioRxiv · 8月28日biorxiv.org · 10.64898/2026.08.27.747581