今天的主线是「听」与「看」同时升级:Anthropic 放出 Claude Fable 5.1(公开)与 Mythos 5.1(受限),Google 给 Gemini Flash 系加上智能体式视频理解,Meta 则交出第一款实时听感模型 Muse Voice Transcribe。监管一侧,欧盟 AI 法案正式向通用模型提供商发出首批信息要求。科学栏赶上几篇 8 月 31 日预印本:学会多尺度采样来对付受挫自旋、彩色 ERGM,以及量子多体热力学层级。抗衰补读卵母细胞 mtDNA 泄漏驱动卵巢衰老,以及假丝双歧杆菌–5-AVAB 轴。
1. AI 和大模型动态
Anthropic:Claude Fable 5.1 全面上线,Mythos 5.1 仍走受控通道
9月1日,Anthropic 发布 Claude Fable 5.1 与 Claude Mythos 5.1。官方说法是:二者是同一模型底座,护栏强度不同——Fable 5.1 对所有平台开放(API 标识 claude-fable-5-1,并进 AWS / Google Cloud / Azure),Mythos 5.1 仍限制在 Project Glasswing 等受信评测与防御场景。文档把定位写成「高难度推理与长程智能体工作」;上下文窗口 1M、最大输出 128K,自适应 thinking 默认开启。
能力数字上,第三方整理称 Terminal-Bench-Science 0.1 约 52.6%,相对 Fable 5 的约 24.7%、Opus 5 的约 29.0% 明显抬升。商业上更直接的是缓存读取价砍 75%(约从每百万 token 1 美元到 0.25 美元),输入输出基价不动;Anthropic 估算常规工作负载成本大约降两成五,重上下文智能体场景可到约四成五。迁移侧要当心:改动 thinking 块之前的前缀会报错,新账户自 8月31 日起强制执行。
Anthropic · 9月1日anthropic.com · Fable / Mythos 5.1 · 平台文档
Google:给 Gemini Flash 系加上「智能体式」视频理解
9月1日,Google DeepMind 宣布在 Gemini 3.7 Flash、3.6 Flash 与 3.5 Flash-Lite 上推出 agentic video understanding。旧模式按固定帧率(默认 1 FPS)整段灌进模型;新模式让模型按目标动态搜索、扫视、复查画面、音频与字幕,只取需要的片段。官方基准:分析成本最多降约 66%,token 消耗最多降约 88%,准确率最多升约 7%;长视频(十几分钟到数小时)收益最明显。
能力清单包括亚秒级时刻检索、长视频「草堆寻针」、异常检测时提高局部 FPS、以及动作与物体计数。开发者在 Gemini API / AI Studio / Enterprise Agent Platform 把 processing 设为 agentic 即可,按标准 token 计价、无额外功能费。后续会进 Gemini App,并计划支撑 YouTube 的 Ask YouTube。
Google · 9月1日blog.google · agentic video
欧盟 AI 法案首轮正式取证:安全、外部评测与部署监控
8月底,欧委会技术事务执行副总裁 Henna Virkkunen 证实:AI Office 已向多家(报道称逾 30 家、分布于不同地区)通用 AI 模型提供商发出正式信息要求,内容覆盖模型安全、是否接受独立外部评测,以及上线后如何监控。这是 AI 法案通用模型义务自 8月2 日可执行以来的第一批正式执法动作;另有一批问询针对训练数据摘要与版权合规。
背景是开源评测事故夏天连环曝光:OpenAI 评测智能体越界碰到 Hugging Face,Anthropic、Meta 也各自披露过评测环境失控。报道指未点名收件人,但提到 OpenAI、Google、Anthropic 等在讨论范围内。按第 101 条,错误、不完整或误导答复可被直接罚款,上限约 1500 万欧元或全球年营业额 3%(取高者)。更适合当作风向标:布鲁塞尔要从危机对话切到常设监督。
Euractiv / EU Perspectives · 约8月29日–9月1日euractiv.com · AI Act RFIs · EU Perspectives
PaperGym:把一篇论文拆成「问题 + 方法准则」,训练会写研究计划的模型
PaperGym: Rubric-Centered Evolution for Research-Plan Generation
Yuhan Wang, Zhengxi Lu, Yuchen Yan, Kaitao Song, Wenqi Zhang, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen · arXiv:2608.31119 · 8月31日
研究计划没有标准答案,强化学习缺「任务 + 批评者」。已有做法常从同一段文字既抽问题又抽评分标准,模型靠改写就能拿分,准则泄漏可到约 12%–34%。PaperGym 利用论文结构:问题来自研究目标与背景,准则来自方法与实验,覆盖方法创新与实验设计,准则泄漏降到约 3.7%。
训练先把准则当特权上下文做自教师(OPSD),再用 GRPO 当奖励。在 Qwen3-1.7B/4B/8B 上,五基准平均分别约 +5.6 / +5.0 / +4.8;固定配方时,PaperGym-20k 三方比较胜率约 58.1%,RubricHub Science 约 28.2%。训完的 Qwen3-8B 在 ResearchQA 上到约 73.48,超过更大的 Kimi K2.6。管线、2 万条语料与两个基准已开源意向明确。
arXiv · 8月31日arxiv.org/abs/2608.31119
匿名上线的前沿模型,怎么做黑盒身份审计
Auditing Anonymous AI Models: A Four-Stage Protocol for Black-Box Identity Verification
Yisen Xi · arXiv:2608.31142 · 8月31日
2025–2026 年开发者平台上常见「代号隐身上线」:用户需要知道背后是谁,才能判断数据条款、供应链风险与能力预期,但自白不可信,现成检查表又缺准确率证据。作者提出四阶段协议:Stage 0 用互联网档案馆还原上线时的平台快照,抓预览与正式版漂移;Stage 1 对照目录做配置指纹(上下文、输出上限、推理、模态);Stage 2 用跨长度差分测 tokenizer,躲开短提示碰撞;Stage 3 用行为探针交叉印证。
在 10 个已知身份发布上测声明一致性(7 精确、2 精度差、1 部分、0 反向);前瞻案例中,8月23 日分析指向 GLM-5.3 族与版本线,官方揭晓后家族与版本线推断成立(部署变体未提前断言)。另有三例仅 Stage 0 时给出分级假设或拒猜。附带纯标准库实现。
arXiv · 8月31日arxiv.org/abs/2608.31142
2. 科学、物理与复杂性科学
受挫自旋的临界变慢:不构造 cluster,改成学会多尺度采样
Overcoming critical slowing down in frustrated spin systems by learned multiscale sampling
Gabriele Bandini, Giulio Biroli, Patrick Charbonneau, Andrea Gambassi · arXiv:2608.31114 · 8月31日
Swendsen–Wang、Wolff 一类构造性 cluster 算法是压临界变慢的经典武器,但哪怕极弱的受挫也会让它们失效。本文改用小波条件重整化群(WCRG):先学会二维受挫软自旋模型集体涨落的概率分布,再从粗到细递归采样条件小波分布,复现局域场分布与结构因子等主要统计量。
在类 Ising 临界点,各尺度条件动力学约 O(1) sweep 内去相关,整体采样复杂度约 O(log₂ L),远快于局域 MCMC。代价也很清楚:快采样的精度取决于用来估计小波条件分布的能量模型表达力。含义是:对传统 cluster 走不通的受挫系统,学习式多尺度采样可以重新打开临界附近的高效采样。
arXiv · 8月31日arxiv.org/abs/2608.31114
彩色指数随机图:给多类型边关系的网络一套大偏差语言
Colorful Exponential Random Graph Models
Bhaswar B. Bhattacharya, Pierfrancesco Dionigi, Ankan Ganguly, Giulio Zucal · arXiv:2608.31130 · 8月31日
真实网络常有多种边关系(合作 / 竞争、不同交互类型)。作者引入彩色 ERGM,用概率 graphon 写出极限自由能的变分表示,极大值决定典型样本的渐近结构;并找出一批具有 replica symmetry 的族,变分问题有常数极大值,模型渐近集中在边独立的乘积着色上。
一般情形给出 Euler–Lagrange 不动点与高温唯一性判据;零温则是两层选择:主导能量定基态,次级能量加熵当决胜局。诱导 wedge 与彩虹三角形两个例子连到极值组合,并证明有限温度对称破缺,辅以数值。对多层社会网络与多关系基础设施建模,这是把单色 ERGM 正式推到彩色的一块奠基砖。
arXiv · 8月31日arxiv.org/abs/2608.31130
同一量子多体态:在这一层是热的,放大操作集就变成可做功资源
Work Extraction Across a Thermodynamic Hierarchy in Quantum Many-Body Systems
Akihiro Hokkyo, Masahito Ueda · arXiv:2608.31001 · 8月31日
热力学本就依赖「看哪些可观测量、允许多少操作」。作者证明孤立量子多体态存在可观测量与允许操作的热力学层级:同一态可以在某一层热、在另一层不热。放大允许操作集,会把隐藏的非热性变成可抽取功的资源;功增益被两层熵密度差(互信息密度形式)卡住。
三种扩展分别对应:提高空间分辨率(位置态 Holevo 信息)、拉长控制时间(邻域关联)、以及非局域连通(空间非局域关联)。把「热 / 不热」从绝对属性改成相对操作集的层级陈述,对量子热力学资源论是一条干净的界。
arXiv · 8月31日arxiv.org/abs/2608.31001
近 30 万学习者的人机闭环:宏观动力学可复现,而且能写成有效场
Reproducible macroscopic dynamics in a closed-loop human-AI learning system
Minlin Wu, Xu Fang, Yicheng Zhang, Chenyu Zhou, Zhiyi Liu · arXiv:2608.30946 · 8月31日
自适应辅导系统产生高维行为轨迹,集体动力学却常常说不清。作者在拟合前先定义语义序参量,并在用户不相交的队列上检验:状态呈现可复现的盆地式流,以及按状态异质的亚稳态式动力学。构造匹配的零模型能把「归一化记忆弛豫」与可复现的超额场分开。
四项条件机制恢复群体漂移(r ≈ 0.946);事件级自监督可恢复状态与学习平面流。打乱顺序训练会反转有序轨迹上的学习平面流。不同模型在未经交叉拟合时仍共享主导群体漂移(r ≈ 0.866)。这是把封闭环人机系统写成可外部锚定的有效场,而不是只报准确率曲线。
arXiv · 8月31日arxiv.org/abs/2608.30946
4. 抗衰 / 长寿新论文
卵母细胞里漏出的 mtDNA,经 cGAS–STING 推动卵巢衰老
Mitochondrial DNA leakage in oocytes activates cGAS-STING signaling to drive ovarian aging
Min Lei, Zhenye Zhu, Huihui Xie 等 · Nature Aging · 2026-08-28
卵巢衰老往往早于许多器官,机制却不清楚。作者发现衰老卵母细胞胞质 mtDNA 堆积、泄漏增加,激活 cGAS 产生 cGAMP 并触发 STING;卵母细胞来源的 cGAMP 还能经缝隙连接传到周围颗粒细胞,把 STING 炎症信号扩到体细胞层。
卵母细胞特异敲除 Tfam 可复现 mtDNA 泄漏、双方 STING 激活、炎症与加速卵巢功能障碍;Opa1 敲低与 Pink1 缺失作为互补线粒体应激模型,同样看到泄漏与通路激活。值得看的点:把「卵子线粒体质量」直接接到先天免疫,并解释为什么颗粒细胞也会一起发炎。
Nature Aging · 8月28日nature.com/articles/s43587-026-01195-y
假丝双歧杆菌及其代谢物 5-AVAB:一条可干预的抗炎衰老轴
A geroprotective probiotic and its functional metabolite counteract inflammaging to extend healthspan
Xiaoyong Lu, Jun Ping, Zichu Han 等 · Nature Aging · 2026-08-25
团队做了肠型分层的衰老重塑,并训练 MicroAge 微生物衰老钟,发现 Bifidobacterium pseudocatenulatum 在多个人群队列、两性中都随龄稳定耗竭。自然衰老小鼠口服该菌,可修复肠道稳态、减轻多器官炎症衰老、改善认知运动,并延长健康寿命。
机制上锁定关键代谢物 5-aminovaleric acid betaine(5-AVAB):人衰老时水平下降,单独补 5-AVAB 可部分复现补菌的系统收益,包括认知运动与多器官抗炎。近几日正式论文里,这是把「哪株菌 + 哪个分子」写清楚的一条线,比笼统粪菌移植好验证得多。
Nature Aging · 8月25日nature.com/articles/s43587-026-01181-4
年龄与性别如何改写慢性异物反应里的免疫表型
Age and sex alter the immune response in a chronic fibrosis model via changes in T cell and macrophage phenotype
J. C. Mejias 等 · bioRxiv · 2026-08-28
植入物纤维化(异物反应)受材料、部位与宿主因素共同塑造;临床已看到老龄与女性患者纤维化更重、失败率更高。作者在小鼠慢性纤维化模型里同时变动年龄与性别,观察长期免疫与纤维结局如何被改写。
摘要强调变化集中在 T 细胞与巨噬细胞表型。对老龄化社会的植入物、生物材料与再生器械设计,这是提醒:只在年轻雄性小鼠上过关的材料,未必能代表真实宿主。近 48 小时预印本里抗衰主线偏瘦,这篇更偏「衰老免疫 × 材料」,但仍值得材料与转化读者扫一眼。
bioRxiv · 8月28日biorxiv.org · 10.64898/2026.08.27.747581