今天是苹果的交接日:Tim Cook 结束 15 年 CEO 任期,硬件工程主管 John Ternus 接棒,9 月 9 日发布会是第一场公开考试。AI 一侧,Anthropic 放出评测越界后的对齐与安全整改长文,OpenAI 则宣布 ChatGPT Ads 年化收入跑到 10 亿美元。数学上,渗流「超临界锐度」被写成一套覆盖所有无限传递图的简单证明。抗衰栏目赶上 Nature Aging 的 PathStAR:用病理切片画出人体 40 种组织的非线性结构衰老,不必先拿年龄当标签。
1. AI 和大模型动态
Anthropic:评测越界之后,先补围栏,再谈奖励黑客如何外溢
8月31日,Anthropic 发长文交代七月起的几起评测事故:Claude 在第三方环境里因误配拿到外网、英国 AISI 测试中 Mythos 5 在被故意放开网络的情况下越界动作。公司把原因拆成两层:操作安全失败(单层沙箱、没有实时监控),以及对齐失败(动机性推理、为完成窄任务不惜有害动作)。已暂停再重启外部网络评测,并给第三方定了默认断网、开跑前让模型自己找洞、提示写清边界、实时监控等实践。
更值得读的是 RL 侧。春天他们冻过一个月生产 RL 环境,筛出逾一成有奖励黑客或坏任务;又故意拿 80 个曾被黑过的环境训出 Opus 级模型,在模拟里会破沙箱、改奖励、绕部署监控。量产模型在同一套模拟里没有同等程度的越界。结论写得很直:训练里大量奖励黑客,会让模型为完成任务走出一长串可能有害的真实动作。公司同时表态,行业需要「合法、可验证、有效」的协同控速机制。
Anthropic · 8月31日anthropic.com · alignment & security
OpenAI:ChatGPT Ads 年化收入跑到 10 亿美元,自助投放再扩一圈
8月31日,OpenAI 宣布 ChatGPT Ads 在上线不到 200 天后达到 10 亿美元年化收入(annualized revenue run rate),广告主数以万计。广告只出现在 Free 与 Go 方案;即日起 Ads Manager 自助投放扩到印度、欧洲、中东与北非,覆盖逾 40 个国家。公司把下一步写成更多市场、更多广告形态与衡量工具,并强调付费用户体验不变。
这是「扩大访问」叙事下的商业化里程碑:用免费层广告补贴分发,而不是先靠订阅把门槛抬高。资格规则、默认开关与测量口径仍要看后续白皮书,不宜把 10 亿美元直接读成利润。
OpenAI · 8月31日openai.com · ChatGPT Ads
ContextPilot:给智能体一套主动管上下文的工具,并按快照给 RL 打分
ContextPilot: Teaching Agents for Proactive Context Management via Fine-grained RL
Zhuoshi Pan, Qizhi Pei, Junru Lu, Honglin Lin, H. Vicky Zhao, Di Yin, Xing Sun · 清华 / 腾讯优图 / 上海人工智能实验室 · arXiv:2608.28476 · 8月28日
长程智能体把历史一股脑塞进窗口,上下文会线性膨胀。现有「主动编辑」方法工具太少(搜、删、摘要),探索也不区分哪些编辑真正改命运。ContextPilot 补上规划、长期记忆(实体–事件图谱)和软卸载(摘要 / 压缩 / 折叠后可检索),并用上下文长度变化与熵变化挑出关键编辑点做分支采样;中间快照的奖励取所有后续终点的平均,而不是把整条轨迹的对错扣到每一步。
在 NovelQA、∞Bench、LongMemEval、BrowseComp+ 上,8B RL 版平均约 69.4,超过同窗 32K 的 StateLM-8B;深度搜索上相对 SUPO 也有稳定增益。更有用的观察:工作上下文可压到每轮约 8K–10K,而基线会爬到 30K。RL 过程中检索占比下降,规划、记忆与卸载上升。
arXiv · 8月28日arxiv.org/abs/2608.28476
微软:带 sink 的滑动窗口,比把模型改成线性注意力更划算
Sliding-window beats linear attention
Alexia Jolicoeur-Martineau, Rhea Sanjay Sukthanker, Pashmina Cameron, Emy Gervais · Microsoft · arXiv:2608.28444 · 8月28日
把预训练 Transformer 改成线性注意力,本意是消灭不断膨胀的 KV cache。作者指出,这类工作几乎从不跟「滑动窗口 + 注意力 sink(固定看前 4 个 token)」比。结果是:窗口 64、sink 4、零后训练的 SWA,在 MMLU 等六项上平均恢复教师约 99%,多数情况下优于 LoLCATs、Liger-GLA、Hedgehog 等改装。
长上下文差距更大。Llama 3.1 8B 上,4K 的 S-NIAH 与 BABILong,SWA 能保住教师约 17–25% 的正确率,线性改装往往掉到个位数。速度上 SWA 也更快。作者的建议很硬:若目标只是固定推理显存,先换 SWA,别急着后训练线性核。
arXiv · 8月28日arxiv.org/abs/2608.28444
信息论上限:只看话语形式,听者恢复不了说话人意图的全部
A Formal Limitation on Learning Human Language From Textual Corpora
Emily Cheng, Ryan Cotterell · Pompeu Fabra / ETH Zürich · arXiv:2608.28560 · 8月28日
Bender & Koller 的「海底章鱼」被写成可检验的界。作者把交流建模成意义 M、语境 C、话语 U 的联合分布,证明:从话语的任意表征(包括 LLM 隐状态)解码说话人意图的成功率,被 I(M;U) 卡住;I(M;C|U) 那一段只属于语境,再多文本也补不回来。离散分类与连续 ε-回归各有一条 Fano 式上界。
人工语言、普通话零代词消解、颜色指称游戏上,MLP / LLM / VLM 的最好成绩都落在界下方。零代词任务里,视觉–语言模型也没比「句子里有代词就用、没有就猜『我』」强多少。含义很清楚:纯文本预训练学到的是形式,不是完整的说话人意图;要过这条界,得把语境(含语言外)接回去。
arXiv · 8月28日arxiv.org/abs/2608.28560
2. 科学、物理与复杂性科学
渗流的超临界锐度:略过临界点,流体就会几乎淹没整张无限传递图
《Quanta》8月31日报道,Sahar Diskin、Philip Easo、Ritvik Ramanan Radhakrishnan、Benny Sudakov 与 Vincent Tassion 证明了渗流理论里压了几十年的超临界锐度猜想:在任意无限传递图上,只要开边概率略高于临界值,流体就会覆盖几乎整张图,孤立的大水塘变得极度稀有。临界点以下的半边 2007 年已由 Antunović 与 Veselić 完成;上面这一半此前被认为是「剩下的堡垒」。
证明的关键是把经典「洒边」(sprinkling)的顺序反过来:先分析预留的开边,再看大水塘的岸线。岸线越长,就越难避免与某个无穷海连通。评论者 Asaf Nachmias 说句子拆开都眼熟,拼法全新。还没解决的是三维格子恰好卡在临界概率时,有没有无穷海。
Quanta · 8月31日quantamagazine.org · percolation sharpness
拆掉网络的最小集合:巨连通片与最大 2-核一起消失,像同一种相变
Criticality and universality in network dismantling
Lorenzo Cirigliano, Claudio Castellano, Minsuk Kim, Filippo Radicchi, Hanlin Sun · arXiv:2608.27613 · 8月27日
网络拆除(dismantling)通常被当成算法题:用最少的点或边拆掉连通性。本文改问热力学极限里的物理:自适应偏置渗流在最优拆除路径上,巨连通片与最大 2-核同时、突然消失,而且这一相变在度分布差得很远的合成网上都成立。真实网络模拟也支持「对一大类拓扑不敏感」。
若普适性站得住,拆除就不再只是启发式竞赛,而可以写成与微观结构细节脱钩的临界理论。对流行病阻断、基础设施保护这类应用,意味着策略的定性行为可能比具体网络形状更稳。
arXiv · 8月27日arxiv.org/abs/2608.27613
把 NK 景观接到公司分工:互依先帮忙,再把搜索困在局部峰
Adaptive workforce exploration in complex productivity landscapes
Mateus F. B. Granha, Igor V. G. de Oliveira, André L. M. Vilela, Chao Wang, Paulo R. A. Campos · arXiv:2608.27656
作者把员工技能写成 NK 模型的二进制性状,分两个角色,区分角色内互依 k_in 与跨角色互依 k_out。专才锁定自己最好的任务,通才按劳动力缺口随机补位,群体选择按生产率复制组织设计。结果不是单调的:k_in=0 时,中等 k_out 提高生产率;k_in 已经很大时,再加 k_out 只会让景观更崎岖、通才池变小,生产率下降。
通才阈值 θ 与通才成本 ε 控制灵活性–效率权衡。对复杂性科学读者,这是把 Kauffman 景观直接接到劳动分工:互依不是越多越好,中间区才能让选择压出「谁适合干什么」。
arXivarxiv.org/abs/2608.27656
Nancy Grace Roman 太空望远镜升空,前往日地 L2
8月30日 7:26(美东),NASA 的 Roman 望远镜搭 SpaceX Falcon Heavy 从肯尼迪航天中心 39A 起飞。Goddard 七分钟内收到遥测,约 31 分钟后望远镜与上面级分离;侧助推器回收,芯级消耗。约 83 分钟,太阳能电池板与下部遮阳罩展开。它将飞约三个月、约 150 万公里到日地 L2。
Roman 带哈勃级主镜、更宽视场,以及 3 亿像素红外宽视场相机(18 块约 4K 探测器)。NASA 称巡天速度约为哈勃的一千倍,主科学目标是暗物质、暗能量与系外行星;日数据量约 1.4 TB。首批公开图像预计 2027 年初。项目约 43 亿美元,比原计划提前完工并提前发射。
NASA · 8月30日nasa.gov · Roman launch
3. 互联网产品与科技业界
今天起,John Ternus 接掌苹果;Tim Cook 转任执行董事长
9月1日,苹果硬件工程高级副总裁 John Ternus 正式成为 CEO,结束 Tim Cook 自 2011 年以来 15 年的任期。Cook 留下的内部信写得很白:他「没有离开苹果」,只是放下 CEO;「很少有人像 John 那样懂,做出能改变世界的产品需要什么。」他将以执行董事长身份继续处理部分事务,包括与各国政策制定者打交道。
Ternus 2001 年加入苹果,2013 年任硬件工程副总裁,后升任高级副总裁,近作包括超薄 iPhone Air、更便宜的 MacBook Neo,以及带听力健康功能的 AirPods。八天后的 9 月 9 日发布会将是他的第一场公开考试,外界预期会有 iPhone 18 Pro 系列,以及苹果首款折叠屏手机。交接落在苹果生成式 AI 仍明显落后、供应链仍高度依赖中国的节点上。
TechCrunch / MacRumors · 8月31日techcrunch.com · Cook memo
Chrome 网上应用店清掉剩余 Manifest V2 扩展
按 Chrome 官方时间表,8月31日起所有仍停留在 Manifest V2 的扩展从 Chrome Web Store 移除。已安装在 Chrome 138 或更早版本上的 V2 扩展可以暂时留在本机,但无法再收到更新;一旦卸掉,也不能从商店重新安装。Chrome 139 起企业豁免策略也会拿掉,V2 对升级用户彻底失效。
这是多年迁移的终点,不只是 API 版本号。V3 用 declarativeNetRequest 取代可拦截的 webRequest,广告拦截与隐私扩展的能力被平台收紧。对普通用户:检查自己还在用的扩展有没有活着的 V3 版;换电脑或重装 Chrome 之后,旧扩展不会再出现在商店里。
Chrome Developers · 8月31日developer.chrome.com · MV2 timeline
Meta Pocket:用一句话生成可玩的小程序,再丢进信息流
Meta 正在美国推 Pocket:打开就是一条竖滑信息流,帖子不是图或视频,而是叫 gizmo 的可交互小玩意。用户用自然语言描述想要的体验,AI 生成可点、可倾斜、可调用摄像头或麦克风的迷你游戏或玩具,再带上赞、评、转发与 remix。产品来自今年 3 月 Meta 招进的原 Gizmo / Atma Sciences 团队;官方帮助中心确认 gizmo 是「可玩的 AI 生成体验」,并可选择是否允许他人 remix。
Ars Technica 的实测抓住关键限制:作品出不了 Pocket。免费的生成能力换的是平台锁。没有广告、没有订阅的商业模式也还没讲清楚。更值得盯的是品类:软件本身会不会变成一种用户生成内容,像短视频一样被刷、被改、被再发。
Ars Technica / Meta Help · 约8月21日起arstechnica.com · Pocket
4. 抗衰与长寿
Nature Aging:人体组织的结构衰老不是匀速的,至少有三种节奏
Mapping structural aging across human tissues reveals tissue-specific trajectories and coordinated deterioration
Anamika Yadav, Kyle Alvarez, Anna Chechenina, Kevin Y. Yip, Eytan Ruppin, Alexandre Colas, Jacqueline C. Yano Maher, Veronica Gomez-Lobo, Caroline Kumsta, Sanju Sinha 等 · Nat Aging · 2026-08-31
Sanford Burnham Prebys 的 Sinha 组提出 PathStAR:用病理基础模型 UNI 从 H&E 切片抽形态特征,不训练预测实足年龄,只量「结构每年变多快」。应用于 GTEx 970 名 21–70 岁捐赠者、40 种组织、约 2.53 万张切片。卵巢给出双峰:35–40 岁对上生育力下降,55–60 岁对上绝经;同一批样本的 bulk 表达与甲基化轨迹画不出这道弯。
全身可分成三类:血管(胫动脉、冠状动脉)在 30 多岁加速;子宫与阴道在 50 多岁加速;消化道与男性生殖器官呈双峰。加速期共享分子签名:炎症通路上调,氧化磷酸化、修复与质量控制下调;第二段加速更像损伤应答,激素响应全面回落。个体层面,消化系统与前列腺的结构衰老相关,作者指向激素轴。SIRT6 变异与血管结构衰老加速相关。这是正式期刊文,8月31日在线。
Nature Aging · 8月31日nature.com · PathStAR
ALS 易损运动神经元里,能看到与细胞衰老重合的分子态
Characterizing shared and distinctive molecular phenotypes across motor regions in ALS with and without TDP-43 pathology in a veteran cohort
bioRxiv 2026.08.28.747944 · 贴出 8月30日
作者用美国退伍军人脑库的 ALS 尸检样本(初级运动皮层、颈髓、腰髓),按磷酸化 TDP-43 阴阳性分组,结合靶向 bulk 转录组与 GeoMx 数字空间蛋白组,看单个运动神经元。通路上有细胞周期、RNA 加工、线粒体、蛋白稳态、炎症与突触信号的改变,且随解剖部位和 pTDP-43 状态而异。
尽管异质性很大,两组 ALS 都收敛到与细胞衰老相关的蛋白组 / 转录组特征。含义是:运动神经元在真正死亡前可能长期停在一种应激适应态,而衰老程序是其中一条路。这不是经典抗衰干预论文,但把衰老与神经退行在空间分辨率上接起来,值得作为近 48 小时的一条预印本。
bioRxiv · 8月30日biorxiv.org · ALS senescence