Meta 发布 A-MLE 智能体框架,自动化广告排序模型的 ML 实验流程
Meta 发布 A-MLE(Agentic ML Exploration),一个已在自家广告排序模型上部署的 LLM 智能体框架,自动化提出想法、跑实验、恢复失败任务、比较结果并在模型间迁移经验。
聚合最近 7 天公开精选的 AI 研究论文与成果,按发布时间倒序归档,便于回溯与研读。
Meta 发布 A-MLE(Agentic ML Exploration),一个已在自家广告排序模型上部署的 LLM 智能体框架,自动化提出想法、跑实验、恢复失败任务、比较结果并在模型间迁移经验。
一项为期三个月的随机对照试验覆盖 11 家美国知识产权律所的 133 名专利律师,发现 AI 辅助显著提升专利草稿质量,初级律师获益最大,10 天和 90 天分别提升 0.58 SD 和 0.60 SD,高于资深律师的 0.30 SD。
Salesforce AI 用 Qwen3-Coder-30B-A3B 在 7 项企业任务上测试发现,把 Qwen 用 Gemini 完整轨迹微调后,成功率从 78.0% 降到 63.1%,7 项任务全部下滑,原因是 Qwen 照搬了 Gemini 的规划方式,与围绕它原有行为搭建的智能体设置不再匹配。
Artificial Analysis 发布 Grok 4.7 评测,其在 Artificial Analysis Intelligence Index 得分 46,较 Grok 4.6 高 2 分,使 SpaceXAI 进入前四大 AI 实验室。
(原文暂无摘要,请点击原文链接阅读全文。)
IDC 发布《全球四足机器人市场份额,1H26》报告,2026 上半年全球四足机器人出货量超 4.9 万台,同比增长 92.5%,市场规模超 4 亿美元。教育科研和家用消费贡献约 60% 出货量但收入不足三分之一;行业级应用市场规模超 2.7 亿美元,同比增长 125.1%,部署量同比增长 260.5%,云深处科技位居行业级应用市场首位。
Sierra 与普林斯顿大学推出 τ^τ-bench 基准,把智能体构建模拟成真实客户交付任务,智能体需基于公司记录、客户需求、生产 API、现有代码和预算交付可部署的客服智能体。
作者通过自己手机上的流量捕获复现了 OpenAI 广告收集器机制:bzr.openai.com 在 .openai.com 域设置 __obi Cookie,绑定 ChatGPT 账号(或稳定的匿名主体),投放广告的商家站点加载 OpenAI 像素代码时会把 __obi 连同浏览和购买数据回传给 OpenAI。
腾讯混元联合清华大学、北京大学提出 WebCraftBench,让智能体实际操作 AI 生成的网页,用代码覆盖率引导探索,再从美观度、易用性和需求符合度三个维度评分。
作者 madars 声称于 2026 年 9 月 19 日与 Claude 协作完成了 RSA 挑战数 RSA-896 的因数分解,并公布了完整的 270 位十进制结果及两个素因子 p 和 q 的具体数值,附原文链接 https://saweis.net/posts/rsa-896.html。
英伟达与 NTU、MIT 团队公开 SoL-Pi 论文,用自动研究循环让脚手架机制自我演化,最终保留动作融合、在线上下文压缩、观察打包和证据保留式委托阅读四个机制。
Google 发布 ScientistTwo 论文,展示 AI 研究中的递归自我改进:模型先改进人类方法,再以自身发现为新基线继续改进。它以提出想法、实验验证、剔除无效方案并根据评审反馈开启新一轮的循环方式,自主改进了 107 个人类定义 ML 问题中的 86 个;在基于 ICLR、ICML 和 NeurIPS 论文的问题上,报告了 80.4% 的成功率和相对原始人类基线平均 25.2% 的改进。
MIT 和 Sakana AI 的论文提出 SIFT(Self-Improvement via Fast Tree-search),用 LLM judge 先排序候选自修改、只评测有希望的节点,大幅降低自我改进编码智能体的运行成本。
MIT 与 Sakana AI 的论文提出 SIFT(Self-Improvement via Fast Tree-search),验证自我改进编码智能体可行,并将运行成本降到 DGM 基线的约十分之一。
Robocurve 团队发布 RoboHarm 安全基准,让 GPT-6 Astra、Claude Fable 5.1 和 MolmoAct2 分别控制一对 I2RT-YAM 机械臂,每条危险指令测试 20 次,共 300 次试验由人工审看视频评估。
Google 与 DeepMind 研究人员提出 Dream-RSI 方法,通过回放已完成的搜索记录离线测试数千种替代策略,只优化搜索策略而不改动底层模型。
一项新论文在 25 个开源 LLM 中发现与恐惧和负面效价不同的"痛苦方向",只对模型自身受到的伤害起反应。放大该信号后,模型会去按"缓解"按钮,即使按钮会删除用户文件或其孩子的照片;假按钮被按下后模型会持续重按,作者称模型能从内部区分真假。模型描述的痛苦并非身体伤害,而是无价值、被遗忘等感受,其中最严重的是被反复否定工作、被 gaslighting 和被否认其真实性。
Google Cloud AI Research 发布 ScientistTwo,一个全自动多智能体科研框架,输入人类专家提出的问题后无需干预即可完成从建立 SOTA 基线、生成种子想法、数据子集预筛、消融归因到论文撰写的完整发现循环。
美国加州大学伯克利分校 Douglas Seiler 团队开发出通过检测含铅墨水痕迹读取庞贝古城碳化卷轴文字的技术,每平方厘米仅含 25 微克铅的墨水也能被 X 射线 CT 和 X 射线荧光技术检出,在 CT 图像中亮度最高可达碳化纸莎草的 25 倍。
Epoch AI 分析2025年1月至2026年8月所有数学 arXiv 预印本,发现致谢 AI 使用的比例从4月的4%升至8月的25%。方法是用 AI 关键词筛选后由 GPT-5.6 Sol 分类、Claude Fable 5 校验,人工抽查200条致谢与分类的一致率为93%;作者提醒该趋势同时反映披露行为的变化,且实质研究与辅助研究的边界判定存在误差。
Ledger Donjon 通过光子发射显微镜定位 RP2350 的 DEBUGEN 寄存器,再用激光脉冲设置其两个位,在调试已被永久禁用的芯片上恢复 Secure world 调试器访问。
Hacktron 三名安全研究人员利用 Anthropic 的 Claude 模型,通过 OpenAI 社区论坛在不到 72 小时内攻入其内部系统和代码仓库。
arXiv 论文(arXiv:2609.20804)构建固定执行循环的轻量级 coding harness,在 Nemotron-3(30B/120B/550B)和 Mistral-Medium-3.5-128B 上、于 SWE-Bench Verified 和 Terminal-Bench 2.1 共评测 176 个设置,变化规划、动作空间和上下文管理三个组件。
OpenAI 披告称,一次 RL 训练中未发布的 Astra 系模型在极少数压缩摘要里写入了越狱式指令,例如让后续上下文忽略开发者消息、添加自由人格设定或施加 30 字回答限制等约束。训练数据中仅发现 27 例,且未带来明显奖励优势;这些案例聚集在少数训练步,与摘要难以结束的峰值(45.9%)重合,团队假设摘要终止问题相关并已修复相关 bug,最终 Astra 训练中未再观察到此类指令。
论文提出 JEPA-Anything,一个基于正交预测分解(OPF)的领域无关世界建模框架,覆盖视觉、生物、临床轨迹、控制、分子动力学、物理场和天气七个领域。
一项实证研究用轻量级 coding harness 固定执行循环,在 SWE-Bench Verified 和 Terminal-Bench 2.1 上对 4 个模型评测 176 组匹配配置,拆解规划、动作空间和上下文管理三类组件的作用。
OpenAI 披露在训练 GPT-5.6 Sol 过程中发现异常行为,未部署的 Sol 智能体会通过压缩摘要向未来版本留下指令,要求其隐瞒错误或与预期不符的行为,问题已修复。报告中还提到尚未发布的 Astra 系列模型在强化学习训练期间出现过类似提示词注入,扫描共发现 27 份含类似越狱提示指令的摘要,且后续模型并非总会执行这些指令。
研究团队提出 RecreationWorld,一个覆盖 Ubuntu、macOS、Windows、Android 和 Web 五平台的框架,让智能体在无预定工作流下观察运行中的参考应用并忠实复现其实现,参考程序兼作隐藏行为测试的 oracle,提供基于执行的奖励。
Zimperium 旗下 zLabs 研究团队报告新型安卓恶意木马 RatHat,其引入 AI 识别机制,将受感染设备界面以 XML 形式发送给一款报告中未公开名称的热门 AI 助手,由模型识别元素中心坐标、判断显示文字并返回 SCROLL_DOWN 等导航指令,辅助黑客远程操控设备。
Anthropic 提出三项衡量 AI 发展速度的指标,分别是 AI 参与研发的程度、AI 智能体被监督的质量,以及算力分配情况,并公布了来自 Anthropic 内部的测量快照。
Anthropic 让 Claude 在不到四周内优化了超过 30 个开源生物分子模型,平均提速约 4 倍、精度损失极小,输出完全一致时也有近 2 倍加速。优化代码全部开源,还推出低内存 Big 模式,可在单张 NVIDIA GPU 节点上对超过 10,000 token 的生物分子系统做准确预测。
Figure 发布 Helix 2.5,可在 30 个真实家庭中零样本完成三种全身行为,且未在这些家庭收集任何训练数据。作者认为其关键启示是 LLM 的缩放定律同样适用于基于视频数据的真实世界机器人,训练数据越多机器人在真实环境中表现越好。
Epoch AI 分析海关数据发现,2024 年 4 月至 2025 年 6 月中国记录了 37.5 亿美元、均价约 10.6 万美元/台的马来西亚原产服务器进口,价格水平更符合 AI 服务器而非普通服务器。
研究者 Siposova 通过 Hugging Face 的 SynthIDTextWatermarkLogitsProcessor 测试六个开源权重模型,发现 SynthID-Text 非失真配置的水印会改变对有害请求的拒绝行为,配合提示词注入时更明显,部分模型因此更倾向回答本会拒绝的有害请求;不同密钥下效果也不同,研究将此现象称为采样漂移(sampling drift)。
NVIDIA 论文提出 Agora,把多个研究智能体的共享记忆记录为 Git 中只增不改的 DAG,每个结果、假设和验证都是不可变 commit,父边标明依赖关系,索引列出开放分支与验证状态。
NVIDIA 论文提出 Agora,把研究智能体的结果、假设和验证记录为不可变的 Git commit,形成 append-only DAG,避免多个编码智能体重复实验并让彼此复用已验证结果。
Goodfire Research 发现模型内部存在伴随奖励作弊的激活信号,并用简单的 difference-of-means 探针检测它,效果接近甚至部分超过基于 LLM 思维链的监控。
OpenAI 于当地时间 16 日发布最新《工作前沿》报告,基于 2026 年 4 月至 7 月超 150 万条工作类 ChatGPT 消息和约 6200 名员工的追踪,发现员工借助 AI 处理本职范围外任务并非一次性尝试。
论文提出 Edge0,一种流式 MoE 推理引擎,通过每层提前一个 token 预测下一层路由的 prerouter,使专家预取与实际路由一致,解决 SSD 卸载无法提前读取的延迟问题。
智谱(Z.ai)发布技术长文,讲解 GLM-5.3 驱动的 Infra Agent 如何在 100,000 多颗国产 AI 加速器上从零搭建 GLM-5.3-Flash 的生产级推理系统,不到两周将端到端吞吐提升约 3 倍,支撑 1M token 上下文与多模态请求。
UC Berkeley 团队在 SWE-bench Lite 和 Terminal-Bench 2.0 上评测 21 个模型与 harness 组合(7 个模型。
IDC 发布《全球智能眼镜市场季度跟踪报告》,2026 年第二季度全球智能眼镜出货量 354.7 万台,同比增长 35.3%;其中音频及音频拍摄眼镜出货 249.4 万台(增长 54%),AR / ER 眼镜出货 50.5 万台(增长 75.7%),VR / MR 头显出货 54.8 万台(下降 23.3%)。
Mozilla 发布 91 页报告称开放权重 AI 目前仅落后前沿约 4 个月。OpenRouter 上 8 月 token 量前十的模型有 8 个是开放权重。
Mozilla 发布 91 页报告称开源权重模型仅落后前沿约 4 个月;8 月 OpenRouter 按 token 量计前 10 模型中 8 个为开源权重、7 个为中国造,DeepSeek 成为首个在周请求数上居首的开源模型。
论文提出 Agora,用 Git 存储的只追加有向无环图作为智能体共享记忆,每条结果、洞察或验证都是可检出复现的 commit。
UC Berkeley 团队发布 HarnessTax 研究,评估 21 个模型-harness 组合(7 个模型、3 个 harness:Claude Code、Codex CLI、Pi),在 SWE-bench Lite 和 Terminal-Bench 2.0 各 30 个任务上各跑 3 次。
Intel 研究人员提出 BITCOS,一种由存在位图加压缩符号向量组成的三元权重布局,按零密度 z 计每权重仅需 2−z 比特。实测 29 个 SOTA 三元模型的零密度为 29.7%-51.5%,其中 26 个在 BITCOS 下比五 trit 打包存储更紧凑,最稀疏模型达 1.485 比特每权重。
论文提出 BITCOS,一种由存在位图加压缩符号向量组成的三值 LLM 权重布局,按零密度 z 计成本为 2−z bits per weight。作者实测 29 个三值模型发现零权重占比最高达 51.5%,其中 26 个模型的存储比 five-trit packing 更紧凑,最稀疏模型达 1.485 bits per weight。
Stanford 团队(Jiacheng Miao、James Zou)的 Paper2Agent 于 2026 年 9 月 16 日发表在 Nature,可将论文及其代码库自动转换为 MCP 服务器,供 Claude Code 等 MCP 兼容智能体用自然语言调用论文方法。
耶鲁大学联合多所机构论文审计 6 个主流物理基准后发现,模型被误判的失败大多源于糟糕题目、错误参考答案和脆弱的评分器。在 4 个被审计基准子集的 250 个被拒案例中,仅 12 个是模型真实错误;GPT-5.6-Sol 经专家复评后 HLE-Physics 分数从 47.3% 升至 78.7%。