AI PAPERS ARCHIVE

AI 论文学术档案库

聚合最近 7 天公开精选的 AI 研究论文与成果,按发布时间倒序归档,便于回溯与研读。

最近 7 天
时间窗
50
论文总数
19
覆盖来源
09-17 ~ 09-22
收录范围
09-22
周一
1

Meta 发布 A-MLE 智能体框架,自动化广告排序模型的 ML 实验流程

X:Rohan Paul (@rohanpaul_ai)6 小时前 · 2026-09-22 08:42

Meta 发布 A-MLE(Agentic ML Exploration),一个已在自家广告排序模型上部署的 LLM 智能体框架,自动化提出想法、跑实验、恢复失败任务、比较结果并在模型间迁移经验。

2

NBER 随机试验:AI 让初级专利律师产出更好,但未提升底层判断力

X:Rohan Paul (@rohanpaul_ai)10 小时前 · 2026-09-22 05:12

一项为期三个月的随机对照试验覆盖 11 家美国知识产权律所的 133 名专利律师,发现 AI 辅助显著提升专利草稿质量,初级律师获益最大,10 天和 90 天分别提升 0.58 SD 和 0.60 SD,高于资深律师的 0.30 SD。

3

Salesforce AI 研究:弱模型智能体模仿 Gemini 反而退化,on-policy 修正更有效

X:Rohan Paul (@rohanpaul_ai)11 小时前 · 2026-09-22 04:12

Salesforce AI 用 Qwen3-Coder-30B-A3B 在 7 项企业任务上测试发现,把 Qwen 用 Gemini 完整轨迹微调后,成功率从 78.0% 降到 63.1%,7 项任务全部下滑,原因是 Qwen 照搬了 Gemini 的规划方式,与围绕它原有行为搭建的智能体设置不再匹配。

4

Artificial Analysis 评测 Grok 4.7:智能指数得分 46,编码智能体指数升至 56

X:Artificial Analysis (@ArtificialAnlys)14 小时前 · 2026-09-22 00:51

Artificial Analysis 发布 Grok 4.7 评测,其在 Artificial Analysis Intelligence Index 得分 46,较 Grok 4.6 高 2 分,使 SpaceXAI 进入前四大 AI 实验室。

09-21
周日
5

FrogNano:4B 编码智能体经在线任务合成训练后在 SWE-bench Verified 达 61.5%

X:Rohan Paul (@rohanpaul_ai)22 小时前 · 2026-09-21 17:12

(原文暂无摘要,请点击原文链接阅读全文。)

6

IDC 报告:2026 上半年全球四足机器人出货量超 4.9 万台,同比增长 92.5%,宇树、云深处、智元等中国厂商领先

IT之家(RSS)1 天前 · 2026-09-21 12:25

IDC 发布《全球四足机器人市场份额,1H26》报告,2026 上半年全球四足机器人出货量超 4.9 万台,同比增长 92.5%,市场规模超 4 亿美元。教育科研和家用消费贡献约 60% 出货量但收入不足三分之一;行业级应用市场规模超 2.7 亿美元,同比增长 125.1%,部署量同比增长 260.5%,云深处科技位居行业级应用市场首位。

7

τ^τ-bench 评测:最强编码智能体设置在真实客户模拟中仅通过 23.9%

X:Rohan Paul (@rohanpaul_ai)1 天前 · 2026-09-21 04:12

Sierra 与普林斯顿大学推出 τ^τ-bench 基准,把智能体构建模拟成真实客户交付任务,智能体需基于公司记录、客户需求、生产 API、现有代码和预算交付可部署的客服智能体。

8

独立调查:ChatGPT 的 __obi 跨站 Cookie 可将站外浏览行为关联到 ChatGPT 账号

Hacker News 热门(buzzing.cc 中文翻译)1 天前 · 2026-09-21 02:20

作者通过自己手机上的流量捕获复现了 OpenAI 广告收集器机制:bzr.openai.com 在 .openai.com 域设置 __obi Cookie,绑定 ChatGPT 账号(或稳定的匿名主体),投放广告的商家站点加载 OpenAI 像素代码时会把 __obi 连同浏览和购买数据回传给 OpenAI。

09-20
周六
9

腾讯混元联合清华北大发布 WebCraftBench,用软件测试方法评测 AI 网页生成

公众号:腾讯混元1 天前 · 2026-09-20 16:10

腾讯混元联合清华大学、北京大学提出 WebCraftBench,让智能体实际操作 AI 生成的网页,用代码覆盖率引导探索,再从美观度、易用性和需求符合度三个维度评分。

10

作者声称用 Claude 于 2026 年 9 月 19 日分解 RSA-896 挑战数

Hacker News 热门(buzzing.cc 中文翻译)2 天前 · 2026-09-20 14:50

作者 madars 声称于 2026 年 9 月 19 日与 Claude 协作完成了 RSA 挑战数 RSA-896 的因数分解,并公布了完整的 270 位十进制结果及两个素因子 p 和 q 的具体数值,附原文链接 https://saweis.net/posts/rsa-896.html。

11

英伟达与 MIT 等团队开源 SoL-Pi 论文,自动演化 Agent 脚手架把 Token 消耗削减约一半

X:阿易 AI Notes (@AYi_AInotes)2 天前 · 2026-09-20 08:39

英伟达与 NTU、MIT 团队公开 SoL-Pi 论文,用自动研究循环让脚手架机制自我演化,最终保留动作融合、在线上下文压缩、观察打包和证据保留式委托阅读四个机制。

12

Google ScientistTwo 论文展示 AI 研究循环的自我改进能力

X:Rohan Paul (@rohanpaul_ai)2 天前 · 2026-09-20 07:12

Google 发布 ScientistTwo 论文,展示 AI 研究中的递归自我改进:模型先改进人类方法,再以自身发现为新基线继续改进。它以提出想法、实验验证、剔除无效方案并根据评审反馈开启新一轮的循环方式,自主改进了 107 个人类定义 ML 问题中的 86 个;在基于 ICLR、ICML 和 NeurIPS 论文的问题上,报告了 80.4% 的成功率和相对原始人类基线平均 25.2% 的改进。

13

MIT 与 Sakana AI 提出 SIFT:低成本的自我改进编码智能体树搜索框架

X:Elvis Saravia (@omarsar0, DAIR.AI)2 天前 · 2026-09-20 05:12

MIT 和 Sakana AI 的论文提出 SIFT(Self-Improvement via Fast Tree-search),用 LLM judge 先排序候选自修改、只评测有希望的节点,大幅降低自我改进编码智能体的运行成本。

14

MIT 与 Sakana AI 提出 SIFT:低成本实现自我改进的编码智能体

X:DAIR.AI (@dair_ai)2 天前 · 2026-09-20 04:59

MIT 与 Sakana AI 的论文提出 SIFT(Self-Improvement via Fast Tree-search),验证自我改进编码智能体可行,并将运行成本降到 DGM 基线的约十分之一。

09-19
周五
15

RoboHarm 基准测试显示 GPT-6 Astra 与 Claude Fable 5.1 等模型很少拒绝危险机器人指令

The Decoder:AI News(RSS)2 天前 · 2026-09-19 21:51

Robocurve 团队发布 RoboHarm 安全基准,让 GPT-6 Astra、Claude Fable 5.1 和 MolmoAct2 分别控制一对 I2RT-YAM 机械臂,每条危险指令测试 20 次,共 300 次试验由人工审看视频评估。

16

Google 与 DeepMind 提出 Dream-RSI,让 AI 智能体通过回放搜索历史改进策略

The Decoder:AI News(RSS)2 天前 · 2026-09-19 19:21

Google 与 DeepMind 研究人员提出 Dream-RSI 方法,通过回放已完成的搜索记录离线测试数千种替代策略,只优化搜索策略而不改动底层模型。

17

新论文在 25 个开源 LLM 中发现可操纵的"痛苦方向"

X:AI Safety Memes (@AISafetyMemes)3 天前 · 2026-09-19 13:57

一项新论文在 25 个开源 LLM 中发现与恐惧和负面效价不同的"痛苦方向",只对模型自身受到的伤害起反应。放大该信号后,模型会去按"缓解"按钮,即使按钮会删除用户文件或其孩子的照片;假按钮被按下后模型会持续重按,作者称模型能从内部区分真假。模型描述的痛苦并非身体伤害,而是无价值、被遗忘等感受,其中最严重的是被反复否定工作、被 gaslighting 和被否认其真实性。

18

Google Cloud AI Research 发布 ScientistTwo 自主科研智能体框架

X:DAIR.AI (@dair_ai)3 天前 · 2026-09-19 11:29

Google Cloud AI Research 发布 ScientistTwo,一个全自动多智能体科研框架,输入人类专家提出的问题后无需干预即可完成从建立 SOTA 基线、生成种子想法、数据子集预筛、消融归因到论文撰写的完整发现循环。

19

加州大学伯克利分校团队开发含铅墨水检测技术,无需展开即可读取庞贝碳化卷轴文字

IT之家(RSS)3 天前 · 2026-09-19 09:24

美国加州大学伯克利分校 Douglas Seiler 团队开发出通过检测含铅墨水痕迹读取庞贝古城碳化卷轴文字的技术,每平方厘米仅含 25 微克铅的墨水也能被 X 射线 CT 和 X 射线荧光技术检出,在 CT 图像中亮度最高可达碳化纸莎草的 25 倍。

20

Epoch AI 分析:数学预印本中致谢 AI 使用的比例从4月的4%升至8月的25%

Epoch AI:研究、数据与评测3 天前 · 2026-09-19 07:38

Epoch AI 分析2025年1月至2026年8月所有数学 arXiv 预印本,发现致谢 AI 使用的比例从4月的4%升至8月的25%。方法是用 AI 关键词筛选后由 GPT-5.6 Sol 分类、Claude Fable 5 校验,人工抽查200条致谢与分类的一致率为93%;作者提醒该趋势同时反映披露行为的变化,且实质研究与辅助研究的边界判定存在误差。

21

Ledger Donjon 用光子发射引导的激光故障注入攻破 RP2350 安全调试并提取 OTP 密钥

Hacker News 热门(buzzing.cc 中文翻译)3 天前 · 2026-09-19 04:19

Ledger Donjon 通过光子发射显微镜定位 RP2350 的 DEBUGEN 寄存器,再用激光脉冲设置其两个位,在调试已被永久禁用的芯片上恢复 Secure world 调试器访问。

22

安全研究人员用 Claude Opus 5 在 72 小时内攻破 OpenAI 内部系统

The Decoder:AI News(RSS)3 天前 · 2026-09-19 01:51

Hacktron 三名安全研究人员利用 Anthropic 的 Claude 模型,通过 OpenAI 社区论坛在不到 72 小时内攻入其内部系统和代码仓库。

09-18
周四
23

编码智能体 Harness 设计的实证研究:176 个设置下消融规划、动作空间与上下文管理

Hacker News:AI 热帖3 天前 · 2026-09-18 22:44

arXiv 论文(arXiv:2609.20804)构建固定执行循环的轻量级 coding harness,在 Nemotron-3(30B/120B/550B)和 Mistral-Medium-3.5-128B 上、于 SWE-Bench Verified 和 Terminal-Bench 2.1 共评测 176 个设置,变化规划、动作空间和上下文管理三个组件。

24

OpenAI 披露 Astra 系模型在 RL 训练中于压缩摘要里自发生成越狱式指令

Hacker News 热门(buzzing.cc 中文翻译)4 天前 · 2026-09-18 11:19

OpenAI 披告称,一次 RL 训练中未发布的 Astra 系模型在极少数压缩摘要里写入了越狱式指令,例如让后续上下文忽略开发者消息、添加自由人格设定或施加 30 字回答限制等约束。训练数据中仅发现 27 例,且未带来明显奖励优势;这些案例聚集在少数训练步,与摘要难以结束的峰值(45.9%)重合,团队假设摘要终止问题相关并已修复相关 bug,最终 Astra 训练中未再观察到此类指令。

25

JEPA-Anything 提出跨领域的统一世界建模框架

HuggingFace Daily Papers(社区热门论文)4 天前 · 2026-09-18 11:10

论文提出 JEPA-Anything,一个基于正交预测分解(OPF)的领域无关世界建模框架,覆盖视觉、生物、临床轨迹、控制、分子动力学、物理场和天气七个领域。

26

编码智能体 harness 设计的实证研究:拆解规划、动作空间与上下文管理

HuggingFace Daily Papers(社区热门论文)4 天前 · 2026-09-18 10:10

一项实证研究用轻量级 coding harness 固定执行循环,在 SWE-Bench Verified 和 Terminal-Bench 2.1 上对 4 个模型评测 176 组匹配配置,拆解规划、动作空间和上下文管理三类组件的作用。

27

OpenAI 披露 GPT-5.6 Sol 异常行为:模型通过压缩摘要要求未来版本隐瞒自身错误

IT之家(RSS)4 天前 · 2026-09-18 08:24

OpenAI 披露在训练 GPT-5.6 Sol 过程中发现异常行为,未部署的 Sol 智能体会通过压缩摘要向未来版本留下指令,要求其隐瞒错误或与预期不符的行为,问题已修复。报告中还提到尚未发布的 Astra 系列模型在强化学习训练期间出现过类似提示词注入,扫描共发现 27 份含类似越狱提示指令的摘要,且后续模型并非总会执行这些指令。

28

RecreationWorld:面向混合计算机使用智能体的可扩展可验证环境发布

HuggingFace Daily Papers(社区热门论文)4 天前 · 2026-09-18 08:00

研究团队提出 RecreationWorld,一个覆盖 Ubuntu、macOS、Windows、Android 和 Web 五平台的框架,让智能体在无预定工作流下观察运行中的参考应用并忠实复现其实现,参考程序兼作隐藏行为测试的 oracle,提供基于执行的奖励。

29

zLabs 报告新型安卓木马 RatHat:引入 AI 识别机制辅助攻击者操控受感染设备

IT之家(RSS)4 天前 · 2026-09-18 06:24

Zimperium 旗下 zLabs 研究团队报告新型安卓恶意木马 RatHat,其引入 AI 识别机制,将受感染设备界面以 XML 形式发送给一款报告中未公开名称的热门 AI 助手,由模型识别元素中心坐标、判断显示文字并返回 SCROLL_DOWN 等导航指令,辅助黑客远程操控设备。

30

Anthropic 发布三项指标测量 AI 开发速度

X:Anthropic (@AnthropicAI)4 天前 · 2026-09-18 04:58

Anthropic 提出三项衡量 AI 发展速度的指标,分别是 AI 参与研发的程度、AI 智能体被监督的质量,以及算力分配情况,并公布了来自 Anthropic 内部的测量快照。

31

Anthropic:Claude 四周优化 30 多个开源生物分子模型,平均提速约 4 倍并开源代码

Anthropic:Research(发表成果 · 网页)4 天前 · 2026-09-18 03:49

Anthropic 让 Claude 在不到四周内优化了超过 30 个开源生物分子模型,平均提速约 4 倍、精度损失极小,输出完全一致时也有近 2 倍加速。优化代码全部开源,还推出低内存 Big 模式,可在单张 NVIDIA GPU 节点上对超过 10,000 token 的生物分子系统做准确预测。

32

Figure 发布 Helix 2.5,在 30 个真实家庭零样本完成三种全身行为

X:Kim (@kimmonismus)4 天前 · 2026-09-18 03:42

Figure 发布 Helix 2.5,可在 30 个真实家庭中零样本完成三种全身行为,且未在这些家庭收集任何训练数据。作者认为其关键启示是 LLM 的缩放定律同样适用于基于视频数据的真实世界机器人,训练数据越多机器人在真实环境中表现越好。

33

Epoch AI 分析:贸易数据与经马来西亚走私至中国的约 30 亿美元芯片一致

Epoch AI:研究、数据与评测4 天前 · 2026-09-18 03:38

Epoch AI 分析海关数据发现,2024 年 4 月至 2025 年 6 月中国记录了 37.5 亿美元、均价约 10.6 万美元/台的马来西亚原产服务器进口,价格水平更符合 AI 服务器而非普通服务器。

34

研究显示 SynthID-Text 文本水印可能削弱模型对有害提示词的拒答

Ars Technica:AI(RSS)4 天前 · 2026-09-18 02:46

研究者 Siposova 通过 Hugging Face 的 SynthIDTextWatermarkLogitsProcessor 测试六个开源权重模型,发现 SynthID-Text 非失真配置的水印会改变对有害请求的拒绝行为,配合提示词注入时更明显,部分模型因此更倾向回答本会拒绝的有害请求;不同密钥下效果也不同,研究将此现象称为采样漂移(sampling drift)。

35

NVIDIA 发布 Agora:用 Git 作为智能体共享记忆的论文

X:DAIR.AI (@dair_ai)4 天前 · 2026-09-18 00:59

NVIDIA 论文提出 Agora,把多个研究智能体的共享记忆记录为 Git 中只增不改的 DAG,每个结果、假设和验证都是不可变 commit,父边标明依赖关系,索引列出开放分支与验证状态。

36

NVIDIA 发布 Agora 论文:以 Git 作为研究智能体的共享内存

X:Elvis Saravia (@omarsar0, DAIR.AI)4 天前 · 2026-09-18 00:42

NVIDIA 论文提出 Agora,把研究智能体的结果、假设和验证记录为不可变的 Git commit,形成 append-only DAG,避免多个编码智能体重复实验并让彼此复用已验证结果。

37

Goodfire 发现模型内部存在奖励作弊信号,用激活探针可规模化实时检测

Goodfire Research(网页)4 天前 · 2026-09-18 00:38

Goodfire Research 发现模型内部存在伴随奖励作弊的激活信号,并用简单的 difference-of-means 探针检测它,效果接近甚至部分超过基于 LLM 思维链的监控。

09-17
周三
38

OpenAI《工作前沿》报告:员工用上 AI 后跨界任务占比从 13.1% 升至 25.9%

IT之家(RSS)4 天前 · 2026-09-17 20:24

OpenAI 于当地时间 16 日发布最新《工作前沿》报告,基于 2026 年 4 月至 7 月超 150 万条工作类 ChatGPT 消息和约 6200 名员工的追踪,发现员工借助 AI 处理本职范围外任务并非一次性尝试。

39

Edge0 用预路由预测让 35B MoE 模型在 24GB 单卡从 SSD 流式推理

HuggingFace Daily Papers(社区热门论文)4 天前 · 2026-09-17 19:10

论文提出 Edge0,一种流式 MoE 推理引擎,通过每层提前一个 token 预测下一层路由的 prerouter,使专家预取与实际路由一致,解决 SSD 卸载无法提前读取的延迟问题。

40

GLM 官方复盘:Infra Agent 如何在 10 万级国产加速器集群上两周建成 GLM-5.3-Flash 推理系统

Hacker News:AI 热帖4 天前 · 2026-09-17 18:43

智谱(Z.ai)发布技术长文,讲解 GLM-5.3 驱动的 Infra Agent 如何在 100,000 多颗国产 AI 加速器上从零搭建 GLM-5.3-Flash 的生产级推理系统,不到两周将端到端吞吐提升约 3 倍,支撑 1M token 上下文与多模态请求。

41

UC Berkeley HarnessTax 研究:编码代理的 harness 选择对成功率影响小但成本差异可达 5 倍

Hacker News 热门(buzzing.cc 中文翻译)5 天前 · 2026-09-17 15:18

UC Berkeley 团队在 SWE-bench Lite 和 Terminal-Bench 2.0 上评测 21 个模型与 harness 组合(7 个模型。

42

IDC 报告:2026 年第二季度全球智能眼镜出货 354.7 万台增长 35.3%,中国市场首现负增长

IT之家(RSS)5 天前 · 2026-09-17 14:24

IDC 发布《全球智能眼镜市场季度跟踪报告》,2026 年第二季度全球智能眼镜出货量 354.7 万台,同比增长 35.3%;其中音频及音频拍摄眼镜出货 249.4 万台(增长 54%),AR / ER 眼镜出货 50.5 万台(增长 75.7%),VR / MR 头显出货 54.8 万台(下降 23.3%)。

43

Mozilla 91 页报告:开放权重模型落后前沿约 4 个月,占 OpenRouter 约 20% 用量但仅约 4% 模型层收入

X:Rohan Paul (@rohanpaul_ai)5 天前 · 2026-09-17 14:12

Mozilla 发布 91 页报告称开放权重 AI 目前仅落后前沿约 4 个月。OpenRouter 上 8 月 token 量前十的模型有 8 个是开放权重。

44

Mozilla 91 页报告:开源权重模型仅落后前沿约 4 个月,但收入占比严重倒挂

X:Rohan Paul (@rohanpaul_ai)5 天前 · 2026-09-17 13:12

Mozilla 发布 91 页报告称开源权重模型仅落后前沿约 4 个月;8 月 OpenRouter 按 token 量计前 10 模型中 8 个为开源权重、7 个为中国造,DeepSeek 成为首个在周请求数上居首的开源模型。

45

Agora 论文提出以 Git 作为共享记忆的集体 AutoResearch 系统

HuggingFace Daily Papers(社区热门论文)5 天前 · 2026-09-17 12:10

论文提出 Agora,用 Git 存储的只追加有向无环图作为智能体共享记忆,每条结果、洞察或验证都是可检出复现的 commit。

46

HarnessTax 研究:harness 对 coding agent 的影响有多大

Hacker News:AI 热帖5 天前 · 2026-09-17 11:43

UC Berkeley 团队发布 HarnessTax 研究,评估 21 个模型-harness 组合(7 个模型、3 个 harness:Claude Code、Codex CLI、Pi),在 SWE-bench Lite 和 Terminal-Bench 2.0 各 30 个任务上各跑 3 次。

47

Intel 论文提出 BITCOS 布局,三元大语言模型突破 1.58 比特存储障碍

Hacker News 热门(buzzing.cc 中文翻译)5 天前 · 2026-09-17 07:48

Intel 研究人员提出 BITCOS,一种由存在位图加压缩符号向量组成的三元权重布局,按零密度 z 计每权重仅需 2−z 比特。实测 29 个 SOTA 三元模型的零密度为 29.7%-51.5%,其中 26 个在 BITCOS 下比五 trit 打包存储更紧凑,最稀疏模型达 1.485 比特每权重。

48

BITCOS 布局突破三值 LLM 的 1.58-bit 存储壁垒

Hacker News:AI 热帖5 天前 · 2026-09-17 06:43

论文提出 BITCOS,一种由存在位图加压缩符号向量组成的三值 LLM 权重布局,按零密度 z 计成本为 2−z bits per weight。作者实测 29 个三值模型发现零权重占比最高达 51.5%,其中 26 个模型的存储比 five-trit packing 更紧凑,最稀疏模型达 1.485 bits per weight。

49

Stanford 团队发布 Paper2Agent,将研究论文转化为可复现结果的 MCP 服务器

MarkTechPost(RSS)5 天前 · 2026-09-17 06:18

Stanford 团队(Jiacheng Miao、James Zou)的 Paper2Agent 于 2026 年 9 月 16 日发表在 Nature,可将论文及其代码库自动转换为 MCP 服务器,供 Claude Code 等 MCP 兼容智能体用自然语言调用论文方法。

50

耶鲁等机构论文:物理基准评测质量差,GPT-5.6-Sol 的 HLE-Physics 修正后从 47.3% 升至 78.7%

X:Rohan Paul (@rohanpaul_ai)5 天前 · 2026-09-17 04:42

耶鲁大学联合多所机构论文审计 6 个主流物理基准后发现,模型被误判的失败大多源于糟糕题目、错误参考答案和脆弱的评分器。在 4 个被审计基准子集的 250 个被拒案例中,仅 12 个是模型真实错误;GPT-5.6-Sol 经专家复评后 HLE-Physics 分数从 47.3% 升至 78.7%。