2026年8月 Hugging Face Papers Top20 论文速读
作者:XD / 发表: 2026年9月1日 04:36 / 更新: 2026年9月1日 04:37 / 编程笔记 / 阅读量:5
数据来自 Hugging Face Papers 2026-08 月榜,按页面 upvotes 排序取 Top20。本月高热度方向主要集中在推理模型、长周期 Agent、world model、视频安全与视觉推理、Agent skill,以及可验证的研究和软件工程流程。
说明:机构字段使用 Hugging Face 页面里的 organization,不等同于完整作者单位;缺失时标注为“HF 页面未给出机构”。点赞和 GitHub stars 为 2026 年 9 月 1 日抓取时页面显示的数值。
简单统计
入选论文数 20
总点赞数 5382
平均点赞数 269.1
GitHub 覆盖 14 / 20
项目主页覆盖 16 / 20
排序方式 Hugging Face upvotes 降序
Top20
1. BDH-CQ: In-Context Learning with Recurrent Latent Reasoning
- 点赞:766
- 机构:Pathway
- 关键词:in-context learning、recurrent latent reasoning、ARC-AGI-1、cost-accuracy Pareto frontier
- 链接:HF / arXiv / GitHub,9666 stars / Project
BDH-CQ 将 in-context learning 和 recurrent latent reasoning 结合起来。推理时,输入示例会持续更新模型的 recurrent memory,模型随后在高维 latent space 中迭代求解,而不是把中间思考过程全部 verbalize 出来。论文在 ARC-AGI-1 上测试,并用 ARC-like intervention 研究模型是否真正从示例中归纳转换规则。150M 参数配置达到 29.5% pass@2,单任务计算成本约 0.0007 美元,核心卖点是用很小的模型取得较好的 cost-accuracy 平衡。
摘要要点:BDH-CQ 通过循环隐空间推理和上下文学习,在 ARC-AGI-1 上探索低成本的推理模型路线。
![]()
2. StateM: Reaching 95.3% Raw Accuracy, or a \$15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling
- 点赞:445
- 机构:HF 页面未给出机构
- 关键词:agent-native runtime、durable states、checked transitions、recoverable runbooks、Terminal-Bench
- 链接:HF / arXiv / GitHub,798 stars / Project
StateM 认为长周期 Agent 的失败不一定来自模型能力不足,也可能是状态丢失、流程没有重新激活、已知步骤被跳过或任务过早终止。它不改模型权重,而是在模型外围加入 agent-native runtime,用 durable states、phase-local context、checked transitions、recoverable runbooks 和 versioned procedures 管理执行过程。论文报告在 Terminal-Bench 2.1 上显著提升多个模型的结果,说明 harness scaling 可能是提高 Agent 可靠性的另一条路径。
摘要要点:StateM 通过持久状态、可恢复 runbook 和可检查状态转移,提升长周期终端任务的执行稳定性。
![]()
3. Macaron-V1: Towards Open Continual Learning with Self-Improvement and Mixture-of-LoRA
- 点赞:342
- 机构:Mind Lab
- 关键词:Mixture-of-LoRA、continual learning、recursive self-improvement、Model-Harness Co-design
- 链接:HF / arXiv
Macaron-V1 面向 experiential intelligence,也就是让 Agent 从真实环境中的经验学习,并在部署之后继续改进。它一方面通过 versioned model-harness pairs 做递归改进,另一方面使用 Mixture-of-LoRA 组合多个 specialist adapter,每轮交互选择合适的 LoRA。旗舰版本将不同 adapter 分别用于 chat、agent、coding 和 GenUI,较小版本则面向本地部署。它的核心思想不是训练一个永远固定的模型,而是让基础模型、专长 adapter 和 harness 一起演化。
摘要要点:Macaron-V1 用 Mixture-of-LoRA 和递归自我改进支持持续学习与多专长协作。
4. HarnessEval-W: Agentifying the Evaluation of Visual Worlds
- 点赞:339
- 机构:MirroS
- 关键词:world model benchmarking、agentified evaluation、evidence tree、reasoning chain
- 链接:HF / arXiv / GitHub,278 stars / Project
HarnessEval-W 解决 world model 评测只给一个 scalar score 的问题。判断一个 rollout 是否合理,需要检查物理、因果关系和世界状态是否正确演化。它使用分层 sub-agents,把评测问题拆成可验证的子问题,每个子 Agent 配备对应上下文和诊断工具,父 Agent 再汇总证据形成最终判断。这样每次评测都会生成一棵 evidence tree,而不是只输出一个无法解释的分数。
摘要要点:HarnessEval-W 将 Agent harness 引入 world model benchmark,用可追溯推理链和证据树解释评测结果。
5. Spark-to-Paper: End-to-End Research Paper Generation as a Composable Skill
- 点赞:289
- 机构:HF 页面未给出机构
- 关键词:composable skills、citation validity、figure editability、fabrication detection、self-refutation loop
- 链接:HF / arXiv / GitHub,858 stars / Project
Spark-to-Paper 把论文生成拆成 13 个可组合 skill,直接运行在现有 coding assistant 里,不要求额外的 Agent 平台。它区分模型判断和确定性操作,也把实验规划和结果报告分开,要求先规定证据,再根据真实结果修正论文结论。系统还加入 citation validity、figure editability、fabrication detection 和 adversarial review,并专门讨论 Self-Refutation Loop,即实验持续否定原始研究目标时如何停止或修正流程。它更像一套研究自动化工作流,而不是一个单纯的写作 prompt。
摘要要点:Spark-to-Paper 通过可组合 skill、确定性检查和自我批评,尝试降低自动论文生成中的引用错误、图表不可编辑和结果编造。
6. Can We Defend Against AI-Generated Video Attacks on Real-World Crisis Events? A Systematic Evaluation of Detectors, Generators and Social Dissemination
- 点赞:281
- 机构:Hugging Face
- 关键词:AI-generated video detection、RA-Bench、MLLMs、detector generalization、social dissemination
- 链接:HF / arXiv / GitHub,98 stars / Project
RA-Bench 研究真实危机事件中的 AI 生成视频攻击,包括战争、灾害、公共安全等场景。数据集包含 17,886 个视频,其中有 1,830 个真实视频 anchor 和 16,056 个来自开源、闭源生成器的生成视频。论文从检测器泛化、生成条件变化和社交传播三个角度测试传统 detector、zero-shot multimodal model 和专门微调的 MLLM。结果表明,现有检测器在真实复杂视频上泛化不稳定,而且视频经过社交传播后更难检测。
摘要要点:RA-Bench 说明当前 AI 视频检测器难以跨生成器和真实危机场景泛化,传播过程还会进一步降低检测可靠性。
7. EnvHarness: Awakening Static Worlds for Agent Learning
- 点赞:273
- 机构:Google
- 关键词:Environment Harness、EnvRigger、black-box policy、reinforcement learning、co-evolution
- 链接:HF / arXiv / GitHub,466 stars / Project
EnvHarness 针对 Agent 训练环境静态、无法跟随模型弱点变化的问题。它在不修改原环境逻辑的情况下,通过插件层重新塑造环境行为,同时保留原有 verifier。EnvRigger 把被测 Agent 当成 black-box policy,观察执行轨迹,生成针对性环境组件,再用新的 rollout 验证这些组件是否真的击中了模型弱点。相比从头生成环境,这种方法更轻量,也更容易迁移到不同领域。
摘要要点:EnvHarness 用可编程插件动态改造静态环境,EnvRigger 根据 Agent 轨迹生成针对性训练和评测场景。
8. VBVR-Pro: A Scalable and Verifiable Suite for Native Visual Reasoning
- 点赞:268
- 机构:Video-Reason
- 关键词:native visual reasoning、visual generation、verifiable reward scorers、multi-task RL、interleaved generation
- 链接:HF / arXiv / GitHub,25 stars / Project
VBVR-Pro 把视觉生成本身当成推理介质,图像和视频不是单纯的输入或最后输出,而是问题求解过程中的中间状态。它提供 300 个程序生成任务、810 个实例和可验证 reward scorer,避免完全依赖 VLM-as-a-judge。论文还比较了 30 多种图像、视频和 interleaved generator,发现视频生成更适合持续的时空状态跟踪,而 interleaved generation 在计算效率上更有优势。
摘要要点:VBVR-Pro 为 native visual reasoning 提供可扩展任务、确定性奖励和跨生成介质的对比实验。
![]()
9. OpenART: Scaling Agent Red Teaming via Open-Ended Environment Evolution
- 点赞:263
- 机构:HF 页面未给出机构
- 关键词:stateful scenarios、EMHA、environment evolution、agent safety、Attack Success Rate
- 链接:HF / arXiv / GitHub,97 stars
OpenART 面向长周期 Agent 的红队测试。传统安全 benchmark 多是短任务、静态状态,无法模拟早期状态修改对后续决策的累积影响。OpenART 提供超过 10,000 个有状态场景、50 个领域和超过 500,000 个工具与 skill,并提出 Evolutionary Markov Hypergraph Attack(EMHA),通过反馈驱动的状态转移不断演化环境。论文报告复杂度越高,环境演化越容易暴露 Agent 安全失败,且 Agent runtime 的实现方式本身会显著影响安全结果。
摘要要点:OpenART 通过持续演化的有状态环境测试 Agent 安全性,重点揭示长链路工具调用中的累积风险。
10. Recursive Synthesis for Long-Horizon Terminal Tasks
- 点赞:251
- 机构:Tencent Hunyuan
- 关键词:recursive verified synthesis、terminal-agent tasks、supervised fine-tuning、agentic PPO
- 链接:HF / arXiv / Project
Recursive Synthesis 解决长周期 terminal Agent 训练数据昂贵且难以保持一致的问题。它从已经验证的 seed task 出发,扩展 reference solution,再重新对齐 instruction 和 verifier,在新的 sandbox 中验证,最后把通过的任务作为下一轮 seed。经过 15 轮递归,框架生成 37,484 个 terminal-agent tasks,单任务成本约 0.05 美元,任务难度也随着轮次增加。这个方向的实际价值是为 Agent post-training 提供可规模化、可验证、难度可控的数据来源。
摘要要点:该方法用递归验证合成长周期终端任务,并通过 rejection sampling、SFT 和 RL 验证训练数据的有效性。
11. On-Policy Self-Distillation without Any Supervision
- 点赞:218
- 机构:University of California at San Diego
- 关键词:on-policy self-distillation、self-consistency、pseudo-solution、majority vote、U-OPSD
- 链接:HF / arXiv / Project
U-OPSD 探索完全不依赖外部监督的 on-policy self-distillation。它先让模型生成多个 rollout,再通过 majority vote 和 self-consistency threshold 构造 pseudo-solution,然后让模型对不一致的 completion 做自蒸馏,重点修正“模型很自信但答错”的部分。论文在多个数学推理 benchmark、模型规模和训练设置上测试,说明模型自己的生成结果中可能已经包含足够的内部一致性信号。
摘要要点:U-OPSD 只利用模型自身生成结果,通过多数投票构造伪解,完成无标签的 on-policy 自蒸馏。
12. Apodex 1.1: Scaling Agentic Intelligence for Complex Work
- 点赞:205
- 机构:Apodex
- 关键词:agentic coordination scaling、environment scaling、AgentOS、long-horizon task decomposition
- 链接:HF / arXiv / GitHub,1340 stars / Project
Apodex 1.1 把 Agent 能力定义为 sustained, verifiable progress,也就是在真实目标上持续推进并交付可验证结果。它沿两条路线扩展:Environment Scaling 增加文件、搜索和代码环境的多样性与可验证性;Agentic Coordination Scaling 训练 Agent 分解任务、并行委派、整合异步结果和重新规划。AgentOS 与 execution harness 负责维护状态和 provenance,35B 的 Mini 版本则强调本地部署可能性。
摘要要点:Apodex 1.1 通过环境扩展、Agent 协作和状态管理,提升复杂专业任务中的持续执行能力。
13. ComBodied Agents: a New Paradigm of Human-Centric Agentic AI
- 点赞:195
- 机构:HF 页面未给出机构
- 关键词:Personal World Models、event-based multimodal perception、longitudinal memory、consent-aware support
- 链接:HF / arXiv
ComBodied Agents 提出一种以人为中心的 Agent 范式。软件 Agent 主要改变软件状态,具身 Agent 主要改变物理状态,但两者都不一定真正理解人的状态变化、意图和接受程度。论文把事件式多模态感知、可纠正的纵向记忆、Personal World Model 和 admissible intervention policy 放进一个闭环,强调 consent、uncertainty、safety、reversibility 和 user control。它更像一套架构与评测方向,适合健康 Agent、AI companion 和人机协同系统继续研究。
摘要要点:ComBodied Agents 将数字工具、传感器、机器人和人工服务作为行动通道,围绕个人状态轨迹提供有边界的支持。
14. Beyond Pixels: From Video Priors to 4D Worlds
- 点赞:188
- 机构:HF 页面未给出机构
- 关键词:4D generation、latent-to-4D、video diffusion、spatiotemporal attention、4D decoder
- 链接:HF / arXiv / GitHub,119 stars / Project
Beyond Pixels 研究如何从视频模型的 latent 直接生成动态 4D 场景。现有方案通常先生成 RGB 视频,再用单独的 4D 模型重建,容易产生分布不匹配和误差传播;或者为某个视频生成器重新训练专门的 4D 预测器,泛化和复用性不足。Latent-to-4D 通过共享 VAE 的 video latent 与预训练 4D decoder 对齐,再使用时空注意力直接预测几何。论文报告一个 checkpoint 可以迁移到多个同 VAE 家族的视频扩散 Transformer。
摘要要点:Latent-to-4D 绕过 RGB 中间结果,直接把视频 latent 转成动态 4D 世界,提高跨生成器复用能力。
![]()
15. Agentic Game Development as a Verifiable Trajectory Data Engine for Scaling World Models
- 点赞:187
- 机构:National University of Singapore
- 关键词:world models、game engine、RL post-training、executable world specification、RLHEV
- 链接:HF / arXiv
这篇论文认为 world model 的扩展不能只靠更多爬取视频和更多训练算力,还需要带 grounded reward 的递归数据引擎。游戏引擎提供了一种可执行的世界规格,可以检查碰撞、物理、可导航性和 bounded playability;开发者再提供整体接受信号。作者据此提出 Reinforcement Learning with Human-Engine Verification(RLHEV),把引擎的密集验证信号和人类对场景的隐式接受反馈结合起来,为空间世界模型的 RL post-training 提供更可靠的训练数据。
摘要要点:游戏开发环境同时提供可执行验证和长周期轨迹,可作为世界模型 post-training 的数据与奖励来源。
16. LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks
- 点赞:183
- 机构:alibaba
- 关键词:task-state management、Manage-Execute-Audit、AgentAdapter、WeaveBench、Terminal-Bench、OSWorld
- 链接:HF / arXiv / GitHub,1424 stars / Project
LongHorizon-Harness 把长周期执行重新定义为 task-state management 问题。传统 harness 把任务执行、状态和完成判断都放在不断增长的上下文里,容易让错误自评估继续污染后续决策。它提出 Manage-Execute-Audit(MEA)循环:manager 维护任务状态并选择下一步,fresh-context executor 执行子任务,read-only auditor 独立验证环境状态。论文报告在 WeaveBench、Terminal-Bench 2.1 和 OSWorld 2.0 上对不同模型都有提升。
摘要要点:该框架把经过环境验证的任务状态放到上下文之外,并通过管理、执行、审计三阶段降低长任务中的状态漂移。
17. VGI-Bench: Probing Visual Intelligence in Video Generation Models
- 点赞:177
- 机构:University of Illinois at Urbana-Champaign
- 关键词:video generation models、visual reasoning、self-correction、denoising、failure modes
- 链接:HF / arXiv / GitHub,11 stars / Project
VGI-Bench 评测视频生成模型是否具备 visual intelligence。它包含 27 个任务和 810 个实例,用两级 taxonomy 覆盖不同任务领域和技能标签,要求模型生成符合演化过程的视觉结果,而不是只得到一个看起来合理的最终画面。评测显示当前系统可以解决一部分视觉推理任务,但可靠性、自我纠错和对输入条件的稳定性仍然有限。它为“视频生成模型是否真的在推理”提供了更具体的测试工具。
摘要要点:VGI-Bench 揭示视频生成模型存在一定零样本视觉推理能力,但可靠性和自我修正能力距离实用仍有差距。
18. VoiceMem: Streaming Dual-Brain Memory for Real-Time Interaction
- 点赞:173
- 机构:Nanyang Technological University Singapore
- 关键词:speech language models、streaming memory、emotional personalization、real-time interaction
- 链接:HF / arXiv / GitHub,454 stars / Project
VoiceMem 为实时语音交互设计了 dual-brain streaming memory:一个 informational left brain 负责事实和信息记忆,一个 emotional right brain 负责情绪、人格和长期互动状态。系统还提供 memory-aware SLM training、long-horizon evaluation 和可替换 memory backend 的部署流程。论文报告 top-5 retrieval、情绪个性化和 134ms retrieval latency 等结果。它的重点是让 duplex speech model 既记得信息,也能保持连续、自然的互动关系。
摘要要点:VoiceMem 通过信息记忆与情绪记忆并行的架构,提高实时语音 Agent 的检索、个性化和低延迟能力。
19. Self-Supervised Visual On-Policy Distillation
- 点赞:170
- 机构:University of California at San Diego
- 关键词:visual on-policy distillation、teacher-student asymmetry、self-distillation、augmented views
- 链接:HF / arXiv / Project
这篇工作研究没有更大 teacher、ground truth 或 privileged annotation 时,视觉 on-policy distillation 还能否产生有效监督。它反过来制造 teacher-student asymmetry:teacher 看原始图像,student 看信息被删减或增强后的视图,让 student 在缺失部分信息的情况下学习 teacher 的分布。论文发现不对称增强有效,而对称 self-distillation 反而会降低效果;增强强度也存在最佳区间。核心经验是,差异本身不够,差异必须保持与任务相关。
摘要要点:S²VOPD 通过原图 teacher 和强增强 student 的不对称视图,在没有额外标注或更强模型的情况下构造视觉蒸馏信号。
20. Demystifying Agent Skills: Why They Work-Until They Don't
- 点赞:169
- 机构:University of California at San Diego
- 关键词:LLM agents、skills、procedural anchoring、retrieval difficulty、workflow memory
- 链接:HF / arXiv / GitHub,10 stars / Project
Demystifying Agent Skills 直接研究 Agent skill 为什么有效、什么时候失效。论文通过受控实验和轨迹对比,认为 skill 的主要作用不是注入模型缺失的事实知识,而是把 noisy trajectory 固化成 procedural anchor,稳定 Agent 的执行过程。它还指出 retrieval 是独立瓶颈:skill pool 变大后,实际调用精度会下降;skill 在上下文不兼容、假设过于脆弱或适应性不足时会失效。这篇论文对如何设计、检索和评估 skill library 很有参考价值。
摘要要点:Agent skill 主要通过程序锚定稳定行动,而不是简单注入知识;检索困难和脆弱假设是两个主要失败来源。
小结
2026 年 8 月的 Top20 很集中地指向“可验证的长周期智能”:BDH-CQ 关注低成本隐式推理,StateM 和 LongHorizon-Harness 关注任务状态,EnvHarness、OpenART 和 HarnessEval-W 关注可演化环境与评测,Spark-to-Paper、Apodex 和 Agent Skills 关注可组合的 Agent 工作流,另有多篇论文把这些问题延伸到视频、语音、机器人和 world model。整体看,社区关心的已经不只是模型一次回答得对不对,而是它能否在复杂环境中持续执行、被检查、被纠错并最终交付结果。
