EADST

2026年8月 Hugging Face Papers Top20 论文速读

数据来自 Hugging Face Papers 2026-08 月榜,按页面 upvotes 排序取 Top20。本月高热度方向主要集中在推理模型、长周期 Agent、world model、视频安全与视觉推理、Agent skill,以及可验证的研究和软件工程流程。

说明:机构字段使用 Hugging Face 页面里的 organization,不等同于完整作者单位;缺失时标注为“HF 页面未给出机构”。点赞和 GitHub stars 为 2026 年 9 月 1 日抓取时页面显示的数值。

简单统计

入选论文数        20
总点赞数          5382
平均点赞数        269.1
GitHub 覆盖       14 / 20
项目主页覆盖      16 / 20
排序方式          Hugging Face upvotes 降序

Top20

1. BDH-CQ: In-Context Learning with Recurrent Latent Reasoning

  • 点赞:766
  • 机构:Pathway
  • 关键词:in-context learning、recurrent latent reasoning、ARC-AGI-1、cost-accuracy Pareto frontier
  • 链接:HF / arXiv / GitHub,9666 stars / Project

BDH-CQ 将 in-context learning 和 recurrent latent reasoning 结合起来。推理时,输入示例会持续更新模型的 recurrent memory,模型随后在高维 latent space 中迭代求解,而不是把中间思考过程全部 verbalize 出来。论文在 ARC-AGI-1 上测试,并用 ARC-like intervention 研究模型是否真正从示例中归纳转换规则。150M 参数配置达到 29.5% pass@2,单任务计算成本约 0.0007 美元,核心卖点是用很小的模型取得较好的 cost-accuracy 平衡。

摘要要点:BDH-CQ 通过循环隐空间推理和上下文学习,在 ARC-AGI-1 上探索低成本的推理模型路线。

BDH-CQ paper card

2. StateM: Reaching 95.3% Raw Accuracy, or a \$15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling

  • 点赞:445
  • 机构:HF 页面未给出机构
  • 关键词:agent-native runtime、durable states、checked transitions、recoverable runbooks、Terminal-Bench
  • 链接:HF / arXiv / GitHub,798 stars / Project

StateM 认为长周期 Agent 的失败不一定来自模型能力不足,也可能是状态丢失、流程没有重新激活、已知步骤被跳过或任务过早终止。它不改模型权重,而是在模型外围加入 agent-native runtime,用 durable states、phase-local context、checked transitions、recoverable runbooks 和 versioned procedures 管理执行过程。论文报告在 Terminal-Bench 2.1 上显著提升多个模型的结果,说明 harness scaling 可能是提高 Agent 可靠性的另一条路径。

摘要要点:StateM 通过持久状态、可恢复 runbook 和可检查状态转移,提升长周期终端任务的执行稳定性。

Macaron-V1 paper card

3. Macaron-V1: Towards Open Continual Learning with Self-Improvement and Mixture-of-LoRA

  • 点赞:342
  • 机构:Mind Lab
  • 关键词:Mixture-of-LoRA、continual learning、recursive self-improvement、Model-Harness Co-design
  • 链接:HF / arXiv

Macaron-V1 面向 experiential intelligence,也就是让 Agent 从真实环境中的经验学习,并在部署之后继续改进。它一方面通过 versioned model-harness pairs 做递归改进,另一方面使用 Mixture-of-LoRA 组合多个 specialist adapter,每轮交互选择合适的 LoRA。旗舰版本将不同 adapter 分别用于 chat、agent、coding 和 GenUI,较小版本则面向本地部署。它的核心思想不是训练一个永远固定的模型,而是让基础模型、专长 adapter 和 harness 一起演化。

摘要要点:Macaron-V1 用 Mixture-of-LoRA 和递归自我改进支持持续学习与多专长协作。

4. HarnessEval-W: Agentifying the Evaluation of Visual Worlds

  • 点赞:339
  • 机构:MirroS
  • 关键词:world model benchmarking、agentified evaluation、evidence tree、reasoning chain
  • 链接:HF / arXiv / GitHub,278 stars / Project

HarnessEval-W 解决 world model 评测只给一个 scalar score 的问题。判断一个 rollout 是否合理,需要检查物理、因果关系和世界状态是否正确演化。它使用分层 sub-agents,把评测问题拆成可验证的子问题,每个子 Agent 配备对应上下文和诊断工具,父 Agent 再汇总证据形成最终判断。这样每次评测都会生成一棵 evidence tree,而不是只输出一个无法解释的分数。

摘要要点:HarnessEval-W 将 Agent harness 引入 world model benchmark,用可追溯推理链和证据树解释评测结果。

5. Spark-to-Paper: End-to-End Research Paper Generation as a Composable Skill

  • 点赞:289
  • 机构:HF 页面未给出机构
  • 关键词:composable skills、citation validity、figure editability、fabrication detection、self-refutation loop
  • 链接:HF / arXiv / GitHub,858 stars / Project

Spark-to-Paper 把论文生成拆成 13 个可组合 skill,直接运行在现有 coding assistant 里,不要求额外的 Agent 平台。它区分模型判断和确定性操作,也把实验规划和结果报告分开,要求先规定证据,再根据真实结果修正论文结论。系统还加入 citation validity、figure editability、fabrication detection 和 adversarial review,并专门讨论 Self-Refutation Loop,即实验持续否定原始研究目标时如何停止或修正流程。它更像一套研究自动化工作流,而不是一个单纯的写作 prompt。

摘要要点:Spark-to-Paper 通过可组合 skill、确定性检查和自我批评,尝试降低自动论文生成中的引用错误、图表不可编辑和结果编造。

6. Can We Defend Against AI-Generated Video Attacks on Real-World Crisis Events? A Systematic Evaluation of Detectors, Generators and Social Dissemination

  • 点赞:281
  • 机构:Hugging Face
  • 关键词:AI-generated video detection、RA-Bench、MLLMs、detector generalization、social dissemination
  • 链接:HF / arXiv / GitHub,98 stars / Project

RA-Bench 研究真实危机事件中的 AI 生成视频攻击,包括战争、灾害、公共安全等场景。数据集包含 17,886 个视频,其中有 1,830 个真实视频 anchor 和 16,056 个来自开源、闭源生成器的生成视频。论文从检测器泛化、生成条件变化和社交传播三个角度测试传统 detector、zero-shot multimodal model 和专门微调的 MLLM。结果表明,现有检测器在真实复杂视频上泛化不稳定,而且视频经过社交传播后更难检测。

摘要要点:RA-Bench 说明当前 AI 视频检测器难以跨生成器和真实危机场景泛化,传播过程还会进一步降低检测可靠性。

7. EnvHarness: Awakening Static Worlds for Agent Learning

  • 点赞:273
  • 机构:Google
  • 关键词:Environment Harness、EnvRigger、black-box policy、reinforcement learning、co-evolution
  • 链接:HF / arXiv / GitHub,466 stars / Project

EnvHarness 针对 Agent 训练环境静态、无法跟随模型弱点变化的问题。它在不修改原环境逻辑的情况下,通过插件层重新塑造环境行为,同时保留原有 verifier。EnvRigger 把被测 Agent 当成 black-box policy,观察执行轨迹,生成针对性环境组件,再用新的 rollout 验证这些组件是否真的击中了模型弱点。相比从头生成环境,这种方法更轻量,也更容易迁移到不同领域。

摘要要点:EnvHarness 用可编程插件动态改造静态环境,EnvRigger 根据 Agent 轨迹生成针对性训练和评测场景。

8. VBVR-Pro: A Scalable and Verifiable Suite for Native Visual Reasoning

  • 点赞:268
  • 机构:Video-Reason
  • 关键词:native visual reasoning、visual generation、verifiable reward scorers、multi-task RL、interleaved generation
  • 链接:HF / arXiv / GitHub,25 stars / Project

VBVR-Pro 把视觉生成本身当成推理介质,图像和视频不是单纯的输入或最后输出,而是问题求解过程中的中间状态。它提供 300 个程序生成任务、810 个实例和可验证 reward scorer,避免完全依赖 VLM-as-a-judge。论文还比较了 30 多种图像、视频和 interleaved generator,发现视频生成更适合持续的时空状态跟踪,而 interleaved generation 在计算效率上更有优势。

摘要要点:VBVR-Pro 为 native visual reasoning 提供可扩展任务、确定性奖励和跨生成介质的对比实验。

EnvHarness paper card

9. OpenART: Scaling Agent Red Teaming via Open-Ended Environment Evolution

  • 点赞:263
  • 机构:HF 页面未给出机构
  • 关键词:stateful scenarios、EMHA、environment evolution、agent safety、Attack Success Rate
  • 链接:HF / arXiv / GitHub,97 stars

OpenART 面向长周期 Agent 的红队测试。传统安全 benchmark 多是短任务、静态状态,无法模拟早期状态修改对后续决策的累积影响。OpenART 提供超过 10,000 个有状态场景、50 个领域和超过 500,000 个工具与 skill,并提出 Evolutionary Markov Hypergraph Attack(EMHA),通过反馈驱动的状态转移不断演化环境。论文报告复杂度越高,环境演化越容易暴露 Agent 安全失败,且 Agent runtime 的实现方式本身会显著影响安全结果。

摘要要点:OpenART 通过持续演化的有状态环境测试 Agent 安全性,重点揭示长链路工具调用中的累积风险。

10. Recursive Synthesis for Long-Horizon Terminal Tasks

  • 点赞:251
  • 机构:Tencent Hunyuan
  • 关键词:recursive verified synthesis、terminal-agent tasks、supervised fine-tuning、agentic PPO
  • 链接:HF / arXiv / Project

Recursive Synthesis 解决长周期 terminal Agent 训练数据昂贵且难以保持一致的问题。它从已经验证的 seed task 出发,扩展 reference solution,再重新对齐 instruction 和 verifier,在新的 sandbox 中验证,最后把通过的任务作为下一轮 seed。经过 15 轮递归,框架生成 37,484 个 terminal-agent tasks,单任务成本约 0.05 美元,任务难度也随着轮次增加。这个方向的实际价值是为 Agent post-training 提供可规模化、可验证、难度可控的数据来源。

摘要要点:该方法用递归验证合成长周期终端任务,并通过 rejection sampling、SFT 和 RL 验证训练数据的有效性。

11. On-Policy Self-Distillation without Any Supervision

  • 点赞:218
  • 机构:University of California at San Diego
  • 关键词:on-policy self-distillation、self-consistency、pseudo-solution、majority vote、U-OPSD
  • 链接:HF / arXiv / Project

U-OPSD 探索完全不依赖外部监督的 on-policy self-distillation。它先让模型生成多个 rollout,再通过 majority vote 和 self-consistency threshold 构造 pseudo-solution,然后让模型对不一致的 completion 做自蒸馏,重点修正“模型很自信但答错”的部分。论文在多个数学推理 benchmark、模型规模和训练设置上测试,说明模型自己的生成结果中可能已经包含足够的内部一致性信号。

摘要要点:U-OPSD 只利用模型自身生成结果,通过多数投票构造伪解,完成无标签的 on-policy 自蒸馏。

12. Apodex 1.1: Scaling Agentic Intelligence for Complex Work

  • 点赞:205
  • 机构:Apodex
  • 关键词:agentic coordination scaling、environment scaling、AgentOS、long-horizon task decomposition
  • 链接:HF / arXiv / GitHub,1340 stars / Project

Apodex 1.1 把 Agent 能力定义为 sustained, verifiable progress,也就是在真实目标上持续推进并交付可验证结果。它沿两条路线扩展:Environment Scaling 增加文件、搜索和代码环境的多样性与可验证性;Agentic Coordination Scaling 训练 Agent 分解任务、并行委派、整合异步结果和重新规划。AgentOS 与 execution harness 负责维护状态和 provenance,35B 的 Mini 版本则强调本地部署可能性。

摘要要点:Apodex 1.1 通过环境扩展、Agent 协作和状态管理,提升复杂专业任务中的持续执行能力。

13. ComBodied Agents: a New Paradigm of Human-Centric Agentic AI

  • 点赞:195
  • 机构:HF 页面未给出机构
  • 关键词:Personal World Models、event-based multimodal perception、longitudinal memory、consent-aware support
  • 链接:HF / arXiv

ComBodied Agents 提出一种以人为中心的 Agent 范式。软件 Agent 主要改变软件状态,具身 Agent 主要改变物理状态,但两者都不一定真正理解人的状态变化、意图和接受程度。论文把事件式多模态感知、可纠正的纵向记忆、Personal World Model 和 admissible intervention policy 放进一个闭环,强调 consent、uncertainty、safety、reversibility 和 user control。它更像一套架构与评测方向,适合健康 Agent、AI companion 和人机协同系统继续研究。

摘要要点:ComBodied Agents 将数字工具、传感器、机器人和人工服务作为行动通道,围绕个人状态轨迹提供有边界的支持。

14. Beyond Pixels: From Video Priors to 4D Worlds

  • 点赞:188
  • 机构:HF 页面未给出机构
  • 关键词:4D generation、latent-to-4D、video diffusion、spatiotemporal attention、4D decoder
  • 链接:HF / arXiv / GitHub,119 stars / Project

Beyond Pixels 研究如何从视频模型的 latent 直接生成动态 4D 场景。现有方案通常先生成 RGB 视频,再用单独的 4D 模型重建,容易产生分布不匹配和误差传播;或者为某个视频生成器重新训练专门的 4D 预测器,泛化和复用性不足。Latent-to-4D 通过共享 VAE 的 video latent 与预训练 4D decoder 对齐,再使用时空注意力直接预测几何。论文报告一个 checkpoint 可以迁移到多个同 VAE 家族的视频扩散 Transformer。

摘要要点:Latent-to-4D 绕过 RGB 中间结果,直接把视频 latent 转成动态 4D 世界,提高跨生成器复用能力。

Beyond Pixels paper card

15. Agentic Game Development as a Verifiable Trajectory Data Engine for Scaling World Models

  • 点赞:187
  • 机构:National University of Singapore
  • 关键词:world models、game engine、RL post-training、executable world specification、RLHEV
  • 链接:HF / arXiv

这篇论文认为 world model 的扩展不能只靠更多爬取视频和更多训练算力,还需要带 grounded reward 的递归数据引擎。游戏引擎提供了一种可执行的世界规格,可以检查碰撞、物理、可导航性和 bounded playability;开发者再提供整体接受信号。作者据此提出 Reinforcement Learning with Human-Engine Verification(RLHEV),把引擎的密集验证信号和人类对场景的隐式接受反馈结合起来,为空间世界模型的 RL post-training 提供更可靠的训练数据。

摘要要点:游戏开发环境同时提供可执行验证和长周期轨迹,可作为世界模型 post-training 的数据与奖励来源。

16. LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks

  • 点赞:183
  • 机构:alibaba
  • 关键词:task-state management、Manage-Execute-Audit、AgentAdapter、WeaveBench、Terminal-Bench、OSWorld
  • 链接:HF / arXiv / GitHub,1424 stars / Project

LongHorizon-Harness 把长周期执行重新定义为 task-state management 问题。传统 harness 把任务执行、状态和完成判断都放在不断增长的上下文里,容易让错误自评估继续污染后续决策。它提出 Manage-Execute-Audit(MEA)循环:manager 维护任务状态并选择下一步,fresh-context executor 执行子任务,read-only auditor 独立验证环境状态。论文报告在 WeaveBench、Terminal-Bench 2.1 和 OSWorld 2.0 上对不同模型都有提升。

摘要要点:该框架把经过环境验证的任务状态放到上下文之外,并通过管理、执行、审计三阶段降低长任务中的状态漂移。

17. VGI-Bench: Probing Visual Intelligence in Video Generation Models

  • 点赞:177
  • 机构:University of Illinois at Urbana-Champaign
  • 关键词:video generation models、visual reasoning、self-correction、denoising、failure modes
  • 链接:HF / arXiv / GitHub,11 stars / Project

VGI-Bench 评测视频生成模型是否具备 visual intelligence。它包含 27 个任务和 810 个实例,用两级 taxonomy 覆盖不同任务领域和技能标签,要求模型生成符合演化过程的视觉结果,而不是只得到一个看起来合理的最终画面。评测显示当前系统可以解决一部分视觉推理任务,但可靠性、自我纠错和对输入条件的稳定性仍然有限。它为“视频生成模型是否真的在推理”提供了更具体的测试工具。

摘要要点:VGI-Bench 揭示视频生成模型存在一定零样本视觉推理能力,但可靠性和自我修正能力距离实用仍有差距。

18. VoiceMem: Streaming Dual-Brain Memory for Real-Time Interaction

  • 点赞:173
  • 机构:Nanyang Technological University Singapore
  • 关键词:speech language models、streaming memory、emotional personalization、real-time interaction
  • 链接:HF / arXiv / GitHub,454 stars / Project

VoiceMem 为实时语音交互设计了 dual-brain streaming memory:一个 informational left brain 负责事实和信息记忆,一个 emotional right brain 负责情绪、人格和长期互动状态。系统还提供 memory-aware SLM training、long-horizon evaluation 和可替换 memory backend 的部署流程。论文报告 top-5 retrieval、情绪个性化和 134ms retrieval latency 等结果。它的重点是让 duplex speech model 既记得信息,也能保持连续、自然的互动关系。

摘要要点:VoiceMem 通过信息记忆与情绪记忆并行的架构,提高实时语音 Agent 的检索、个性化和低延迟能力。

19. Self-Supervised Visual On-Policy Distillation

  • 点赞:170
  • 机构:University of California at San Diego
  • 关键词:visual on-policy distillation、teacher-student asymmetry、self-distillation、augmented views
  • 链接:HF / arXiv / Project

这篇工作研究没有更大 teacher、ground truth 或 privileged annotation 时,视觉 on-policy distillation 还能否产生有效监督。它反过来制造 teacher-student asymmetry:teacher 看原始图像,student 看信息被删减或增强后的视图,让 student 在缺失部分信息的情况下学习 teacher 的分布。论文发现不对称增强有效,而对称 self-distillation 反而会降低效果;增强强度也存在最佳区间。核心经验是,差异本身不够,差异必须保持与任务相关。

摘要要点:S²VOPD 通过原图 teacher 和强增强 student 的不对称视图,在没有额外标注或更强模型的情况下构造视觉蒸馏信号。

20. Demystifying Agent Skills: Why They Work-Until They Don't

  • 点赞:169
  • 机构:University of California at San Diego
  • 关键词:LLM agents、skills、procedural anchoring、retrieval difficulty、workflow memory
  • 链接:HF / arXiv / GitHub,10 stars / Project

Demystifying Agent Skills 直接研究 Agent skill 为什么有效、什么时候失效。论文通过受控实验和轨迹对比,认为 skill 的主要作用不是注入模型缺失的事实知识,而是把 noisy trajectory 固化成 procedural anchor,稳定 Agent 的执行过程。它还指出 retrieval 是独立瓶颈:skill pool 变大后,实际调用精度会下降;skill 在上下文不兼容、假设过于脆弱或适应性不足时会失效。这篇论文对如何设计、检索和评估 skill library 很有参考价值。

摘要要点:Agent skill 主要通过程序锚定稳定行动,而不是简单注入知识;检索困难和脆弱假设是两个主要失败来源。

小结

2026 年 8 月的 Top20 很集中地指向“可验证的长周期智能”:BDH-CQ 关注低成本隐式推理,StateM 和 LongHorizon-Harness 关注任务状态,EnvHarness、OpenART 和 HarnessEval-W 关注可演化环境与评测,Spark-to-Paper、Apodex 和 Agent Skills 关注可组合的 Agent 工作流,另有多篇论文把这些问题延伸到视频、语音、机器人和 world model。整体看,社区关心的已经不只是模型一次回答得对不对,而是它能否在复杂环境中持续执行、被检查、被纠错并最终交付结果。

相关标签
About Me
XD
Goals determine what you are going to be.
Category
标签云
Pickle API uwsgi FP8 Mixtral Permission Heatmap Github Python Clash Excel v0.dev COCO Baidu Proxy FP16 Pytorch Web UI SVR HuggingFace SQL 论文速读 Safetensors PDF 第一性原理 git-lfs Cloudreve 域名 Sklearn 论文 Random CEIR 图标 Algorithm ms-swift Domain WebCrawler 搞笑 Paddle 强化学习 uWSGI ResNet-50 Magnet YOLO OpenAI Quantize BF16 Windows Bert 音频 GPT4 PDB Transformers Land LoRA 继承 LeetCode JSON Disk NLTK Attention Tracking Anaconda v2ray Ubuntu CUDA Qwen2.5 云服务器 News Vim mmap Pillow torchinfo GoogLeNet SQLite 多线程 Input OpenCV Video Base64 NLP 算法题 版权 RL Numpy Template VPN IndexTTS2 LLAMA XML tqdm 签证 ChatGPT Augmentation icon Paper UNIX VSCode Gemma Bin XGBoost Plate LLM 证件照 Llama GIT Zip Google Use git QWEN Qwen 财报 Ptyhon Linux 公式 NameSilo Streamlit tar Qwen2 Interview Logo Bipartite 飞书 Datetime CAM Claude FP32 FastAPI LaTeX GGML CC PyCharm Food Agent SAM Quantization Shortcut Search Statistics BTC C++ scipy EXCEL CSV Conda Math Bitcoin BeautifulSoup 多进程 Hotel PyTorch logger 关于博主 Michelin CV FlashAttention ONNX InvalidArgumentError 报税 Distillation 腾讯云 Pandas GPTQ 递归学习法 Hilton RGB Animate Data WAN Card Tiktoken DeepStream ModelScope hf Password FP64 Knowledge CTC Git llama.cpp Crawler DeepSeek Review Website Breakpoint AI Jupyter MD5 TSV TTS CLAP diffusers Jetson RAR Miniforge VGG-16 顶会 HaggingFace TensorFlow Tensor 阿里云 Plotly Image2Text Markdown SPIE Freesound Firewall Dataset TensorRT Translation OCR Rebuttal Diagram 净利润 transformers Docker Color printf Hungarian PIP Nginx Django 图形思考法 Vmess
站点统计

本站现有博文334篇,共被浏览929803

本站已经建立2638天!

热门文章
文章归档
回到顶部