arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15729 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15729 篇

2608.06329 2026-08-07 cs.CL cs.AI 新提交 62%

Benchmarking the Benchmarks: Evaluating Benchmarks for Conversational Agents

基准的基准:对话智能体的基准评估

Noam Koren, Roy Bar-Haim, Abigail Goldsteen

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 该研究针对对话智能体基准质量评估不足的问题,提出基于LLM评判员的无参考评估框架,可区分基准质量等级,适用于合成与人工整理的基准,验证了其有效性与实用性。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05876 2026-08-07 cs.AI cs.CL 新提交 62%

Personalized Deep Research Query Refinement with Graph-Scaffolded Evidence Grounding

基于图支架证据锚定的个性化深度研究查询优化

Soojin Yoon, Dongha Lee

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本研究提出G-STEER方法,通过图支架证据锚定优化用户请求为个性化研究规范,在提升深度研究智能体报告个性化的同时,大幅减少向用户提问的数量。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05695 2026-08-07 cs.AI cs.CL cs.CR 新提交 62%

DreamGuard: Efficient Runtime Guardrail for LLM Agents via Risk-Aware World Model

DreamGuard:基于风险感知世界模型的LLM智能体高效运行时护栏

Wenhao Lin, Chenyu Yu, Xingwei Lin, Sicong Cao, Xiang Chen, Lei Xue, Le Yu, Letian Sha, Chunming Wu

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 针对LLM智能体运行时护栏的长视野风险盲点问题,提出基于风险感知世界模型的主动式护栏DreamGuard,经实验验证其安全-效用权衡更优且延迟低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28609 2026-08-07 cs.AI cs.CL cs.CV 版本更新 62%

OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models

OSReward:为跨平台计算机使用奖励模型建立标准化评估

Qiushi Sun, Kanzhi Cheng, Yian Wang, Bowen Yang, Hang Yan, Liheng Chen, Fangzhi Xu, Zichen Ding, Nuo Chen, Jialin Cao, Xingdong Gong, Zehao Li, Kaiming Jin, Xinfeng Yuan, Zhoumianze Liu, Jingyang Gong, Zhangyue Yin, Jiahui Gao, Zhiyong Wu, Tianbao Xie, Jianbing Zhang, Ben Kao, Lingpeng Kong

机构 * The University of Hong Kong(香港大学) Nanjing University(南京大学) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) Fudan University(复旦大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本研究推出OSReward基准评估VLM评判者的可靠性,构建OS-Shepherd开源奖励模型缩小成本差距,为规模化可靠CUA奖励设计提供参考

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21140 2026-08-07 cs.SE cs.AI 版本更新 62%

Matching Matters: A Fair Quality-Efficiency Benchmark for Command-Line Agents

AgentMeter: 评估基于CLI的本地任务求解智能体的模型-CLI匹配

Han Chi, Jiaxin Qi, Yan Cui, Baisheng Lai, Jianqiang Huang

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) Hangzhou Institute for Advanced Study, Chinese Academy of Sciences(中国科学院杭州高等研究院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE

AI总结 提出AgentMeter基准,通过成功锚定、成本感知的AMS指标评估模型与CLI的匹配,发现模型和CLI选择不可解耦,需作为部署单元评估。

Comments 13 pages, 4 figures, 12 tables; includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04095 2026-08-06 cs.AI cs.CL 新提交 62%

FinPerMA: A Theory-Informed, Event-Grounded Personalized-Memory Benchmark for LLM Agents

FinPerMA:一种基于理论、事件驱动的LLM智能体个性化记忆基准

Ben Wang, Kang Zhou, Lifan Guo, Feng Chen, Chi Zhang

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 研究针对LLM智能体个性化记忆的现有基准不足,提出FinPerMA基准,在276个角色的2994个问题上测试7种LLM,发现其记忆配置远未饱和,简单检索优于专用记忆系统且冲击后差距扩大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03722 2026-08-06 cs.AI cs.CL 版本更新 62%

When Outputs Disperse, Does Epistemic Revision Follow? A Black-Box Diagnostic for Machine Collectives

当输出分散时,认知修正会随之而来吗?面向机器集体的黑盒耦合诊断方法

Molood Arman

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 该研究提出黑盒耦合诊断方法,评估LLM集体输出分散度干预与认知立场修正的关联,发现不同模型的错误前提恢复效应存在显著差异,建议报告立场转变及保留前提率。

Comments Reviewed at Collective Intelligence 2026 (CI 2026) Conference. Revised version incorporating reviewer feedback

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02046 2026-08-06 cs.CL cs.AI 版本更新 62%

CompanionBench: A Theory-Anchored, Real-World-Grounded Benchmark for AI Emotional Companionship

CompanionBench:一个基于理论、扎根于真实世界的AI情感陪伴基准

Yao Liu, Guangjia Chai, Yuming Huang, Jihao Huang, Lei Wang, Junchen Wan

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 该研究推出基于理论与真实数据的交互式双语AI情感陪伴基准CompanionBench,评估28个智能体发现其能力差异,指出角色扮演智能体表现差、核心能力存弱点,将发布500对中英平行数据及评估代码。

Comments 33 pages, 6 figures, 19 tables, 13 appendices. Bilingual (Chinese/English) interactive benchmark; 28 evaluated agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25073 2026-08-06 cs.CR cs.AI cs.LG 62%

Security in the Fine-Tuning Lifecycle of Large Language Models: Threats, Defenses,Evaluation, and Future Directions

大型语言模型微调生命周期中的安全:威胁、防御、评估与未来方向

Wenjuan Li, Yitao Liu, Runze Chen, Rajkumar Buyya

机构 * Hangzhou Normal University(杭州师范大学) Zhejiang University(浙江大学) China Mobile (Zhejiang) Innovation Research Institute Co., Ltd.(中国移动(浙江)创新研究院有限公司) Quantum Cloud Computing and Distributed Systems (qCLOUDS) Lab, School of Computing and Information Systems(量子云计算与分布式系统(qCLOUDS)实验室,计算与信息学院) The University of Melbourne(墨尔本大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文系统综述了大型语言模型微调过程中的安全威胁与防御,提出了基于生命周期的三阶段框架,并通过统一实验评估了攻击与防御的有效性及跨阶段局限性。

Comments 39 pages, 7 figures, 22 tables

Journal ref Software: Practice and Experience, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03206 2026-08-05 cs.CY cs.AI cs.CL 新提交 62%

EduClaw-Bench: A Long-Horizon Benchmark for Pedagogical LLM Agents with Simulated Learners

EduClaw-Bench:面向教学大型语言模型智能体的长周期基准测试集(含模拟学习者)

Unggi Lee, Sookbun Lee, Yeil Jeong, Eunjoo Lee, Minchul Shin, Hoilym Kwon

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 研究人员推出EduClaw-Bench长周期基准测试集,结合模拟学习者评估LLM智能体辅导效果,发现辅导质量取决于基础模型与智能体适配器的结合,且多数组合无法维持全程良好辅导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00155 2026-08-05 cs.AI cs.LG 交叉投稿 62%

AgentStream: How Well Do Self-Evolving LLM Agents Perform Under Streaming Tasks?

AgentStream:自进化大语言模型智能体在流式任务下的表现如何?

Dong Yan, Jian Liang, Dapeng Hu, Ran He, Nicholas Jing Yuan, Qi Zhang, Tieniu Tan

机构 * University of Chinese Academy of Sciences(中国科学院大学) Microsoft(微软公司) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Nanjing University(南京大学)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AgentStream框架,评估三种流式场景下三种基础模型的五种自进化LLM智能体方法,发现自进化表现受场景、模型能力等影响,为方法选择提供指导。

Comments Code is available at https://github.com/Jasper-Yan/AgentStream

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00301 2026-08-04 cs.LG cs.CL 新提交 62%

Abstention as an Action Can Kill Both the Reward Gradient and the KL Anchor: Collapse Law and Repair for Error-Penalized Reinforcement Learning

弃权作为一种动作会同时破坏奖励梯度和KL锚点:错误惩罚强化学习的崩溃规律与修复方案

Xujun Che, Yuchen Yuan, Weida Zhao, Chenyang Yu

专题命中 Agent评测 :agent(abstract);分类 cs.CL、cs.LG

AI总结 该研究针对错误惩罚强化学习中弃权动作导致的奖励梯度与KL锚点同时失效的问题,提出通过训练强制置信度报告的结构性修复方案,实验验证了机制并提升了语言模型的相关性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27056 2026-08-04 cs.AI cs.CL 版本更新 62%

Setoka: A Benchmark for Hierarchical User Understanding in Personalized Agents over Heterogeneous Data

Setoka:面向异构数据下个性化智能体分层用户理解的基准测试集

Lingyang Zeng, Guangze Chen, Kaichen Yu, Zhicheng Pan, Siyang Weng, Zirui Hu, Xiangyun Du, Hailin He, Rong Zhang, Chengcheng Yang, Kai Huang, Xuan Zhou

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本研究提出Setoka基准测试集,评估记忆增强型个性化智能体的分层用户理解能力,发现现有系统在需整合异构信息的任务中性能下降,推动相关记忆机制设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29771 2026-08-04 cs.AI cs.LG q-fin.CP q-fin.PM 版本更新 62%

CLQT: A Closed-Loop, Cost-Aware, Strategy-Consistent Benchmark for Diagnostic Evaluation of LLM Portfolio-Management Agents

CLQT:用于LLM投资组合管理代理诊断评估的闭环、成本感知、策略一致性基准

Bo Qu, Mingguang Chen

机构 * Illinois Institute of Technology(伊利诺伊理工学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出CLQT基准,通过闭环交易环境诊断LLM代理的决策过程,而非仅排名收益,评估五个维度的能力。

Comments 56 pages, 15 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00762 2026-08-04 cs.LG cs.AI cs.MA 版本更新 62%

Meritocratic Fairness via $K$-Shapley Values in Budgeted Combinatorial Bandits with Full-Bandit Feedback

预算化组合多臂老虎机中基于Shapley值的 meritocratic 公平性框架

Shradha Sharma, Shweta Jain, Swapnil Dhamal

机构 * Indian Institute of Technology Ropar(印度理工学院罗帕尔)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种新的预算化组合多臂老虎机框架,通过扩展Shapley值到K-Shapley值,解决了全反馈环境下个体臂贡献的计算问题,并提出了K-SVFair-FBF算法,实现了公平性与效率的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13741 2026-08-04 cs.AI cs.LG 版本更新 62%

PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning

PB²:基于偏好的强化学习中通过基于种群的方法进行偏好空间探索

Brahim Driss, Alex Davey, Riad Akrour

机构 * Univ. Lille(里尔大学) Inria(法国国家信息与自动化技术研究院) CNRS(法国国家科学研究中心) Centrale Lille(里尔中央理工大学) UMR 9189-CRIStAL(9189号研究单元-CRIStAL)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本研究针对基于偏好的强化学习中偏好空间探索不足的问题,提出PB²方法,通过维持多样化智能体种群提升偏好探索能力,在复杂环境及教师误标注场景下性能更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02330 2026-08-03 cs.CV cs.AI cs.LG 版本更新 62%

ActionParty: Multi-Subject Action Binding in Generative Video Games

ActionParty:生成视频游戏中的多主体动作绑定

Alexander Pondaven, Ziyi Wu, Igor Gilitschenski, Philip Torr, Sergey Tulyakov, Fabio Pizzati, Aliaksandr Siarohin

机构 * Snap Research(Snap研究院) University of Oxford(牛津大学) University of Toronto(多伦多大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ActionParty,一种可控制多主体的生成视频游戏世界模型,通过引入主体状态标记和空间偏置机制,提升动作关联准确性与身份一致性。

Comments ECCV 2026 - Project page: https://action-party.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28074 2026-07-31 cs.AI cs.LG 新提交 62%

Echoverse: Deep, Evolving Environments for Training Computer-Use Agents at Scale

Echoverse:用于大规模训练计算机使用智能体的深度演化环境

Yash Pandya, Sahil Gupta, Sarthak Harne, Archana Yadav, Kavyansh Chourasia, Hussein Mozannar, Vibhav Vineet, Sara Abdali, Corby Rosset, Yash Lara, Ahmed Awadallah, Ece Kamar, Akshay Nambi

机构 * Microsoft Research(微软研究院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 Echoverse是用于大规模训练计算机使用智能体的深度演化环境,其协同演化循环可提升智能体性能,经12个环境训练后9B模型准确率大幅提升,还发布了基准环境与代码

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27536 2026-07-31 cs.GT cs.AI cs.LG cs.MA 新提交 62%

Strategy, Not Payoffs: A Behavioural Embedding of Normal-Form Games

策略,而非收益:标准型博弈的行为嵌入

Joshua Caiata, Sreepriya Pulyassary, Xiang Li, Kate Larson

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出轻量双特征行为嵌入,可预测大型语言模型在不同标准型博弈间微调后的策略能力变化,证明策略能力迁移由决策行为结构而非收益几何决定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27384 2026-07-31 cs.CL cs.AI 新提交 62%

Same Facts, Different Diagnosis: Measuring and Mitigating Narrative Anchoring in Clinical Language Models

相同事实,不同诊断:临床语言模型中叙事锚定的测量与缓解

Prabhjot Singh, Pritam Deka, Vijay Chennareddy

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) Queen’s University Belfast(贝尔法斯特女王大学) Middlesex University London(伦敦密德萨斯大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本研究针对临床语言模型的叙事锚定偏差,构建含1000个USMLE案例的基准,提出NarrativeShield三智能体流水线,可大幅降低叙事锚定差距并减少不稳定决策,同时发布数据集供相关研究使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12790 2026-07-31 cs.AI cs.CL cs.MA 版本更新 62%

Who Grades the Grader? Co-Evolving Evaluation Metrics and Skills for Self-Improving LLM Agents

谁来评估评估者?用于自我改进的语言模型代理的协同进化评估指标和技能

Xing Zhang, Guanghui Wang, Yanwei Cui, Ziyuan Li, Wei Qiu, Bing Zhu, Peiyang He

机构 * Amazon(亚马逊)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 研究自我进化智能体系统中评估指标缺失问题,提出指标可进化,通过“双棘轮”协同进化指标与技能循环,在多任务中保留提升效果,还阐述安全性源于锚定规则与外部审核,为无可靠自动验证器场景提供架构。

Comments Code: https://github.com/amazon-science/Self-Evolving-Agents-Double-Ratchet

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26273 2026-07-30 cs.LG cs.AI stat.ML 新提交 62%

Top-$k$ Pareto Bandits: Hypervolume Regret for Multi-Objective Slate Selection

Nicolas Gutowski, Fabien Chhel, Alexandre Letard, Sylvain Lamprier

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

Comments 21 pages, 7 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24999 2026-07-29 cs.CL cs.AI 新提交 62%

CogArena: A Multimethod Evaluation of Cognitive Ability Structure in Large Language Models

CogArena:大语言模型认知能力结构的多方法评估

Dengzhe Hou, Lingyu Jiang, Fangzhou Lin, Kazunori D Yamada

专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.CL

AI总结 研究围绕多方法框架构建CogArena基准评估大语言模型认知能力结构,通过多模型实验,发现范式相关性多为正但组内优势不明显,冻结确认标准及复制均失败,未建立稳定五维分布,提供了结合多种要素的工作流程。

Comments 21 pages, 8 figures. Code and the procedurally generated battery: https://github.com/dengzhe-hou/CogArena

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02050 2026-07-28 cs.CY cs.AI cs.HC cs.LG 版本更新 62%

Principles and Guidelines for Randomized Controlled Trials in AI Evaluation

人工智能评估中随机对照试验的原则与指南

Christopher Kelly, Angelica Chowdhury, Alexandra Campili, Bimpe Ayoola, Devin Barbour, Thomas Chen Dawson, Ze Shen Chin, Rokas Gipiškis

专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究针对人工智能评估随机对照试验缺乏通用标准和共享词汇的问题,借鉴多学科实践综合五条原则,形成33条可操作指南,为其发挥设计工具、评估标准和标准制定蓝图的作用,提供评估标准、共享语言及指南。

Comments 33 pages, ICML 2026 (Workshop on Technical AI Governance Research) and Technical AI Safety Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24577 2026-07-28 cs.LG cs.SE 新提交 62%

Evaluating Fuzz Testing for Reinforcement Learning Agents

评估强化学习智能体的模糊测试

Zhibin Kang, Hanmo You, Dong Wang, Haiming Zheng, Junjie Chen

机构 * College of Intelligence and Computing, Tianjin University(天津大学智能与计算学部)

专题命中 Agent评测 :agent(abstract);分类 cs.LG、cs.SE

AI总结 研究针对强化学习智能体模糊测试评估差异问题,通过在三种环境下统一配置对五种方法及随机测试进行基准测试,从多角度评估,揭示不同方法特点,表明模糊测试能提升智能体鲁棒性等,还给出可操作指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23310 2026-07-28 cs.GT cs.AI cs.LG cs.MA econ.TH 新提交 62%

Online Fair Division with Budget Constraints

具有预算约束的在线公平分配

Saar Cohen, Nicholas Teh, Paul W. Goldberg, Michael J. Wooldridge

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 研究广义分配预算约束下离散公平分配的在线变体,确定有界密度扩展条件并获近似算法,研究资源增强及刻画保证改进,还开发学习增强框架,证明其性质及单独预测边际的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22667 2026-07-28 cs.AI cs.IT cs.LG cs.RO cs.SY eess.SP eess.SY math.IT 新提交 62%

Reinforcement Learning for Heterogeneous Sensor Selection in Maritime Surveillance

用于海上监视中异构传感器选择的强化学习

Andrei Starodubov, Yaqub Aris Prabowo, Andreas Hadjipieris, Roberto Galeazzi, Ioannis Kyriakides

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 针对异构海上传感器网络单船跟踪问题,提出信息增益引导的强化学习传感器选择框架,通过近端策略优化智能体选传感器,结合贝叶斯跟踪器估计船只状态,经模拟比较,该策略在单传感器激活下性能接近全传感且避免复杂计算。

Comments 5 pages, 4 figures, submitted to the IEEE MetroSea 2026 Conference: Special Session 13: Object Detection, Tracking, and Sensor Fusion for Maritime Situational Awareness

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27476 2026-07-28 cs.AI cs.LG 版本更新 62%

PeopleSearchBench: A Multi-Dimensional Benchmark for Evaluating AI-Powered People Search Platforms

PeopleSearchBench: 一个多维度基准,用于评估人工智能驱动的人力搜索平台

Wei Wang, Tianyu Shi, Shuai Zhang, Boyang Xia, Zequn Xie, Chenyu Zeng, Qi Zhang, Lynn Ai, Yaqi Yu, Kaiming Zhang, Feiyue Tang, Lei Ding

机构 * LessieAI research team(LessieAI 研究团队)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出PeopleSearchBench,一个开源基准,评估四个人力搜索平台在119个真实查询中的表现,采用事实验证方法,提出Criterions-Grounded Verification,评估三个维度:相关性精度、有效覆盖和信息效用,Lessie在所有指标中表现最佳。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01496 2026-07-28 cs.GT cs.AI cs.LG 版本更新 62%

The Optimal Sample Complexity of Linear Contracts

线性合约的最优样本复杂度

Mikael Møller Høgsgaard

机构 * Department of Statistics, University of Oxford, United Kingdom(英国牛津大学统计系) Department of Computer Science, Aarhus University, Denmark(丹麦奥胡斯大学计算机科学系)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文通过经验效用最大化算法,证明仅需 O(ln(1/δ)/ε²) 个样本即可实现最优线性合约的 ε-近似,并匹配下界,从而确立最优样本复杂度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03059 2026-07-28 cs.LG cs.AI 版本更新 62%

Loong: Synthesize Long Chain-of-Thoughts at Scale through Verifiers

Loong:通过验证器大规模合成长思维链

Xingyue Huang, Rishabh, Gregor Franke, Ziyi Yang, Jiamu Bai, Weijie Bai, Jinhe Bi, Zifeng Ding, Yiqun Duan, Chengyu Fan, Wendong Fan, Xin Gao, Ruohao Guo, Yuan He, Zhuangzhuang He, Xianglong Hu, Neil Johnson, Bowen Li, Fangru Lin, Siyu Lin, Tong Liu, Yunpu Ma, Hao Shen, Hao Sun, Beibei Wang, Fangyijie Wang, Hao Wang, Haoran Wang, Yang Wang, Yifeng Wang, Zhaowei Wang, Ziyang Wang, Yifan Wu, Zikai Xiao, Chengxing Xie, Fan Yang, Junxiao Yang, Qianshuo Ye, Ziyu Ye, Guangtao Zeng, Yuwen Ebony Zhang, Zeyu Zhang, Zihao Zhu, Bernard Ghanem, Philip Torr, Guohao Li

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 研究针对将LLMs推理能力扩展到其他领域的挑战,提出Loong项目这一开源框架,由LoongBench和LoongEnv组成,通过它们形成强化学习的智能体-环境循环,经实验评估及对合成数据的分析,推动推理密集型领域发展。

详情

展开后加载摘要…

URL PDF HTML 收藏