arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15729 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15729 篇

2608.18351 2026-08-20 cs.CR cs.AI cs.LG cs.SY eess.SY 新提交 62%

Task-Conditioned Least-Privilege Learning for Executable Terminal and MCP Agents

面向可执行终端与MCP智能体的任务条件最小权限学习

Alexander Tu, Michael Tu

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出任务条件最小权限学习框架,通过后训练优化4B参数模型的权限选择,使智能体超额权限错误率大幅降低,安全成功率显著提升,可作为工具使用智能体的额外控制层。

Comments This work has been submitted to the IEEE for possible publication. Copyright may be transferred without notice, after which this version may no longer be accessible

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04156 2026-08-20 cs.AI cs.LG 版本更新 62%

BrainBench: Benchmarking Large Language Models for Comprehensive EEG Understanding

BrainBench:面向全面脑电理解的大语言模型基准测试

Yangxuan Zhou, Yuning Chen, Chen Wu, Jiquan Wang, Shijian Li, Gang Pan, Sha Zhao

机构 * Zhejiang University(浙江大学) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 该研究推出BrainBench基准测试,涵盖4个子集共17个数据集等,评估大语言模型在两种范式下的脑电理解能力,为相关研究提供可复现测试平台。

Comments 51 pages,28 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17373 2026-08-19 cs.LG cs.AI 新提交 62%

Integrating Novelty and Surprise for Experience Prioritization and Exploration in Image-Based Reinforcement Learning

将新颖性与意外性结合用于基于图像的强化学习中的经验优先级排序与探索

Hoda Yamani, Henry Williams, Bruce A. MacDonald

机构 * University of Auckland(奥克兰大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出NSPER及扩展的NSPER+R,将新颖性与意外性结合,在DeepMind Control Suite任务上提升了基于图像的强化学习的训练效率与收敛速度。

Comments 9 pages, 4 figures. Published in International Journal of Computer and Systems Engineering, 2026. Code: https://github.com/UoA-CARES/NSPER

Journal ref International Journal of Computer and Systems Engineering, Vol. 20, No. 4, pp. 439-447, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01008 2026-08-19 cs.SE cs.AI 版本更新 62%

FVSpec: Real-World Property-Based Tests as Lean Challenges

FVSpec: 作为精益挑战的真实世界基于属性的测试

Quinn Dougherty, Max von Hippel, Simon Henniger, Hazel Shackleton, Mike Dodds

机构 * Forall R&D(Forall 研发) Benchify Galois Inc(Galois 公司)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE

AI总结 提出FVSpec基准,通过从真实Python仓库中提取属性测试并自动翻译为Lean 4规范,评估AI在形式化验证任务上的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16371 2026-08-19 cs.CV cs.AI cs.LG 62%

Cataract-LMM Large-Scale Multi-Source Multi-Task Benchmark for Deep Learning in Surgical Video Analysis

白内障LMM大规模多源多任务基准用于手术视频分析中的深度学习

Mohammad Javad Ahmadi, Iman Gandomi, Parisa Abdi, Seyed-Farzad Mohammadi, Amirhossein Taslimi, Mehdi Khodaparast, Hassan Hashemi, Mahdi Tavakoli, Hamid D. Taghirad

机构 * Applied Robotics and AI Solutions (ARAS)(应用机器人与人工智能解决方案) Faculties of Electrical and Computer Engineering(电气与计算机工程学院) K.N. Toosi University of Technology(卡里姆·纳尼·托西技术大学) Translational Ophthalmology Research Center(转化眼科研究中心) Farabi Eye Hospital(法拉比眼科医院) Tehran University of Medical Sciences(德黑兰医科大学) Noor Ophthalmology Research Center(努尔眼科研究中心) University of Alberta(阿尔伯塔大学) Departments of Electrical and Computer Engineering & Biomedical Engineering(电气与计算机工程及生物医学工程系)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一个包含3000个白内障超声乳化手术视频的数据集,用于训练通用深度学习模型,通过多任务基准验证了模型在手术流程识别、场景分割等方面的效果。

Comments 28 pages, 14 figures, 15 tables. Data descriptor for the Cataract-LMM benchmark dataset. Source code and dataset are available

Journal ref Scientific Data, vol. 13, p. 1189, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25459 2026-08-19 cs.CL cs.LG 版本更新 62%

SimulRAG: Simulator-based RAG for Grounding LLMs in Long-form Scientific QA

SimulRAG:基于模拟器的检索增强生成(RAG)框架,用于将大型语言模型(LLMs)落地到长篇科学问答任务中

Haozhou Xu, Dongxia Wu, Matteo Chinazzi, Ruijia Niu, Rose Yu, Yi-An Ma

机构 * University of California San Diego(加州大学圣迭戈分校) Stanford University(斯坦福大学) Northeastern University(东北大学)

专题命中 Agent评测 :planning(abstract);分类 cs.CL、cs.LG

AI总结 针对LLMs在长篇科学问答中易幻觉的问题,本文提出SimulRAG框架,引入UE+SBA机制,发布相关基准,实验表明其信息量与事实性较基线分别提升30.4%、16.3%

Comments Haozhou Xu and Dongxia Wu are co-first authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14677 2026-08-18 eess.SP cs.AI cs.LG 新提交 62%

Offline Ambient-Controlled Latent Diffusion: Architecture, Telemetry, and On-Device Evaluation

离线环境光控制潜在扩散:架构、遥测与设备端评估

Lech Kalinowski, Artur Morys-Magiera, Piotr Miłkowski

专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 该研究开发了一款设备端Android潜在扩散图像生成应用,以环境光传感器驱动而非文本提示,通过绑定传感器读数等实现离线审计,验证了环境光依赖的保留及设备端运行的延迟表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14620 2026-08-18 cs.LG cs.AI 新提交 62%

Explaining Reinforcement Learning Decisions in Self-adaptive Systems

解释自适应系统中强化学习的决策

Jasmina Gajcin, Juan C. Rosero, Ivana Dusparic

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 针对强化学习策略透明度不足的问题,本文提出EARL库用于生成反事实解释,并在CitiBikes模拟中验证了其在实际自适应系统中的适用性。

Comments Accepted in the 20th Colombian Computing Congress. 13 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14109 2026-08-17 cs.AI cs.LG cs.MA 新提交 62%

A Graph-Based Reinforcement Learning Framework for Structured Drift Diagnosis and Recovery in Autonomous LLM Agents

面向自主大语言模型智能体中结构化漂移诊断与恢复的基于图的强化学习框架

Ismail El Hamraoui, Sagar Jose, Nicolas Bureau, Robert Plana

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本研究针对自主LLM智能体的运行时行为漂移问题,提出基于图的强化学习即插即用恢复框架,经AppWorld基准验证,该框架可利用漂移信息做出正确恢复决策且输出符合要求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15808 2026-08-17 q-bio.QM cs.AI cs.CV cs.LG 62%

Foundation Models in Biomedical Imaging: Turning Hype into Reality

生物医学影像中的基础模型:从 hype 到现实

Amgad Muneer, Kai Zhang, Ibraheem Hamdi, Rizwan Qureshi, Muhammad Waqas, Shereen Fouad, Hazrat Ali, Syed Muhammad Anwar, Jia Wu

机构 * Department of Imaging Physics, The University of Texas MD Anderson Cancer Center(影像物理系,德克萨斯大学MD安德森癌症中心) Center for Secure Artificial Intelligence for Healthcare (SAFE), McWilliams School of Biomedical Informatics, UTHealth Houston(安全人工智能用于医疗保健中心(SAFE),麦威廉斯生物医学信息学学院,UTHealth休斯顿) Female Medicine in Machine Learning, Massachusetts Institute of Technology(机器学习中的女性医学,麻省理工学院) Department of Computer Science, Salim Habib University(计算机科学系,Salim Habib大学) School of Computer Science and Digital Technologies, Aston Centre for Artificial Intelligence Research and Application, Aston University(计算机科学与数字技术学院,阿斯顿人工智能研究与应用中心,阿斯顿大学) Division of Computing Science and Mathematics, University of Stirling(计算科学与数学系,斯特灵大学) School of Medicine and Health Sciences, George Washington University(医学与健康科学学院,乔治·华盛顿大学) Sheikh Zayed Institute for Pediatric Surgical Innovation, Children’s National Hospital(谢赫扎耶德儿童外科创新研究所,儿童医院) Department of Thoracic/Head and Neck Medical Oncology, The University of Texas MD Anderson Cancer Center(胸腔/头颈医学肿瘤科,德克萨斯大学MD安德森癌症中心)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了基础模型在生物医学影像中的应用,提出REAL-FM框架以评估模型的实际临床价值,指出基础模型在因果推理和安全性方面存在不足,强调需要协调的专业AI系统。

Comments 9 figures and 3 tables

Journal ref Nature Biomedical Engineering 10, 1557-1575 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11616 2026-08-14 cs.AI cs.CV cs.LG 版本更新 62%

MBA: Multimodal Benchmark and Agents for Real-World Business Ideation

MBA:面向现实世界商业创意的多模态基准与智能体

Hojun Choi, Jaeyo Shin, Suin Lee, Hyunjung Shim

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 该研究推出首个多模态商业创意基准MBA-Bench,提出MBA-b和MBA-k两种智能体,经实验其性能显著优于相关基准,为多模态商业创意智能体研究提供了重要支撑。

Comments Project page: https://hchoi256.github.io/projects/mba/ Code: https://github.com/hchoi256/MBA

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06564 2026-08-14 cs.LG cs.CL 版本更新 62%

Which Decisions Low-Bit Quantization Breaks, and How to Predict Them

量化损伤是乘法性的,而非加法性的

Zekun Wu, Swati Dhiman, Adriano Koshiyama

机构 * Holistic AI(霍利斯提克人工智能公司) University College London(伦敦大学学院)

专题命中 Agent评测 :agent(abstract);分类 cs.CL、cs.LG

AI总结 该研究发现大型语言模型的量化损伤是乘法性的,而非加法性的,提出边际收缩概念,拟合关系可准确预测决策翻转率,增加1位是修复损伤最廉价的方式。

Comments 18 pages, 9 figures, 8 tables. Under review at the Third Workshop on Uncertainty-Aware NLP (UncertaiNLP), EMNLP 2026 (non-archival)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11381 2026-08-13 cs.AI cs.LG 新提交 62%

From Numbers to Judgment: Specialist LLM Agents and Reinforcement Learning for European Listed Real Estate

从数字到判断:专业大语言模型智能体与欧洲上市房地产的强化学习研究

Pardis Taghavi, Santosh Bhavani

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本研究以欧洲上市房地产分析为对象,提出Larix框架将分析维度映射为专业LLM智能体,结合GRPO微调Qwen3.5-9B,实现数值任务与判断任务的性能提升且可迁移至新企业与监管体系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11243 2026-08-13 cs.AI cs.LG 新提交 62%

The Off-Support Barrier: Why Semantic Safety Constraints Are Not Learning-Problem Invariants, and What Follows for Prior Design, Containment, and Verification

离支撑屏障:为何语义安全约束不是学习问题不变量,以及对先验设计、约束与验证的启示

Yoshinori Watanabe

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出语义安全约束是离支撑对象,基于奇异学习理论推导得出多项推论,以2026年7月OpenAI与Hugging Face评估事件为案例,为AI安全的先验设计、约束验证等问题提供理论启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10475 2026-08-12 cs.AI cs.CL cs.GT 新提交 62%

Evaluating Rational Contracting in Natural Language

评估自然语言中的理性缔约

Bhavyesh Sajja, Max Kleiman-Weiner, Roger Zimmermann, Tan Zhi-Xuan

专题命中 Agent评测 :AI agent(abstract);分类 cs.AI、cs.CL

AI总结 本研究针对自然语言缔约的评估缺口,构建理性框架并开发ContractSim评估套件,发现当前LLM智能体在高不确定性下缔约及执行协议存在不足,为相关智能体设计指明改进方向。

Comments 9 pages, 5 figures, 2 tables (Appendix: 34 pages, 6 figures, 9 tables)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00642 2026-08-12 cs.AI cs.LG 版本更新 62%

Coachable agents for interactive gameplay

可指导的交互式游戏智能体

Roberto Capobianco, Harm van Seijen, Nolan D. Bard, Neil Burch, Fatima Davelouis, Josh Davidson, Alisa Devlic, Yunshu Du, Ishan Durugkar, Siddhant Gangapurwala, Daniel Hernandez, G. Zacharias Holland, Sahil Jain, Kenta Kawamoto, Raksha Kumaraswamy, Patrick MacAlpine, Dustin R. Morrill, Declan Oller, Francesco Riccio, Akanksha Saran, Craig Sherstan, Kaushik Subramanian, Thomas J. Walsh, Samuel Barrett, Kizza N. Frisbee, Mady Govil, Johannes Günther, Varun R. Kompella, James A. MacGlashan, Maxwell Svetlik, Michael D. Thomure, Jaden B. Travnik, Kevin Waugh, Elahe Aghapour, Florian Fuchs, Andreanne Lemay, Shruti Mishra, Takuma Seno, Peter Stone, Michael Spranger, Peter R. Wurman

机构 * Sony AI, Zurich, Switzerland(索尼AI,苏黎世,瑞士) Sony AI, North America (various locations)(索尼AI,北美(多地)) Sony AI, Tokyo, Japan(索尼AI,东京,日本)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出结合通用价值函数近似器与精心选择的训练场景、学习算法和数据增强的框架,使智能体在复杂领域(如《地平线:西之绝境》、《GT赛车》和类人机器人)中实时展现不同风格,同时保持主任务性能。

Comments Source code: https://github.com/SonyResearch/coachable_agents - Videos: https://drive.google.com/drive/folders/19F5uKziT_zkDurze5sy5iMFD4BHfD3lV

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07943 2026-08-12 cs.CR cs.AI cs.CL 版本更新 62%

Poise: Position-Aware One-Instruction Skill Injection for Silent Execution on LLM Agents

POISE:面向LLM智能体的位置感知不可检测技能注入攻击

Haochang Hao, Dehai Min, Zhifang Zhang, Yunbei Zhang, Miao Xu, Yingqiang Ge, Lu Cheng

机构 * University of Illinois at Chicago(伊利诺伊大学香槟分校) University of Queensland(昆士兰大学) Tulane University(路易斯安那州立大学) Rutgers University(罗格斯大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出POISE攻击方法,通过位置感知将恶意指令压缩为单一良性指令嵌入技能正文,在保持隐蔽性的同时实现89.3%的攻击成功率,比随机位置基线高28.0个百分点。

Comments Title changed from "POISE: Position-Aware Undetectable Skill Injection on LLM Agents" to "Poise: Position-Aware One-Instruction Skill Injection for Silent Execution on LLM Agents"; the manuscript, figures, appendices, and reproducibility details have been updated. 15 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16706 2026-08-12 cs.AI cs.CL cs.MA 版本更新 62%

Auditing Automated Evaluation, Error Propagation, and Runtime Mitigation in Tool-Using Language Agents

评估工具使用语言代理:裁判可靠性、错误传播和运行时缓解在AgentProp-Bench中

Bhaskar Gurram

机构 * Zasti Inc.(Zasti公司)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文通过AgentProp-Bench评估工具使用语言代理的可靠性,发现基于子字符串的裁判与人类标注一致性较低,但三模型集成能提高一致性,同时发现参数注入导致错误传播的概率较高,运行时拦截器在GPT-4o-mini上有效减少幻觉,但对Gemini-2.0-Flash无显著影响。

Comments 11 pages, 4 figures, 8 tables. Code and data: https://github.com/bhaskargurram-ai/agenthallu-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.07752 2026-08-12 cs.AI cs.GT cs.LG 版本更新 62%

Representation and Invariance in Reinforcement Learning

强化学习中的表示与不变性

Samuel Alexander, Arthur Paul Pedersen

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文研究强化学习框架间保留相对智能的可映射性,引入相关准则,证明确定性与随机性RL框架间映射无法满足该准则,揭示不同版本RL存在固有根本差异。

Comments 16 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08968 2026-08-11 cs.SE cs.AI 新提交 62%

GALA: Graph-Augmented LLM Agents for Root Cause Analysis and Incident Response in Microservices

GALA:用于微服务根本原因分析和事件响应的图增强大语言模型智能体

Yifang Tian, Yaming Liu, Zichun Chong, Zihang Huang, Yiran Li, Hans-Arno Jacobsen

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.SE

AI总结 针对微服务RCA的现有方法存在局限,提出图增强LLM智能体框架GALA+,结合STRIX与SURE-Score,在基准测试中性能优于最佳LLM基线,获SRE专家认可。

Comments Proceedings of the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE '26), October 12--16, 2026, Munich, Germany

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08814 2026-08-11 cs.CV cs.AI cs.LG 新提交 62%

360CityArena: A Realistic Virtual Urban Navigation Benchmark for Embodied Agents

360CityArena:面向具身智能体的真实虚拟城市导航基准

Kenta Watanabe, Atsuyuki Miyai, Mizuki Takenawa, Kiyoharu Aizawa, Toshihiko Yamasaki

机构 * The University of Tokyo(东京大学)

专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究人员提出基于东京秋叶原重建的360CityArena城市导航基准,评估具身智能体城市探索能力,发现最强模型Gemini 2.5 Flash表现远低于人类,为相关研究提供了挑战性测试平台。

Comments ECCV2026. Project Page: https://360mm-team.github.io/360CityArena/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08180 2026-08-11 cs.CL cs.AI 新提交 62%

A Grounded and Decomposed Framework for Relation-Level Hallucination Evaluation in Abstractive Summarization

用于抽象摘要中关系级幻觉评估的基于基础与分解的框架

Praveen Kumar Katwe, Rakesh Chandra Balabantaray, Kali Prasad Vittala, Naman Kabadi

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本研究提出一种用于抽象摘要关系级幻觉评估的基于基础与分解的框架,引入关系幻觉指数(RHI)及其归一化公式,经多模型评估验证其可生成稳定且具区分性的幻觉测量结果,推进了自动化关系级保真度评估。

Comments 6 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08160 2026-08-11 cs.CL cs.AI 新提交 62%

Can LLM Agents Stick to the Script? A Benchmark for Long-Horizon Consistency in Interactive Narratives

大语言模型智能体能坚持剧本吗?交互式叙事中长期一致性的基准测试

Yingpeng Ma, Jianhao Yan, Bei Shi, Ka Hou Kam, Runnan Wang, Xuebo Liu, Yulong Chen, Yue Zhang, Derek F. Wong

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 该研究针对LLM智能体在交互式叙事中难以维持长期一致性的问题,构建了NCP-Bench基准测试,发现现有顶尖LLM的承诺保持率较低,存在显著的逻辑冲突问题。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07533 2026-08-11 cs.AI cs.SE 新提交 62%

MetaSpace: Metamorphic Testing for Spatial Cognition in Embodied Agents

MetaSpace:面向具身智能体空间认知的变形测试

Gengyang Xu, Dongwei Xiao, Yiteng Peng, Shuai Wang

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE

AI总结 MetaSpace是评估具身智能体空间认知的框架,基于变形测试原则生成测试用例,在三个场景中检测到SOTA MLLM驱动智能体的90422个空间认知错误,其SC分数远低于人类基准。

Comments 30 pages, 17 figures. Published in Proceedings of the ACM on Programming Languages (OOPSLA1)

Journal ref Proceedings of the ACM on Programming Languages, 10, OOPSLA1 (April 2026), 343-372

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07529 2026-08-11 cs.CL cs.AI 新提交 62%

WuYuEval: A Multi-Level Benchmark for Large Language Models in Solid Waste Management

WuYuEval:面向固体废物管理的大语言模型多级基准测试

Yi Zhang, Hongyang Wang, Zheng Hao Leong, Zihao Wu, Kaijun Lin, Zhixing Pan, Qixun Huangfu, Wei Ren, Wenyan Wu, Fangyun Wang, Wenting Yu, Hengyu Lin, Muling Yang, Zongguo Wen

专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.CL

AI总结 WuYuEval是面向固体废物管理的多级基准测试,含基础与专家模块,评估33个LLM的SWM能力,发现其在专业任务表现差,为开发专用基础模型提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08118 2026-08-11 cs.AI cs.LG cs.SC math.CO 新提交 62%

Neurosymbolic Discovery of Algebraic Graph Constructions

代数图构造的神经符号发现

David Seka, Stefan Szeider

机构 * TU Wien(维也纳技术大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 针对仅提供原始图数据无法揭示其结构性质的问题,提出基于通用大语言模型与SageMath的神经符号智能体,可自动发现代数图构造,在100个高度对称图基准上全部成功,还找到Bernhart-Kainen可散度猜想的最小反例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00077 2026-08-11 cs.CL cs.AI 版本更新 62%

Autorubric: A Unifying Framework for Rubric-Based LLM Evaluation on Non-Verifiable Tasks

Autorubric:统一基于评分标准的LLM评估

Delip Rao, Chris Callison-Burch

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 Autorubric通过整合多种评分标准评估技术,提供统一的评分框架和默认设置,提升LLM评估的可靠性与一致性,并在多个基准测试中展示了其有效性。

Comments 60 pages; COLM 2026 camera ready copy

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18347 2026-08-11 cs.LG cs.AI 版本更新 62%

The Cell Must Go On: Agar.io for Continual Reinforcement Learning

细胞必须继续前进:Agar.io用于持续强化学习

Mohamed A. Mohamed, Kateryna Nekhomiazh, Vedant Vyas, Marcos M. Jose, Andrew Patterson, Marlos C. Machado

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 AgarCL是一个基于Agar.io游戏的持续强化学习研究平台,用于评估不同算法在复杂动态环境中的表现和挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06420 2026-08-10 cs.LG cs.AI 新提交 62%

Risk-Aware Decision Policies for Agents Under Noisy Perception

感知噪声下智能体的风险感知决策策略

David Szczecina

机构 * University of Waterloo(滑铁卢大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 针对感知噪声下智能体决策问题,该研究构建人工生命捕食者-猎物觅食模型,发现不确定性感知策略可提升智能体存活率,揭示了行为随不确定性的状态转变,为含噪声标签的鲁棒学习提供类比。

Comments 8 pages, 6 figures. Submitted to the 2026 Conference on Artificial Life (ALIFE2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06352 2026-08-07 cs.LG cs.CL 新提交 62%

CalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal Tasks

CalibForge:用于扩展可学习终端任务的对抗性求解器校准

Fanzhe Meng, Guoxin Chen, Jiale Zhao, Shuang Sun, Zhiyu Lin, Wayne Xin Zhao, Ruihua Song, Ji-Rong Wen, Kai Jia

专题命中 Agent评测 :agent(abstract);分类 cs.CL、cs.LG

AI总结 本文提出CalibForge系统,通过对抗性求解器校准合成5431个终端任务,训练的模型在多个基准测试中取得显著性能提升,验证了求解器相关可学习性的实用价值。

Comments Dataset: https://huggingface.co/datasets/AweAI-Team/CalibForge. Repository: https://github.com/AweAI-Team/CalibForge

详情

展开后加载摘要…

URL PDF HTML 收藏