arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 11104 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 11104 篇

2604.15343 2026-05-20 cs.HC cs.AI cs.LG 62%

When the Loop Closes: Architectural Limits of In-Context Isolation, Metacognitive Co-option, and the Two-Target Design Problem in Human-LLM Systems

当循环闭合时:人类-大语言模型系统中上下文隔离、元认知侵占和双目标设计问题的架构限制

Z. Cheng, N. Song

机构 * Independent Researcher(独立研究者)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了人类-大语言模型系统中上下文隔离、元认知侵占和双目标设计问题的架构限制,通过案例研究揭示了上下文污染机制和元认知侵占动态,并提出了保护性系统设计与限制性系统设计的伦理区别。

Comments empirical case study with primary data; 16 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18772 2026-05-20 cs.IR cs.AI cs.CL 62%

Improving Retrieval-Augmented Generation without Taxonomy-based Error Categorization

无需基于分类的错误归类即可改进检索增强生成

Gongbo Zhang, Yifan Peng, Chunhua Weng

机构 * Columbia University(哥伦比亚大学) Weill Cornell Medicine(韦尔·科恩医学中心)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出RePAIR方法,通过直接将错误的RAG输出映射到错误缓解行动计划,无需依赖细粒度错误分类和显式批评者监督,从而提升检索增强生成的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00505 2026-05-19 cs.IR cs.AI cs.CL 62%

LLM-Oriented Information Retrieval: A Denoising-First Perspective

面向大语言模型的信息检索:一种去噪优先的视角

Lu Dai, Liang Sun, Fanpu Cao, Ziyang Rao, Cehao Yang, Hao Liu, Hui Xiong

机构 * Hong Kong University of Science and Technology(香港科技大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种以去噪为核心的信息检索方法,强调在信息检索全流程中,最大化可利用证据密度和可验证性是关键瓶颈,通过四个阶段框架和信号-噪声优化技术分类,探讨了信息检索中的挑战和解决方案。

Comments SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07122 2026-05-19 cs.CR cs.AI cs.LG 62%

Enhancing Cloud Network Resilience via a Robust LLM-Empowered Multi-Agent Reinforcement Learning Framework

通过一个鲁棒的LLM赋能的多智能体强化学习框架增强云网络韧性

Yixiao Peng, Hao Hu, Feiyang Li, Xinye Cao, Yingchang Jiang, Jipeng Tang, Guoshun Nan, Yuling Liu

机构 * State Key Laboratory of Mathematical Engineering and Advanced Computing(数学工程与先进计算国家重点实验室) Henan Key Laboratory of Information Security(河南省信息安全重点实验室) National Engineering Research Center for Mobile Network Technologies(移动网络技术国家工程研究中心) Beijing University of Posts and Telecommunications(北京邮电大学) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于大语言模型的多智能体强化学习框架,旨在提升云网络的防御能力和韧性,通过分层架构和人类在回路支持来增强系统的适应性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21035 2026-05-19 cs.AI cs.LG cs.MA q-bio.GN 62%

GenoMAS: A Multi-Agent Framework for Scientific Discovery via Code-Driven Gene Expression Analysis

GenoMAS:通过代码驱动的基因表达分析进行科学发现的多智能体框架

Haoyang Liu, Yijiang Li, Haohan Wang

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出GenoMAS多智能体框架,通过类型消息传递协议协调六个专门的LLM代理,以实现基因表达数据的高效处理和科学发现,其在数据预处理和基因识别任务上均优于现有方法。

Comments 51 pages (14 pages for the main text, 10 pages for references, and 27 pages for the appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13957 2026-05-19 cs.CL cs.AI 62%

Supervising the search process produces reliable and generalizable information-seeking agents

通过监督搜索过程产生可靠且可推广的信息寻求代理

Guangzhi Xiong, Qiao Jin, Xiao Wang, Yin Fang, Haolin Liu, Yifan Yang, Fangyuan Chen, Zhixing Song, Dengyu Wang, Minjia Zhang, Zhiyong Lu, Aidong Zhang

机构 * Department of Computer Science, University of Virginia, USA(弗吉尼亚大学计算机科学系) National Library of Medicine, National Institutes of Health, USA(美国国立卫生研究院国家医学图书馆) Department of Computer Science, University of Illinois Urbana–Champaign, USA(伊利诺伊大学厄巴纳-香槟分校计算机科学系) Medical Oncology, Dana–Farber Cancer Institute, USA(达纳-法伯癌症研究所医学肿瘤科) Surgery, University of Alabama at Birmingham, USA(阿拉巴马大学伯明翰分校外科系) Department of Neurology, Yale School of Medicine, USA(耶鲁医学院神经病学系)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过监督搜索过程来构建更可靠且可推广的信息寻求代理,通过RAG-Gym框架系统研究了架构设计、参数优化和动作评估,发现推理反思是关键能力,Re$^2$Search++在多跳信息检索基准上取得显著提升,尤其在领域外任务中表现更优。

Comments Homepage: https://rag-gym.github.io; Code: https://github.com/RAG-Gym/RAG-Gym

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16632 2026-05-19 cs.LG cs.AI cs.LO 62%

Learning How to Cube

学习如何求立方

Ferhat Erata, Sam Kouteili, Thanos Typaldos, Timos Antonopoulos, Robert B. Jones, Byron Cook, Ruzica Piskac

机构 * Yale University(耶鲁大学) AWS Agentic AI(AWS智能体AI)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种神经符号后训练框架,通过MCTS数据整理管道和符号启发式方法,使4B参数模型在SAT竞赛基准上取得53的pass@5分数,超越了Claude-Sonnet-4等前沿LLM。

Comments 33 pages, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16442 2026-05-19 cs.RO cs.AI cs.LG 62%

Hierarchical Two-Stage Framework for Environment-Aware Long-Horizon Vessel Trajectory Prediction

面向环境的长航程船舶轨迹预测分层两阶段框架

Ganeshaaraj Gnanavel, Tharindu Fernando, Sridha Sridharan, Clinton Fookes

机构 * SAIVT Research Group, Queensland University of Technology(SAIVT研究组,昆士兰理工大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出分层两阶段框架,结合长短期预测器与网格感知短期预测器,通过分层融合机制提升船舶轨迹预测精度,实验显示在ADE和FDE上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16303 2026-05-19 cs.CY cs.AI cs.CL 62%

From Demographics to Survey Anchors: Evaluating LLM Agents for Modeling Retirement Attitudes

从人口统计学到调查锚点:评估LLM代理在建模退休态度中的表现

Rubén Garzón, Pauline Baron, Vincent Grari, Jonne Kamphorst, Michael Bernstein, Marcin Detyniecki

机构 * AI Research(AI研究) AXA Group Operations(AXA集团运营) CDSP & CEE(CDSP与CEE) Sciences Po(社会科学高等学院) Computer Science Department(计算机科学系) Stanford University(斯坦福大学)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 本文比较了基于人口统计学的LLM代理与基于调查数据的代理在预测退休态度调查中的准确性,发现仅依赖人口统计学的代理存在偏差且不够准确,而基于调查锚点的代理能更好地捕捉复杂的人类响应模式。

Comments 50 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16054 2026-05-18 cs.LG cs.AI 62%

Ada-Diffuser: Latent-Aware Adaptive Diffusion for Decision-Making

Ada-Diffuser: 面向决策制定的潜在意识自适应扩散模型

Fan Feng, Selena Ge, Minghao Fu, Zijian Li, Yujia Zheng, Zeyu Tang, Yingyao Hu, Biwei Huang, Kun Zhang

机构 * University of California San Diego(加州大学圣地亚哥分校) Carnegie Mellon University(卡内基梅隆大学) MBZUAI Stanford University(斯坦福大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Ada-Diffuser,通过显式建模潜在动态过程,提升决策制定的精度与适应性,实验验证其在模拟控制与机器人基准中的有效性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09378 2026-05-18 cs.AI cs.LG 62%

Frontier Large Language Models Rival State-of-the-Art Planners

前沿大语言模型与最先进的规划器相媲美

Augusto B. Corrêa, André G. Pereira, Jendrik Seipp

机构 * University of Oxford(牛津大学) Federal University of Rio Grande do Sul(里约格兰德杜斯尔大学) Linköping University(林霍普大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究显示前沿大语言模型在规划任务中超越传统规划器, Gemini 3.1 Pro在标准任务中表现突出,GPT-5表现接近基线,且在符号规划中仍具竞争力,揭示了大语言模型规划能力的提升趋势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15202 2026-05-18 cs.AI cs.CL cs.IR 62%

DeepSlide: From Artifacts to Presentation Delivery

DeepSlide:从瑕疵到演示交付

Ming Yang, Zhiwei Zhang, Jiahang Li, Haoseng Liu, Yuzheng Cai, Weiguo Zheng

机构 * School of Data Science, Fudan University(复旦大学数据科学学院)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 DeepSlide是一种人机协同的多智能体系统,旨在优化演示全过程,从需求获取到脚本生成,提升演示的动态表现力和叙事流畅性。

Comments 37 pages,10 figures,9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14290 2026-05-15 cs.CR cs.AI cs.CL cs.SE 62%

Web Agents Should Adopt the Plan-Then-Execute Paradigm

网络代理应采用计划-然后执行范式

Julien Piet, Annabella Chow, Yiwei Hou, Muxi Lyu, Sylvie Venuto, Jinhao Zhu, Raluca Ada Popa, David Wagner

机构 * UC Berkeley(加州大学伯克利分校)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出网络代理应默认采用计划-然后执行范式,而非ReAct架构。该范式通过预先制定任务特定程序,避免运行时网页内容的干扰,提升安全性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13050 2026-05-15 cs.CL cs.AI 62%

Context Training with Active Information Seeking

基于主动信息获取的上下文训练

Zeyu Huang, Adhiguna Kuncoro, Qixuan Feng, Jiajun Shen, Lucio Dery, Arthur Szlam, Marc'Aurelio Ranzato

机构 * The University of Edinburgh(爱丁堡大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过引入维基百科搜索和浏览器工具改进上下文优化,通过搜索驱动训练流程提升模型性能,适用于低资源翻译、医疗场景和推理任务,证明方法高效且鲁棒。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13821 2026-05-14 cs.AI cs.LG 62%

Harnessing Agentic Evolution

利用代理进化

Jiayi Zhang, Yongfeng Gu, Jianhao Ruan, Maojia Song, Yiran Peng, Zhiguang Han, Jinyu Xiang, Zhitao Wang, Caiyin Yang, Yixi Ouyang, Bang Liu, Chenglin Wu, Yuyu Luo

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) DeepWisdom Singapore University of Technology and Design(新加坡科技设计大学) Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Université de Montréal & Mila(蒙特利尔大学及Mila)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AEvo框架,通过统一接口整合程序和代理进化,提升长周期搜索性能,在多个基准测试中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12674 2026-05-14 cs.AI cs.LG cs.RO 62%

Revealing Interpretable Failure Modes of VLMs

揭示视觉语言模型的可解释性故障模式

Isha Chaudhary, Vedaant V Jain, Kavya Sachdeva, Sayan Ranu, Gagandeep Singh

机构 * UIUC(伊利诺伊大学香槟分校) Kumo AI IIT Delhi(德里印度理工学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出REVELIO框架,通过系统性探索揭示VLMs在自动驾驶和室内机器人领域中的可解释性故障模式,发现模型在空间定位和安全威胁识别上的缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12289 2026-05-13 cs.LG cs.AI 62%

PriorZero: Bridging Language Priors and World Models for Decision Making

PriorZero:连接语言先验与世界模型以实现决策制定

Junyu Xiong, Yuan Pu, Jia Tang, Yazhe Niu

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Nanjing University of Aeronautics and Astronautics(南京航空航天大学) The Chinese University of Hong Kong MMLab(香港中文大学MMLab)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 PriorZero通过解耦的rollout训练设计,将LLM生成的语义先验整合到基于世界模型的规划中,提升探索效率和长期性能,适用于文本冒险游戏和指令遵循任务。

Comments 30 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07637 2026-05-13 cs.AI cs.LG cs.MA 62%

Learning to Communicate Locally for Large-Scale Multi-Agent Pathfinding

为大规模多智能体路径规划学习本地通信

Valeriy Vyaltsev, Alsu Sagirova, Anton Andreychuk, Oleg Bulichev, Yuri Kuratov, Konstantin Yakovlev, Aleksandr Panov, Alexey Skrynnik

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LC-MAPF,通过多轮本地通信提升多智能体协作,优于现有基于强化学习和模仿学习的MAPF求解器,且保持可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11114 2026-05-13 cs.LG cs.AI stat.ML 62%

In-Context Multi-Objective Optimization

上下文多目标优化

Xinyu Zhang, Conor Hassan, Julien Martinelli, Daolang Huang, Samuel Kaski

机构 * Department of Computer Science, Aalto University, Finland(芬兰阿尔托大学计算机科学系) ELLIS Institute Finland(芬兰ELLIS研究所) Department of Computer Science, University of Manchester, UK(英国曼彻斯特大学计算机科学系)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 TAMO通过Transformer架构实现多目标黑盒优化,无需重新训练即可在不同任务间转移,显著提升优化效率并保持帕累托前沿质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11373 2026-05-13 cs.AI cs.LG stat.ML 62%

Causal Algorithmic Recourse: Foundations and Methods

因果算法补救:基础与方法

Drago Plecko, Collin Wang, Elias Bareinboim

机构 * Department of Statistics & Data Science(统计与数据科学系) UCLA(加州大学洛杉矶分校) Department of Computer Science(计算机科学系) Columbia University(哥伦比亚大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出因果框架,通过预后干预结果建模算法补救过程,引入后补救稳定性条件,开发基于copula的算法推断补救效果,并提供分布自由方法学习补救效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05665 2026-05-13 cs.RO cs.AI cs.CL 62%

Characterizing the Robustness of Black-Box LLM Planners Under Perturbed Observations with Adaptive Stress Testing

基于扰动观测的黑盒大语言模型规划器鲁棒性表征:适应性压力测试

Neeloy Chakraborty, John Pohovey, Melkior Ornik, Katherine Driggs-Campbell

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了在扰动观测下大语言模型规划器的鲁棒性,提出适应性压力测试方法,通过蒙特卡洛树搜索高效搜索提示扰动空间,发现导致模型高不确定或崩溃的场景和配置。

Comments Accepted to ACL Findings 2026; 31 pages, 26 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10848 2026-05-12 cs.IR cs.AI cs.CL 62%

Rethinking Agentic Search with Pi-Serini: Is Lexical Retrieval Sufficient?

重新思考Pi-Serini中的代理搜索:词汇检索是否足够?

Tz-Huan Hsu, Jheng-Hong Yang, Jimmy Lin

机构 * University of Waterloo(滑铁卢大学) Stencilzeit University of Waterloo(斯泰尔齐特大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了在代理循环中,随着LLM能力提升,词汇检索是否足够。通过结合BM25与前沿LLM,引入Pi-Serini搜索代理,展示其在BrowseComp-Plus上优于现有检索代理的性能。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12275 2026-05-12 cs.CL cs.LG 62%

GONE: Structural Knowledge Unlearning via Neighborhood-Expanded Distribution Shaping

GONE: 通过邻域扩展分布塑造实现结构知识卸载

Chahana Dahal, Ashutosh Balasubramaniam, Zuobin Xiong

机构 * University of Nevada, Las Vegas(内华达大学拉斯维加斯分校) Indian Institute of Technology Guwahati(印度理工学院古瓦哈提分校)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出GONE基准,用于评估LLM在结构知识图谱中的知识卸载能力,引入NEDS框架通过图连接性识别相关邻居,实现精确的遗忘边界划分,展示出在知识编辑和卸载任务中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03756 2026-05-12 cs.LG cs.CE cs.CL 62%

MOOSE-Star: Unlocking Tractable Training for Scientific Discovery by Breaking the Complexity Barrier

MOOSE-Star: 通过突破复杂性障碍实现科学发现的可 tractable 训练

Zonglin Yang, Lidong Bing

机构 * MiroMind AI

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 MOOSE-Star 通过分解子任务、层次搜索和受限组合方法,实现科学假设生成过程的可 tractable 训练,降低复杂度至对数级别,提升训练和推理效率。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09998 2026-05-12 cs.LG cs.AI 62%

Continual Harness: Online Adaptation for Self-Improving Foundation Agents

持续Harness:面向自我改进基础代理的在线适应

Seth Karten, Joel Zhang, Tersoo Upaa, Ruirong Feng, Wenzhe Li, Chengshuai Shi, Chi Jin, Kiran Vodrahalli

机构 * Princeton University(普林斯顿大学) ARISE Foundation(ARISE基金会) Google DeepMind(谷歌DeepMind)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出持续Harness,一种无需人工干预的自我改进机制,通过在线适应提升具身代理在长视界部分可观察决策中的表现,实验证明其在Pokémon游戏中显著降低操作成本并接近专家水平。

Comments 28 pages, 19 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09536 2026-05-12 cs.CL cs.AI 62%

TAD: Temporal-Aware Trajectory Self-Distillation for Fast and Accurate Diffusion LLM

TAD: 时空感知轨迹自蒸馏用于快速准确的扩散大语言模型

Haoyang Zhou, Li Kong, Shijie Ren, Xiting Wang, Shuang Liang, Guowei Wang, Zhenxuan Pan

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) Ant Group(蚂蚁集团)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 TAD通过时空感知轨迹自蒸馏方法,在提升生成速度的同时保持准确性,实验表明在LLaDA上质量模型将平均准确率提升至51.6%,速度模型将AUP提升至257.1。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16349 2026-05-12 cs.IR cs.AI cs.CL 62%

Benchmarking Real-Time Question Answering via Executable Code Workflows

通过可执行代码工作流基准测试实时问答

Wenjie Zhou, Yuan Gao, Xin Zhou, Hao Fu, Zhongjian Miao, Wei Chen, Bo Chen, Xiaobing Zhao

机构 * Li Auto Inc(利亚 Auto 公司) Minzu University of China(民族大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出RT-QA框架,通过可执行代码工作流实现动态评估,发现现有模型在实时适应性上存在显著不足,主要问题包括懒惰检索和时间混淆。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09514 2026-05-12 cs.CL cs.AI 62%

EcoGym: Evaluating LLMs for Long-Horizon Plan-and-Execute in Interactive Economies

EcoGym:评估基于LLM的长周期计划与执行能力于交互经济中

Xavier Hu, Jinxiang Xia, Shengze Xu, Kangqi Song, Yishuo Yuan, Guibin Zhang, JinCheng Ren, Boyu Feng, Li Lu, Tieyong Zeng, Jiaheng Liu, Minghao Liu, He Zhu, Yuchen Eleanor Jiang, Wei Wang, Wangchunshu Zhou

机构 * OPPO-PersonalAI(OPPO-个人AI)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 EcoGym提出一个通用基准,用于评估LLM在交互经济中的长周期计划与执行能力,通过三个环境展示不同策略和行动的优化挑战。

Comments update

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06047 2026-05-12 cs.AI cs.CL 62%

DSGBench: A Diverse Strategic Game Benchmark for Evaluating LLM-based Agents in Complex Decision-Making Environments

DSGBench:一种多样化的战略游戏基准,用于评估基于大语言模型的代理在复杂决策环境中的能力

Wenjie Tang, Yuan Zhou, Erqiang Xu, Keyan Cheng, Minne Li, Liquan Xiao

机构 * College of Computer, National University of Defense Technology(国防科技大学计算机学院) Intelligent Game and Decision Lab (IGDL)(智能博弈与决策实验室)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 DSGBench通过六个复杂战略游戏评估LLM代理在复杂决策环境中的能力,采用细粒度评分系统和自动决策追踪机制,揭示不同LLM模型的优劣与系统限制。

Comments 43 pages, 5 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08327 2026-05-12 cs.LG cs.AI 62%

Interactive Critique-Revision Training for Reliable Structured LLM Generation

交互式批评-修订训练用于可靠的结构化大语言模型生成

Fei Xu Yu, Zuyuan Zhang, Mahdi Imani, Nathaniel D. Bastian, Tian Lan

机构 * The George Washington University(乔治华盛顿大学) Northeastern University(东北大学) United States Military Academy(美国军事学院)

专题命中 规划推理 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 本文提出DPA-GRPO方法,通过生成器-验证器游戏中的结构化验证干预,提升结构化决策的准确性与一致性,实验显示其在TaxCalcBench TY24上优于零样本生成和生成器-only RL基线。

详情

展开后加载摘要…

URL PDF HTML 收藏