arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 11104 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 11104 篇

2604.25907 2026-05-08 cs.LG cs.AI 81%

How Fast Should a Model Commit to Supervision? Training Reasoning Models on the Tsallis Loss Continuum

模型应如何快速承诺于监督?在Tsallis损失连续体上训练推理模型

Chu-Cheng Lin, Eugene Ie

机构 * Google(谷歌)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出Tsallis损失族J_Q,通过q参数在RLVR和密度估计极之间插值,解释SFT-then-RLVR流程,并提出GARL和PAFT方法以缓解冷启动问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01327 2026-05-08 cs.AI cs.LG 81%

Segment-Aligned Policy Optimization for Multi-Modal Reasoning

基于段落对齐的策略优化用于多模态推理

Lei Gao, Zhuoming Li, Mengxi Jia, Jiakang Yuan, Hongbo Sun, Hao Sun, Xuelong Li

机构 * Fudan University(复旦大学) Southeast University(东南大学) China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd.(中国电信人工智能技术(北京)有限公司) Institute of Artificial Intelligence, China Telecom(中国电信人工智能研究院)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出SAPO方法,通过将推理步骤而非token或完整序列作为策略更新的基本单元,提升多模态推理任务的准确性和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07236 2026-04-29 cs.AI cs.CL 81%

How Much Heavy Lifting Can an Agent Harness Do?: Measuring the LLM's Residual Role in a Planning Agent

代理能承载多少实质性工作?:测量规划代理中LLM的残余作用

Sungwoo Jung, Seonil Son

机构 * Independent Researcher(独立研究者)

专题命中 规划推理 :planning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究通过外部测量规划代理各层,量化LLM在决策中的残余作用,发现声明性规划承担主要工作,而符号反思和LLM支持的修订仅在特定情况下生效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24175 2026-04-28 cs.CL cs.AI 81%

AdapTime: Enabling Adaptive Temporal Reasoning in Large Language Models

AdapTime:在大语言模型中实现自适应时间推理

Yimin Deng, Yejing Wang, Zhenxi Lin, Zichuan Fu, Guoshuai Zhao, Derong Xu, Yefeng Zheng, Xiangyu Zhao, Xian Wu, Li Zhu, Xueming Qian

机构 * Xi’an Jiaotong University(西安交通大学) City University of Hong Kong(香港城市大学) Tencent Jarvis Lab(腾讯 Jarvis实验室) Westlake University(西湖大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出AdapTime方法,通过动态执行推理步骤提升大语言模型的时间推理能力,采用重构、重写和复核三步策略,无需外部工具即可增强模型对时间信息的处理能力。

Comments ACL 2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05664 2026-04-28 cs.CL cs.AI cs.SE 81%

CODESIM: Multi-Agent Code Generation and Problem Solving through Simulation-Driven Planning and Debugging

CODESIM: 通过仿真驱动的规划与调试进行多智能体代码生成与问题解决

Md. Ashraful Islam, Mohammed Eunus Ali, Md Rizwan Parvez

机构 * Bangladesh University of Engineering and Technology(孟加拉工程与技术大学) Qatar Computing Research Institute(卡塔尔计算研究所)

专题命中 规划推理 :planning(title,abstract);分类 cs.CL、cs.AI

AI总结 CODESIM提出了一种基于仿真的多智能体代码生成框架,通过仿真验证和内部调试提升代码生成能力,在多个基准测试中取得新高成绩。

Comments Accepted in NAACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21204 2026-04-24 cs.CL cs.AI cs.IR 81%

On Reasoning Behind Next Occupation Recommendation

关于未来职业推荐的推理方法

Shan Dong, Palakorn Achananuparp, Hieu Hien Mai, Lei Wang, Yao Lu, Ee-Peng Lim

机构 * Singapore Management University(新加坡国立管理学院) Columbia University(哥伦比亚大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种两阶段职业预测方法,通过生成用户职业选择原因来提升大语言模型在职业推荐中的性能,实验表明该方法在准确率上优于无监督方法。

Comments Accepted to PAKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20043 2026-04-23 cs.CL cs.AI 81%

TriEx: A Game-based Tri-View Framework for Explaining Internal Reasoning in Multi-Agent LLMs

TriEx:一种基于游戏的三视角框架,用于解释多智能体大语言模型中的内部推理

Ziyi Wang, Chen Zhang, Wenjun Peng, Qi Wu, Xinyu Wang

机构 * Adelaide University(阿德莱德大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 TriEx通过三视角框架提升多智能体大语言模型的可解释性,通过结构化自我推理、对手信念状态和 oracle 审计分析,揭示模型在信念动态和评估可靠性上的系统性不匹配。

Comments ACL2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19766 2026-04-23 cs.CL cs.AI 81%

OThink-SRR1: Search, Refine and Reasoning with Reinforced Learning for Large Language Models

OThink-SRR1: 通过强化学习增强大语言模型的搜索、细化与推理

Haijian Liang, Zenghao Niu, Junjie Wu, Changwang Zhang, Wangchunshu Zhou, Jun Wang

机构 * Shenzhen University(深圳大学) OPPO Research Institute(OPPO研究院)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 OThink-SRR1通过强化学习训练的迭代搜索-细化-推理流程,有效解决复杂多跳问题中的检索噪声干扰和计算成本问题,实验表明其在多跳问答基准上准确率优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17555 2026-04-23 cs.AI cs.CL cs.IR 81%

CoSearch: Joint Training of Reasoning and Document Ranking via Reinforcement Learning for Agentic Search

CoSearch:通过强化学习联合训练推理和文档排序以实现代理搜索

Hansi Zeng, Liam Collins, Bhuvesh Kumar, Neil Shah, Hamed Zamani

机构 * Center for Intelligent Information Retrieval, University of Massachusetts Amherst(智能信息检索中心,马萨诸塞大学阿默斯特分校) Snap Inc(Snap公司)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出CoSearch框架,通过群体相对策略优化联合训练推理代理和生成文档排序模型,以解决代理搜索中检索系统性能瓶颈问题,实验表明其在多个问答基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19638 2026-04-22 cs.AI cs.CL cs.RO 81%

SafetyALFRED: Evaluating Safety-Conscious Planning of Multimodal Large Language Models

SafetyALFRED:评估多模态大语言模型的安全意识规划

Josue Torres-Fonseca, Naihao Deng, Yinpei Dai, Shane Storks, Yichi Zhang, Rada Mihalcea, Casey Kennington, Joyce Chai

机构 * University of Michigan(密歇根大学) Boise State University(博伊西州立大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出SafetyALFRED,基于ALFRED基准测试,引入六类厨房真实世界危险,评估多模态大语言模型在安全意识规划中的表现,发现静态QA评估不足,需转向强调具身环境中的纠正行动的基准。

Comments Work accepted at ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14902 2026-04-21 cs.AI cs.CL cs.CV cs.RO 81%

ADAPT: Benchmarking Commonsense Planning under Unspecified Affordance Constraints

ADAPT:在未指定 affordance 约束下评估常识规划的基准测试

Pei-An Chen, Yong-Ching Liang, Jia-Fong Yeh, Hung-Ting Su, Yi-Ting Chen, Min Sun, Winston Hsu

机构 * National Taiwan University(国立台湾大学) National Yang Ming Chiao Tung University(国立阳明交通大学) National Tsing Hua University(国立清华大学)

专题命中 规划推理 :planning(title);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出 ADAPT 模块,通过显式 affordance 推理提升智能具身代理的鲁棒性和任务成功率,展示了领域适应的视觉语言模型在 affordance 推理中的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05053 2026-04-21 cs.AI cs.CL 81%

Reinforced Efficient Reasoning via Semantically Diverse Exploration

通过语义多样探索增强高效推理

Ziqi Zhao, Zhaochun Ren, Jiahong Zou, Liu Yang, Zhiwei Xu, Xuri Ge, Zhumin Chen, Xinyu Ma, Daiting Shi, Shuaiqiang Wang, Dawei Yin, Xin Xin

机构 * Shandong University(山东大学) Leiden University(莱顿大学) Baidu Inc.(百度公司)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出ROSE方法,通过语义熵分支策略和ε探索机制提升大语言模型的推理多样性与效率,并通过实验验证其有效性。

Comments Accepted at ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07100 2026-04-21 cs.CL cs.AI 81%

STRIDE-ED: A Strategy-Grounded Stepwise Reasoning Framework for Empathetic Dialogue Systems

STRIDE-ED:一种基于策略的分步推理框架用于共情对话系统

Hongru Ji, Yuyin Fan, Meng Zhao, Xianghua Li, Lianwei Wu, Chao Gao

机构 * School of Artificial Intelligence, OPtics and ElectroNics (iOPEN), Northwestern Polytechnical University, China(人工智能学院、光学与电子学(iOPEN)、西北工业大学,中国) School of Artificial Intelligence and Big Data, Henan University of Technology, China(人工智能与大数据学院、河南理工大学,中国) School of Computer Science, Northwestern Polytechnical University, China(计算机学院、西北工业大学,中国)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出STRIDE-ED框架,通过结构化策略引导推理,解决共情对话中策略意识和上下文敏感决策的难题,实验表明其在多种LLM上表现优异。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05569 2026-04-21 cs.IR cs.AI cs.CL 81%

CBR-to-SQL: Rethinking Retrieval-based Text-to-SQL using Case-based Reasoning in the Healthcare Domain

CBR-to-SQL:重新思考基于检索的文本到SQL方法:在医疗领域使用基于案例的推理

Hung Nguyen, Hans Moen, Pekka Marttinen

机构 * Department of Computer Science Aalto University(奥卢大学计算机科学系) Department of Clinical Medicine Aalborg University(奥尔堡大学临床医学系)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出CBR-to-SQL框架,通过分解检索增强生成的两阶段检索,提升医疗领域文本到SQL的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16333 2026-04-21 cs.LG cs.AI 81%

A Discordance-Aware Multimodal Framework with Multi-Agent Clinical Reasoning

一种考虑不一致性的多模态框架与多智能体临床推理

Pegah Ahadian, Mingrui Yang, Sixu Chen, Xiaojuan Li, Qiang Guan

机构 * Department of Computer Science(计算机科学系) Kent State University(肯特州立大学) Department of Biomedical Engineering(生物医学工程系) Cleveland Clinic(克利夫兰诊所)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种结合机器学习模型与多智能体推理系统的多模态框架,用于预测膝骨关节炎的进展并生成临床管理建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06211 2026-04-21 cs.CL cs.AI cs.SE 81%

Illocutionary Explanation Planning for Source-Faithful Explanations in Retrieval-Augmented Language Models

意图解释规划:在检索增强语言模型中实现源忠实的解释

Francesco Sovrano, Alberto Bacchelli

机构 * Collegium Helveticum, ETH Zurich(瑞士苏黎世联邦理工学院学院) University of Zurich(瑞士苏黎世大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究通过意图宏观规划提升检索增强语言模型中解释的源忠实性,通过链式意图提示提升源忠实度,实验显示在部分模型中提升显著,但整体效果仍有限。

Comments 24 pages; Accepted for publication at XAI'2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20020 2026-04-20 cs.AI cs.CL 81%

Persona-Assigned Large Language Models Exhibit Human-Like Motivated Reasoning

具有人格分配的大型语言模型表现出类似人类的动机推理

Saloni Dash, Amélie Reymond, Emma S. Spiro, Aylin Caliskan

机构 * University of Washington(华盛顿大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了分配不同政治和社会人口属性的人格对大型语言模型动机推理的影响,发现人格分配的模型在评估信息真实性时表现下降,且政治人格在科学证据评估中更倾向于与自身身份一致的结论,传统去偏方法效果有限。

Comments ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15148 2026-04-17 cs.AI cs.CL cs.IR 81%

IG-Search: Step-Level Information Gain Rewards for Search-Augmented Reasoning

IG-Search: 基于信息增益的步级奖励用于搜索增强推理

Zihan Liang, Yufei Ma, Ben Chen, Zhipeng Qian, Huangyu Dai, Lingtao Mao, Xuxin Zhang, Chenyi Lei, Wenwu Ou

机构 * Kuaishou Technology(快手科技)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出IG-Search框架,通过信息增益在每一步评估检索文档对答案置信度的提升,实现细粒度信用分配,优于传统轨迹级和步级方法,在多跳推理任务中表现更佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21440 2026-04-15 cs.CL cs.AI 81%

KG-Hopper: Empowering Compact Open LLMs with Knowledge Graph Reasoning via Reinforcement Learning

KG-Hopper:通过强化学习赋能紧凑型开放式大语言模型进行知识图谱推理

Shuai Wang, Yinan Yu

机构 * Department of Computer Science(计算机科学系) Engineering Chalmers University of Technology(工程学院查尔姆斯理工大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 KG-Hopper通过强化学习框架,使紧凑型开放式大语言模型能够在一个推理回合内完成多跳知识图谱推理,优于更大系统并达到与专有模型相当的性能。

Comments Accepted to IJCNN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11047 2026-04-15 cs.CL cs.LG 81%

CoG: Controllable Graph Reasoning via Relational Blueprints and Failure-Aware Refinement over Knowledge Graphs

CoG:通过关系蓝图和故障感知细化实现可控图推理

Yuanxiang Liu, Songze Li, Xiaoke Guo, Zhaoyan Gong, Qifei Zhang, Huajun Chen, Wen Zhang

机构 * Zhejiang University(浙江大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出CoG框架,通过关系蓝图和故障感知细化模块,解决知识图谱中推理稳定性与效率问题,实验显示其在准确性和效率上均优于现有方法。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12493 2026-04-15 cs.CL cs.AI 81%

Latent Planning Emerges with Scale

在规模下显现的潜在规划

Michael Hanna, Emmanuel Ameisen

机构 * ILLC, University of Amsterdam(伊拉斯姆斯自由大学,阿姆斯特丹大学) Anthropic

专题命中 规划推理 :planning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究了LLM在简单规划任务中潜在规划能力随规模增加而增强的现象,发现模型能通过内部表示生成未来词并影响上下文,但复杂任务如押韵对句中规划能力有限。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01692 2026-04-14 cs.LG cs.AI 81%

Reasoning as Gradient: Scaling MLE Agents Beyond Tree Search

推理作为梯度:超越树搜索的MLE代理扩展

Yifei Zhang, Xu Yang, Xiao Yang, Bowen Xian, Qizheng Li, Shikai Fang, Jingyuan Li, Jian Wang, Mingrui Xu, Weiqing Liu, Jiang Bian

机构 * Nanjing University(南京大学) Microsoft Research Asia(微软亚洲研究院) Peking University(北京大学) Zhejiang University(浙江大学) Wuhan University(武汉大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出Gome,一种基于梯度优化的MLE代理,通过将结构化诊断推理映射到梯度计算,实现更高效的优化。实验显示,随着模型能力增强,梯度优化在前沿模型中表现更优,且在受限预算下达到35.1%的任何奖牌率。

Comments 36 pages, 6 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26435 2026-04-13 cs.CL cs.AI 81%

Adaptive Planning for Multi-Attribute Controllable Summarization with Monte Carlo Tree Search

多属性可控摘要的自适应规划

Sangwon Ryu, Heejin Do, Yunsu Kim, Gary Geunbae Lee, Jungseul Ok

机构 * GSAI, POSTECH(浦项科技大学人工智能研究院) CSE, POSTECH(浦项科技大学计算机科学与工程学院) ETH Zurich(苏黎世联邦理工学院) ETH AI Center(苏黎世联邦理工学院人工智能中心) LILT(LILT公司)

专题命中 规划推理 :planning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出PACO框架,通过定制化的MCTS实现多属性可控摘要的自适应规划,有效满足相关约束,实验表明其在不同领域和模型上表现优异,甚至超越大模型基线。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07687 2026-04-10 cs.LG cs.AI 81%

Joint Task Offloading, Inference Optimization and UAV Trajectory Planning for Generative AI Empowered Intelligent Transportation Digital Twin

生成式人工智能赋能的智能交通数字孪生中的联合任务卸载、推断优化与无人机轨迹规划

Xiaohuan Li, Junchuan Fan, Bingqi Zhang, Rong Yu, Xumin Huang, Qian Chen

机构 * Guangxi University Key Laboratory of Intelligent Networking and Scenario System (School of Information and Communication, Guilin University of Electronic Technology)(广西大学智能组网与场景系统重点实验室(桂林电子科技大学信息与通信学院)) Research Institute of Highway Ministry of Transport(交通运输部公路科学研究院) School of Automation, Guangdong University of Technology(广东工业大学自动化学院) School of Architecture and Transportation Engineering, Guilin University of Electronic Technology(桂林电子科技大学建筑与交通工程学院)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种联合优化方法,通过无人机任务卸载、推断优化和轨迹规划提升生成式人工智能赋能的智能交通数字孪生的精度与延迟平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05424 2026-04-08 cs.AI cs.CL 81%

PRISM-MCTS: Learning from Reasoning Trajectories with Metacognitive Reflection

PRISM-MCTS: 通过元认知反思学习推理轨迹

Siyuan Cheng, Bozhong Tian, YanChao Hao, Zheng Wei

机构 * Tencent PCG(腾讯PCG)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 PRISM-MCTS通过整合过程奖励模型和动态共享内存,有效捕捉启发式与谬误,提升推理效率,减少轨迹需求,在多个推理基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05159 2026-04-08 cs.SE cs.AI cs.CL 81%

Planning to Explore: Curiosity-Driven Planning for LLM Test Generation

规划以探索:基于好奇心的规划用于LLM测试生成

Alfonso Amayuelas, Firas Laakom, Piotr Piękos, Wenyi Wang, Yifan Xu, Yuhui Wang, Jürgen Schmidhuber, William Wang

机构 * University of California, Santa Barbara(加州大学圣塔芭芭拉分校) King Abdullah University of Science and Technology(阿卜杜拉国王科技大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出CovQValue方法,通过将覆盖地图反馈给LLM生成多样化计划,并利用LLM估计的Q值选择最信息量的计划,以平衡即时分支发现与未来可达性,优于贪心策略,在测试生成任务中取得更高覆盖率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05075 2026-04-08 cs.AI cs.CL 81%

MMORF: A Multi-agent Framework for Designing Multi-objective Retrosynthesis Planning Systems

MMORF:一种用于设计多目标逆合成规划系统的多智能体框架

Frazier N. Baker, Trieu Nguyen, Reza Averly, Botao Yu, Daniel Adu-Ampratwum, Huan Sun, Xia Ning

机构 * Department of Computer Science and Engineering, The Ohio State University(俄亥俄州立大学计算机科学与工程系) Department of Mathematics and Statistics, University of South Florida(南佛罗里达大学数学与统计系) Division of Medicinal Chemistry and Pharmacognosy, The Ohio State University(俄亥俄州立大学药物化学与生药学系) Department of Biomedical Informatics, The Ohio State University(俄亥俄州立大学生物医学信息学系) Translational Data Analytics Institute, The Ohio State University(俄亥俄州立大学转化数据分析研究所)

专题命中 规划推理 :planning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出MMORF框架,通过多智能体系统解决多目标逆合成规划问题,展示了MASIL和RFAS在安全、成本和约束任务中的优越性能。

Comments 36 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08548 2026-04-07 cs.RO cs.AI cs.LG 81%

From Seeing to Doing: Bridging Reasoning and Decision for Robotic Manipulation

从感知到行动:弥合推理与决策以实现机器人操作

Yifu Yuan, Haiqin Cui, Yibin Chen, Zibin Dong, Fei Ni, Longxin Kou, Jinyi Liu, Pengyi Li, Yan Zheng, Jianye Hao

机构 * Tianjin University(天津大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出FSD模型,通过空间关系推理生成中间表示,提升机器人操作的泛化能力,在8个基准测试中表现优异,且在零样本任务中实现显著性能提升。

Comments Published as a conference paper at ICLR 2026. Our project homepage: https://embodied-fsd.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01212 2026-04-02 cs.CL cs.AI 81%

$\texttt{YC-Bench}$: Benchmarking AI Agents for Long-Term Planning and Consistent Execution

YC-Bench:评估长期规划和一致执行的AI代理基准测试

Muyu He, Adit Jain, Anand Kumar, Vincent Tu, Soumyadeep Bakshi, Sachin Patro, Nazneen Rajani

专题命中 规划推理 :planning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出YC-Bench基准测试,评估AI代理在长期任务中维持战略一致性的能力,通过模拟一年初创公司运营,测试代理在不确定环境中的规划、学习与适应能力,发现仅三模型能持续超越初始资金,Scratchpad使用是成功关键,对抗性客户检测是主要失败模式。

Comments 16 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11536 2026-04-02 cs.CL cs.AI 81%

HARP: Hallucination Detection via Reasoning Subspace Projection

通过推理子空间投影进行幻觉检测:HARP

Junjie Hu, Gang Tu, ShengYu Cheng, Jinxin Li, Jinting Wang, Rui Chen, Zhilong Zhou, Dongbo Shan

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 HARP通过推理子空间投影方法检测大语言模型中的幻觉,通过分解隐藏状态空间并应用SVD提升鲁棒性,实验显示在TriviaQA上达到92.8%的AUROC。

Journal ref The Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏