arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-09-01 至 2026-09-01 共收录 368 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 61 篇

2608.30224 2026-09-01 cs.CL cs.AI 新提交 84%

The Differential Reasoning Router: Operationalizing Cost-Aware LLM Annotation in E-commerce

差异推理路由:在电商中实现成本感知的大语言模型标注

Cheng Lyu, Jingyue Zhang, Vinny DeGenova, Mengwei Li, Yuanli Pei

机构 * Wayfair

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究针对电商LLM标注冷启动问题,提出DRR框架,通过联合优化模型选择与人工升级实现自适应路由,在保持准确率的同时节约60%以上推理令牌成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15872 2026-09-01 cs.CL 版本更新 83%

SciOrch: Learning to Orchestrate Expert LLMs for Solving Frontier Multimodal Scientific Reasoning Tasks

SciOrch: 学习编排专家大语言模型以解决前沿多模态科学推理任务

Jingru Guo, Xiangyuan Xue, Lian Zhang, Wanghan Xu, Siki Chen, Philip Torr, Wanli Ouyang, Lei Bai, Zhenfei Yin

机构 * Imperial College London(伦敦帝国学院) The Chinese University of Hong Kong(香港中文大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Oxford(牛津大学) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL

AI总结 提出SciOrch框架,训练轻量级8B模型编排多个前沿大语言模型,通过MCTS和GRPO优化,在科学推理任务上超越最强单模型和多智能体基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08300 2026-09-01 cs.LG 版本更新 83%

QueryGraph: Reliable Multi-Tool Query Execution Planning via LLM-Based Graph Generation

QueryWeaver: 基于LLM图生成的可靠多工具查询执行规划

Aishwarya Chakravarthy, Vidhi Kulkarni, Duen Horng Chau

机构 * School of Computational Science and Engineering, Georgia Institute of Technology, Atlanta, GA, USA(计算科学与工程学院,佐治亚理工学院,亚特兰大,GA,美国)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.LG

AI总结 提出将自然语言查询转换为结构化图并通过确定性规划器执行的系统,利用深度优先搜索解决跨工具依赖,实现高可靠性查询。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08814 2026-09-01 cs.RO cs.AI cs.ET cs.MA 版本更新 83%

Scale-Plan: Scalable Language-Enabled Task Planning for Heterogeneous Multi-Robot Teams

Scale-Plan: 为异构多机器人团队实现可扩展的语言赋能任务规划

Piyush Gupta, Sangjae Bae, Jiachen Li, David Isele

机构 * Honda Research Institute(本田研究院) University of California(加州大学)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 Scale-Plan通过生成紧凑的任务相关问题表示,提升异构多机器人团队的可扩展性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30343 2026-09-01 cs.GT 新提交 82%

LangBP: Language-Guided Reasoning and Acting for Joint Bidding and Pricing

LangBP:用于联合出价与定价的语言引导推理与行动

Jiaqi Ding, Chuan Yang, Linghui Meng, Shengsheng Niu, Jie He, Zhangang Lin, Ching Law, Xiaolin Fang

专题命中 规划推理 :reasoning(title,abstract);verifier(abstract)

AI总结 该研究针对联合出价与定价任务,提出LangBP分层框架,通过S-DT和EGPO解决现有语言引导方法的局限,在AuctionNet实验及电商平台部署中均取得良好效果。

Comments 12 pages,6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09295 2026-09-01 cs.MA 版本更新 82%

MACRO-LLM: LLM-Empowered Multi-Agent Collaborative Reasoning under Spatiotemporal Partial Observability

MACRO-LLM:基于时空部分可观测性的LLM赋能多智能体协作推理

Handi Chen, Running Zhao, Xiuzhe Wu, Zhanfeng Xu, Edith C. H. Ngai

专题命中 规划推理 :reasoning(title,abstract);planning(abstract)

AI总结 本文提出MACRO-LLM,通过三个模块解决多智能体在时空部分可观测性下的协作推理问题,验证了其在复杂任务中的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29263 2026-09-01 cs.AI 新提交 79%

RACER: Reinforced Agent Collaboration for Explainable Reasoning on Knowledge Graphs

RACER:面向知识图谱可解释推理的强化智能体协作框架

Yuwei Lou, Hao Hu, Yuzhou Jiang, Zongfei Zhang, Liang Wang, Jincai Liu, Jidong Ge, Xianping Tao

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) Chinaunicom Software Nanjing Branch(中国联通软件南京分公司)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 RACER是面向知识图谱可解释推理的强化智能体协作框架,通过多智能体协作等技术解决LLM的幻觉与复杂推理难题,在两个数据集上平均提升5%性能。

Comments 15 pages, 1 figures, This paper has been accepted by ICONIP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24888 2026-09-01 cs.AI 版本更新 79%

SimGuide: Typed Multi-Context User Representations for Preference-Conditioned Agent Planning

SIMGUIDE:用于个性化智能体规划的过程式基础多上下文表示

Chirag Shah

机构 * University of Washington(华盛顿大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 本研究针对个性化AI智能体无法适配用户多场景优先级的问题,提出SIMGUIDE方法,构建SIMBENCH基准验证,发现过程式基础的Sims优于RAG,且表示格式是关键设计变量。

Comments Previous version had some results that were hard to verify or reproduce, so new experiments were done and many parts of the paper were changed to reflect that

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06714 2026-09-01 cs.AI 版本更新 79%

The Optimizer Is the Agent: Reasoning-Driven Search across Prompts, Programs, and ML Workflows

优化器即智能体:跨提示、程序与机器学习工作流的推理驱动搜索

Junbo Li, Boyi Liu, Canwen Xu, Yite Wang, Yuxiong He, Zhangyang Wang, Qiang Liu, Zhewei Yao

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Snowflake(思诺飞克公司)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 该研究提出ReASearch统一框架,让智能体自主优化提示、程序与ML工作流,在14项任务中优于专用系统,部分发现超人类最佳结果的方案。

Journal ref COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.10781 2026-09-01 cs.MA cs.AI cs.RO 79%

Simultaneous Computation with Multiple Prioritizations in Multi-Agent Motion Planning

Patrick Scheffe, Julius Kahle, Bassam Alrifaee

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29359 2026-09-01 eess.SY cs.SY 新提交 78%

Minimizing Grid Interconnection Capacity Requirements for AI Data Centers: A Developer-Side Planning Framework with Onsite Resources and Workload Flexibility

最小化AI数据中心的电网互连容量需求:一种结合现场资源与工作负载灵活性的开发者侧规划框架

Hassan Zahid Butt, Rida Fatima, Xingpeng Li

专题命中 规划推理 :planning(title,abstract)

AI总结 本文开发ICP-AI框架,在规定预算下最小化AI数据中心的电网互连容量,结合PV、BESS资源与灵活工作负载调度,通过实验验证其可有效减少互连容量,为项目规划提供支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29397 2026-09-01 cs.CL 新提交 70%

AlgoWorlds: Benchmarking Tool Use for Global Optimization in Algorithmic Worlds

AlgoWorlds:用于算法世界中全局优化的工具使用基准

Zixiang Xu, Jiaan Wang, Fandong Meng

机构 * Weixin AI, Tencent(腾讯微信AI) University of Southern California(南加州大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL

AI总结 本研究推出AlgoWorlds基准,评估大语言模型在算法世界中利用工具将信息转化为全局最优决策的能力,实验显示领先模型仅38.61%案例能达精确最优。

Comments Homepage: https://xzx34.github.io/AlgoWorlds/ Code: https://github.com/xzx34/AlgoWorlds

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29088 2026-09-01 cs.AI 新提交 70%

HANIA: Planner-Guided Multimodal Graph Evidence Selection for Grounded Question Answering

HANIA:规划器引导的多模态图证据选择用于基于证据的问答

Zafar Ali, Asad Khan, Nimbeshaho Thierry, Nabila Amir, Adam A. Q. Mohammed, Pavlos Kefalas

机构 * Southeast University(东南大学) Portland Institute(波特兰研究所) Aristotle University of Thessaloniki(亚里士多德大学) Shandong University(山东大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出HANIA框架,通过规划器引导的多模态图证据选择处理ScienceQA问答任务,无需目标数据集微调或迭代检索即可实现具竞争力的多模态问答。

Comments 10 pages, 1 figure. Accepted at Graph-enhanced LLMs for trustwOrthy Web data management (GLOW), ISWC 2026 Workshops, Bari, Italy

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28062 2026-09-01 cs.AI 版本更新 70%

WeAgent-MMSearch: Native Text-Vision Interaction for Multimodal Search Agents

WeAgent-MMSearch:面向多模态搜索智能体的原生文本-视觉交互

Zongkai Liu, Hui Zhang, Liqiang Niu, Zhen Cao, Han Li, Juntao Liu, Wenchao Chen, Chengduo Zhao, Chao Yu, Fandong Meng

机构 * Weixin AI, Tencent(腾讯微信人工智能) Sun Yat-sen University(中山大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 针对现有多模态搜索智能体忽略图像、长程交互易失败的问题,提出 WeAgent-MMSearch 系统,通过 WeAgent-Harness 实现文本-视觉交互,经 FA-GSPO 后训练后,模型在多模态搜索基准上性能大幅提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08311 2026-09-01 cs.SE cs.AI 版本更新 70%

Understanding Automated Program Repair Agents Through the Lens of Traceability: An Empirical Study

通过可追溯性视角理解自动化程序修复智能体:一项实证研究

Ira Ceka, Hailie Mitchell, Saurabh Pujar, Luca Buratti, Shyam Ramji, Junfeng Yang, Gail Kaiser, Baishakhi Ray

机构 * Columbia University(哥伦比亚大学) IBM Research(IBM研究院)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文通过追踪五个最先进的自动化程序修复智能体在500个真实世界修复任务中的决策流程,揭示了它们在逻辑密集型错误修复、测试生成和回归测试选择方面的关键局限性,并提出了改进方向。

Comments Accepted for publication (ISSTA '26). Camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29379 2026-09-01 cs.RO 新提交 67%

Bridging Semantics and Physics with Constrained LLMs for Safe and Trustworthy Robotic Manipulation

用受约束的大语言模型(LLM)弥合语义与物理鸿沟,实现安全可信的机器人操纵

Wenhao Hong, Lan Wei, Dandan Zhang

机构 * Imperial College London(帝国理工学院)

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 该研究针对语言引导机器人操纵的语言-动作鸿沟,通过类型化契约约束LLM决策,结合MoveIt流水线验证,在多类机器人任务上实现了优于脚本策略的安全可靠性能。

Comments ECCV Workshop paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29347 2026-09-01 cs.RO 新提交 67%

A Cognitive Architecture for Shared Autonomy in AUV Operations

用于自主水下航行器(AUV)作业的共享自主权认知架构

Niamh Ellis, Thi Tran, Ignacio Carlucho, Yvan R. Petillot

机构 * School of Informatics, University of Edinburgh(爱丁堡大学信息学院) School of Engineering and Physical Sciences, Heriot-Watt University(赫瑞瓦特大学工程与物理科学学院)

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 本文提出一种由本体和多个LLMs构成的AUV作业共享自主权认知架构,经对比Llama3、GPT-OSS、Qwen2.5后,发现GPT-OSS在可行性评估等任务中表现最优,Qwen2.5则擅长识别自然语言输入的任务类型。

Comments IEEE OES AUV Symposium 2026 Southampton

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28846 2026-09-01 cs.CL cs.AI cs.LG 新提交 67%

A rigor-matched audit of periodic-step layer skipping for efficient llm inference: conflayers versus swift, with a supplemental analysis of trained routing alternatives

高效大语言模型推理的周期步长层跳过方法的严格匹配审计:ConfLayers与SWIFT,及训练路由替代方法的补充分析

Prateek Kumar Sikdar, Arpan Ghosh

机构 * Accenture(埃森哲)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究通过含3个随机种子的严格匹配审计,对比了ConfLayers与SWIFT两种周期步长层跳过方法及训练路由方法的LLM推理效率,发现SWIFT推理速度更快但搜索开销更高,训练路由方法准确率更低,还发布了审计对比模板。

Comments 17 pages, 8 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15757 2026-09-01 cs.AI cs.CL cs.LG cs.MA 版本更新 67%

Language-Guided Tuning: Configuration Optimization for Automated ML Research

语言引导调优:自动化机器学习研究的配置优化

Yuxing Lu, Yucheng Hu, Nan Sun, Xukai Zhao

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对机器学习配置优化瓶颈,提出多智能体大语言模型框架LGT,协调三类智能体形成反馈循环,在七个数据集上实现比传统方法更优的可解释性优化效果。

Comments 18 pages, 4 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19245 2026-09-01 cs.SE cs.CV cs.MA 版本更新 67%

MaCTG: Multi-Agent Collaborative Thought Graph for Automatic Programming

MaCTG:用于自动编程的多智能体协作思维图

Zixiao Zhao, Jing Sun, Zhe Hou, Zhiyuan Wei, Cheng-Hao Cai, Miao Qiao, Jin Song Dong

机构 * School of Computer Science, University of Auckland(计算机科学系,奥克兰大学) School of Information and Communication Technology, Griffith University(信息与通信技术系,格里菲斯大学) Beijing Institute of Technology(北京理工大学) Suzhou Industrial Park Monash Research Institute of Science and Technology(苏州工业园区莫纳什科学与技术研究所) School of Computing, National University of Singapore(计算系,新加坡国立大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 本文提出MaCTG多智能体框架,通过动态图结构实现LLM智能体的精准协作,在传统图像处理自动编程任务中达83.33%最优准确率,运营成本较现有多智能体框架降低89.09%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14643 2026-09-01 cs.AI cs.CL 66%

Argumentation for Explainable and Globally Contestable Decision Support with LLMs

基于大语言模型的可解释且全球可争议的决策支持论证

Adam Dejl, Matthew Williams, Francesca Toni

专题命中 规划推理 :reasoning(abstract,journal_ref);分类 cs.CL、cs.AI

AI总结 本文提出ArgEval框架,通过结构化评估通用决策选项,实现可解释且可全球争议的决策支持,应用于胶质瘤治疗推荐,产生符合临床实践的解释性指导。

Comments KR 2026, KR Meets Machine Learning and Explanation Track

Journal ref Proceedings of the 23rd International Conference on Principles of Knowledge Representation and Reasoning - KR meets Machine Learning and Explanation, 917-928. 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30952 2026-09-01 cs.LG cs.CL 新提交 62%

One Policy Is Enough: Single-Agent Reinforcement Learning Outperforms Tree Search for Chemistry Tool Learning

一个策略就足够:单智能体强化学习在化学工具学习中优于树搜索

Armin Dariani, Sifan Wu, Bang Liu, Entao Yang

机构 * DIRO, Université de Montréal(蒙特利尔大学DIRO学院) Mila - Quebec Artificial Intelligence Institute(米拉-魁北克人工智能研究所) Air Liquide(液化空气集团)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 该研究提出单智能体强化学习模型,在ChemToolBench多工具化学任务上,相较CheMatAgent的树搜索方法,在Qwen-2.5-7B和Llama-3.1-8B上提升了工具F1、返回F1及答案通过率,且成本更低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30581 2026-09-01 cs.AI cs.LG 新提交 62%

Automated Testing of LLM-Based Post Hoc Explainers Using Model Checking as an Oracle

使用模型检验作为神谕对基于大语言模型(LLM)的事后解释器进行自动化测试

Dennis Gross, Helge Spieker

机构 * Institut für Kommunikations- und Prüfungsforschung gGmbH(通信与测试研究院(非营利有限责任公司)) Simula Research Laboratory(Simula研究院)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出以概率模型检验为神谕、结合事后查询分类法,实现对基于LLM的事后解释器的自动化测试,在7个MDP环境中区分出不同规模LLM的解释可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29096 2026-09-01 cs.LG cs.AI 新提交 62%

Development of an Autonomous AI Coding Agent using Monte Carlo Tree Search (MCTS) and Gemini LLM Frameworks

基于蒙特卡洛树搜索(MCTS)和Gemini大语言模型框架的自主AI编码智能体开发

Pravin Game, Vipin Ramakrishnan, Prathamesh Wagh

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本研究开发了一种结合Gemini LLM与定制MCTS的自主AI编码智能体,通过自评判系统优化代码生成,在复杂逻辑任务上成功率达92%,性能优于零样本生成模型。

Comments 10 PAGES WITH PLAGIARISM REPORT ON 10TH PAGE

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28648 2026-09-01 cs.HC cs.AI cs.CL 版本更新 62%

Why It Hurts: Identifying the Drivers of Negative Thoughts in Emotional Support Conversations

为何会痛苦:识别情感支持对话中消极想法的驱动因素

Hainiu Xu, Zhaoyue Sun, Hanqi Yan, Jinhua Du, Caroline Catmur, Yulan He

机构 * King’s College London(伦敦国王学院) JinFlow Intelligence Ltd.(金流智能公司) The Alan Turing Institute(阿兰·图灵研究所)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 本研究针对LLM情感支持任务中认知评估维度显著性被忽视的问题,推出AppraiSal基准并提出基于贝叶斯逆规划的多智能体概率框架PRISM,提升了LLMs识别情境特定显著评估维度的能力。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13318 2026-09-01 cs.AI cs.CL 版本更新 62%

WebXSkill: Skill Learning for Autonomous Web Agents

WebXSkill:自主网页代理的技能学习

Zhaoyang Wang, Qianhui Wu, Xuchao Zhang, Chaoyun Zhang, Wenlin Yao, Fazle Elahi Faisal, Baolin Peng, Si Qin, Suman Nath, Qingwei Lin, Chetan Bansal, Dongmei Zhang, Saravan Rajmohan, Jianfeng Gao, Huaxiu Yao

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Microsoft(微软)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 WebXSkill通过可执行技能框架解决自主网页代理在长周期任务中的执行与适应问题,提升任务成功率。

Comments Accepted to Findings of EMNLP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03677 2026-09-01 cs.CL cs.AI 版本更新 62%

MIND: Unified Inquiry and Diagnosis RL with Criteria Grounded Clinical Supports for Psychiatric Consultation

MIND: 一种基于临床标准的统一探究与诊断强化学习框架用于精神病咨询

Guoyi Li, Shihao Xu, Jiatong Ma, Zhongjiang Yao, Yunyun Han, Jianhua Chen, Yafeng Deng

机构 * EverMind AI Inc.(EverMind AI公司) EverMind AI Inc., Tianqiao and Chrissy Chen Institute(EverMind AI公司、田桥与克里斯西·陈研究所) Shanghai Mental Health Center, Shanghai Jiao Tong University School of Medicine(上海精神卫生中心、上海交通大学医学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 MIND通过基于临床标准的推理框架提升精神病咨询的诊断准确性和互动质量。

Comments Accepted to EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01419 2026-09-01 cs.LG cs.AI 版本更新 62%

Semi-supervised CAPP Transformer Learning via Pseudo-labeling

半监督CAPP变换器学习 via 假设标签

Dennis Gross, Helge Spieker, Arnaud Gotlieb, Emmanuel Stathatos, Panorios Benardos, George-Christopher Vosniakos

机构 * Simula Research Laboratory(Simula研究实验室) National Technical University of Athens(希腊国家技术大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种半监督学习方法,通过假设标签改进基于变换器的CAPP模型,提升数据稀缺环境下的制造过程规划准确性。

Comments 4th European Symposium on Artificial Intelligence in Manufacturing

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30959 2026-09-01 cs.CV cs.AI 新提交 57%

LOCI: A Locator-Critic with Refinement Loop

LOCI:带精化循环的定位器-评判器

Walid Bousselham, Mathilde Caron, Arsha Nagrani, Cordelia Schmid

机构 * Google DeepMind(谷歌DeepMind)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 针对视觉语言模型无法定位图像关键细节的问题,提出无需训练的LOCI框架,通过定位器与评判器的迭代精化循环实现自修正,在多个复杂视觉基准上取得当前最优结果,显著提升了开源与专有VLMs的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30345 2026-09-01 cs.AI 新提交 57%

Answer Probing-Guided Search for Diverse Solution Exploration of LLMs

基于答案探测引导的大语言模型多样化解决方案探索搜索

Yi Fang, Que Shen, Chengpeng Li, Boyi Deng, Wei Shi, Wenjie Wang, Fuli Feng, Fengli Xu, Dayiheng Liu

机构 * University of Science and Technology of China(中国科学技术大学) Zhongguancun Academy(中关村学院) Alibaba Group(阿里巴巴集团) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究针对LLMs推理易收敛于单一解的问题,提出Answer Probing引导的树搜索APTS,经实验证实可提升多推理任务的解决方案多样性,具备有效性与鲁棒性。

Comments Accepted to the EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏