arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-04 至 2026-02-04 共收录 25 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 25 篇

2602.03197 2026-02-04 cs.HC 88%

Exploring the Role of Tracing in AI-Supported Planning for Algorithmic Reasoning

探索在AI支持的规划中追踪的作用:用于算法推理

Yoshee Jain, Heejin Do, Zihan Wu, April Yi Wang

专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract)

AI总结 本研究探讨了在AI支持的规划中使用追踪对算法推理的影响,发现追踪促使学习者转向目标导向的推理,并提高了部分正确解决方案的一致性,但未显著影响反馈质量。

Comments 14 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02873 2026-02-04 cs.CV 85%

ViThinker: Active Vision-Language Reasoning via Dynamic Perceptual Querying

ViThinker: 通过动态感知查询实现主动视觉-语言推理

Weihang You, Qingchan Zhu, David Liu, Yi Pan, Geng Yuan, Hanqi Jiang

机构 * School of Computing, University of Georgia(计算机学院,佐治亚大学) School of Engineering and Applied Science, Princeton University(工程与应用科学学院,普林斯顿大学)

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 ViThinker通过动态感知查询实现主动视觉-语言推理,提升感知基础和推理准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03769 2026-02-04 cs.LG 83%

Reasoning with Latent Tokens in Diffusion Language Models

在扩散语言模型中使用潜在令牌进行推理

Andre He, Sean Welleck, Daniel Fried

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.LG

AI总结 本文提出通过引入潜在令牌提升扩散语言模型在需要全局一致性和前瞻性的推理任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03376 2026-02-04 cs.RO cs.CV 82%

PlanTRansformer: Unified Prediction and Planning with Goal-conditioned Transformer

PlanTRansformer: 一种结合目标条件变换器的统一预测与规划

Constantin Selzer, Fabina B. Flohr

机构 * Department of Electrical Engineering and Information Technology, Intelligent Vehicles Lab (IVL), Munich University of Applied Science(电气工程与信息科技系,智能车辆实验室(IVL),慕尼黑应用科学大学)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract)

AI总结 PlanTRansformer通过整合目标条件预测、动态可行性等技术,提升自动驾驶中的预测与规划性能。

Comments Submitted and accepted at IEEE IV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03255 2026-02-04 cs.AI 79%

LPS-Bench: Benchmarking Safety Awareness of Computer-Use Agents in Long-Horizon Planning under Benign and Adversarial Scenarios

LPS-Bench: 在长周期规划中评估计算机使用代理的安全意识基准测试

Tianyu Chen, Chujia Hu, Ge Gao, Dongrui Liu, Xia Hu, Wenjie Wang

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 LPS-Bench通过评估长周期规划中计算机使用代理的安全意识,揭示现有系统在安全行为维持方面的不足,并提出缓解策略以提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03097 2026-02-04 cs.AI 79%

De-conflating Preference and Qualification: Constrained Dual-Perspective Reasoning for Job Recommendation with Large Language Models

解构偏好与资格:基于大语言模型的约束双视角推理 job 推荐

Bryce Kan, Wei Yang, Emily Nguyen, Ganghui Yi, Bowen Yi, Chenxiao Yu, Yan Liu

机构 * University of Southern California(南加州大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 JobRec通过约束双视角推理解构偏好与资格,提升职位推荐的可控性和匹配质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02991 2026-02-04 cs.AI 79%

Large Language Models Can Take False First Steps at Inference-time Planning

大语言模型在推理时间规划中可能采取错误的初始步骤

Haijiang Yan, Jian-Qiao Zhu, Adam Sanborn

机构 * Department of Psychology, The University of Warwick(沃里克大学心理学系) Department of Psychology, The University of Hong Kong(香港大学心理学系)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 研究揭示了大语言模型在推理过程中因自我生成上下文积累导致的规划行为偏差,并通过实验验证了规划能力随上下文变化而变化的机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15113 2026-02-04 cs.CL 79%

Inferring Scientific Cross-Document Coreference and Hierarchy with Definition-Augmented Relational Reasoning

基于定义增强的 relational 推理进行科学跨文档指代与层次推断

Lior Forer, Tom Hope

机构 * The Hebrew University of Jerusalem(希伯来大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出基于定义增强的relational推理方法,用于科学文本中的跨文档指代和层次推断,通过生成上下文依赖的概念定义和关系定义,提升模型对复杂科学概念的推理能力。

Comments Accepted to TACL. Pre-MIT Press publication version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03442 2026-02-04 cs.CL 70%

A-RAG: Scaling Agentic Retrieval-Augmented Generation via Hierarchical Retrieval Interfaces

A-RAG:通过分层检索接口扩展代理检索增强生成

Mingxuan Du, Benfeng Xu, Chiwei Zhu, Shaohan Wang, Pengyu Wang, Xiaorui Wang, Zhendong Mao

机构 * University of Science and Technology of China(中国科学技术大学) Metastone Technology(metastone技术公司)

专题命中 规划推理 :reasoning(abstract);test-time compute(abstract);分类 cs.CL

AI总结 A-RAG通过分层检索接口提升检索增强生成效果,有效利用模型能力并适应不同任务。

Comments 18 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02995 2026-02-04 cs.AI 70%

Agent Alpha: Tree Search Unifying Generation, Exploration and Evaluation for Computer-Use Agents

Agent Alpha:通过树搜索统一生成、探索和评估计算机使用代理

Sizhe Tang, Rongqian Chen, Tian Lan

机构 * The George Washington University(乔治·华盛顿大学)

专题命中 规划推理 :planning(abstract);test-time compute(abstract);分类 cs.AI

AI总结 Agent Alpha通过步骤级MCTS统一生成、探索和评估,实现计算机使用代理的高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03622 2026-02-04 cs.CL cs.AI cs.LG 67%

Align to Structure: Aligning Large Language Models with Structural Information

对齐结构:将大型语言模型与结构信息对齐

Zae Myung Kim, Anand Ramachandran, Farideh Tavazoee, Joo-Kyung Kim, Oleg Rokhlenko, Dongyeop Kang

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过整合语言学话语框架到强化学习中,结构对齐方法提升LLMs在长文本生成和摘要任务中的连贯性和结构组织能力。

Comments Accepted to AAAI 2026 AIA

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03704 2026-02-04 cs.CL cs.AI 62%

Cognitively Diverse Multiple-Choice Question Generation: A Hybrid Multi-Agent Framework with Large Language Models

具有大语言模型的混合多智能体框架的认知多样性多项选择题生成

Yu Tian, Linh Huynh, Katerina Christhilf, Shubham Chakraborty, Micah Watanabe, Tracy Arner, Danielle McNamara

机构 * Arizona State University(亚利桑那州立大学)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 ReQUESTA通过混合多智能体框架生成认知多样化的多项选择题,提升生成的题目难度、区分度和语义一致性。

Comments This manuscript is under review at Electronics

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03608 2026-02-04 cs.CL cs.AI cs.IR 62%

Controlling Output Rankings in Generative Engines for LLM-based Search

在基于大语言模型的搜索生成引擎中控制输出排名

Haibo Jin, Ruoxi Chen, Peiyan Zhang, Yifeng Luo, Huimin Zeng, Man Luo, Haohan Wang

机构 * School of Information Sciences, University of Illinois at Urbana-Champaign, IL, USA(伊利诺伊大学厄巴纳-香槟分校信息科学学院) Independent Researcher, Starc Institute(Starc研究所独立研究者) Research Scientist, Intel Labs, Santa Clara, CA, USA(英特尔实验室研究科学家)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 CORE通过优化内容生成,提升基于LLM的搜索中小企业产品的可见性,实现高推广成功率。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02891 2026-02-04 cs.LG cs.CL 62%

TraceNAS: Zero-shot LLM Pruning via Gradient Trace Correlation

TraceNAS: 通过梯度轨迹相关性实现零样本LLM剪枝

Prajna G. Malettira, Manish Nagaraj, Arjun Roy, Shubham Negi, Kaushik Roy

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 TraceNAS通过梯度轨迹相关性实现零样本LLM剪枝,高效发现高保真剪枝模型,减少GPU计算成本并提升模型性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02862 2026-02-04 cs.AI cs.LG 62%

STEER: Inference-Time Risk Control via Constrained Quality-Diversity Search

STEER: 通过受约束的质量多样性搜索实现推理时间的风险控制

Eric Yang, Jong Ha Lee, Jonathan Amar, Elissa Ye, Yugang Jia

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 STEER通过受约束的质量多样性搜索实现推理时间的风险控制,提供可调节的决策保守性调整,提升临床分诊等场景下的行为覆盖和准确性。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02639 2026-02-04 cs.AI cs.LG 62%

A Positive Case for Faithfulness: LLM Self-Explanations Help Predict Model Behavior

对忠实性的积极案例:LLM自我解释有助于预测模型行为

Harry Mayne, Justin Singh Kang, Dewi Gould, Kannan Ramchandran, Adam Mahdi, Noah Y. Siegel

机构 * University of Oxford(牛津大学) University of California, Berkeley(加州大学伯克利分校) University College London(伦敦大学学院) Google DeepMind(谷歌DeepMind)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出NSG度量标准,证明LLM自我解释能提升模型行为预测能力,且比外部生成解释更具预测价值,揭示了自我解释在AI监督中的积极作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02550 2026-02-04 cs.LG cs.AI 62%

HyPAC: Cost-Efficient LLMs-Human Hybrid Annotation with PAC Error Guarantees

HyPAC: 低成本的LLM-人类混合标注与PAC误差保证

Hao Zeng, Huipeng Huang, Xinhao Qu, Jianguo Huang, Bingyi Jing, Hongxin Wei

机构 * Department of Statistics and Data Science, Southern University of Science and Technology, China(统计与数据科学系,南方科技大学) Department of Statistics, University of California at Riverside, USA(统计系,加州大学河滨分校) College of Computing and Data Science, Nanyang Technological University, Singapore(计算与数据科学学院,南洋理工大学) School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen, China(人工智能学院,香港中文大学(深圳))

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 HyPAC通过自适应路由和PAC误差保证,实现低成本高效标注,降低78.51%成本并严格控制误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03798 2026-02-04 cs.SE cs.CL cs.CV 57%

FullStack-Agent: Enhancing Agentic Full-Stack Web Coding via Development-Oriented Testing and Repository Back-Translation

全栈代理:通过面向开发的测试和仓库反翻译增强全栈网页编码

Zimu Lu, Houxing Ren, Yunqiao Yang, Ke Wang, Zhuofan Zong, Mingjie Zhan, Hongsheng Li

机构 * Multimedia Laboratory (MMLab), The Chinese University of Hong Kong(香港中文大学多媒体实验室) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 FullStack-Agent通过面向开发的测试和仓库反翻译提升全栈网页编码能力,其多代理框架和自我改进方法在多个测试用例中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03645 2026-02-04 cs.LG 57%

Reinforcement Fine-Tuning for History-Aware Dense Retriever in RAG

强化微调用于历史感知密集检索器在RAG中

Yicheng Zhang, Zhen Qin, Zhaomin Wu, Wenqi Zhang, Shuiguang Deng

机构 * College of Computer Science and Technology, Zhejiang University, Hangzhou, China(浙江大学计算机科学与技术学院) Ningbo Global Innovation Center, Zhejiang University, Ningbo, China(浙江大学宁波全球创新中心) Department of Computer Science, National University of Singapore, Singapore(新加坡国立大学计算机科学系)

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出通过强化学习优化RAG中的检索器,通过引入随机采样和历史状态缓解状态别名问题,提升检索性能。

Comments On going work. Codes are released at https://github.com/zyc140345/HARR

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03496 2026-02-04 cs.LG 57%

Lookahead Path Likelihood Optimization for Diffusion LLMs

前瞻路径似然优化用于扩散大语言模型

Xuejie Liu, Yap Vit Chun, Yitao Liang, Anji Liu

机构 * Institute for Artificial Intelligence, Peking University(人工智能研究院,北京大学) School of Computing, National University of Singapore(计算学院,新加坡国立大学) School of Intelligence Science and Technology, Peking University(智能科学与技术学院,北京大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出POKE-SMC方法,通过优化路径似然提升扩散大语言模型的解屏蔽路径准确性,实验表明在同等计算开销下,平均提升2%-3%的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03320 2026-02-04 cs.CV cs.AI 57%

MedSAM-Agent: Empowering Interactive Medical Image Segmentation with Multi-turn Agentic Reinforcement Learning

MedSAM-Agent: 通过多轮代理强化学习赋能交互式医学图像分割

Shengyuan Liu, Liuxin Bao, Qi Yang, Wanting Geng, Boyun Zheng, Chenxin Li, Wenting Chen, Houwen Peng, Yixuan Yuan

机构 * Chinese University of Hong Kong, Hong Kong SAR, China(香港中文大学) Hunyuan Group, Tencent(腾讯洪音集团) Institute of Automation, the Chinese Academy of Sciences, Beijing, China(中国科学院自动化研究所) Dalian University of Technology, Dalian, China(大连理工大学) Stanford University, Stanford, USA(斯坦福大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 MedSAM-Agent通过多轮代理强化学习提升医学图像分割的交互效率与准确性

Comments 23 Pages, 4 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02858 2026-02-04 cs.RO cs.LG cs.MA cs.NI cs.SY eess.SY 57%

IMAGINE: Intelligent Multi-Agent Godot-based Indoor Networked Exploration

IMAGINE: 基于 Godot 的智能多智能体室内网络探索

Tiago Leite, Maria Conceição, António Grilo

机构 * Institute for Systems and Robotics(系统研究所)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 本文提出基于Godot的多智能体强化学习方法,用于解决室内未知环境中的自主协作探索问题,通过高保真模拟和课程学习提升训练效率与鲁棒性。

Comments 12 pages, submitted to a journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03432 2026-02-04 cs.IR 50%

Failure is Feedback: History-Aware Backtracking for Agentic Traversal in Multimodal Graphs

失败是反馈:面向多模态图中代理遍历的历史感知回溯

Joohyung Yun, Doyup Lee, Wook-Shin Han

专题命中 规划推理 :reasoning(abstract)

AI总结 FiF通过历史感知回溯和经济理性的代理工作流程,提升多模态图中检索的适应性和效率。

Comments Project page: https://failureisfeedback.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02787 2026-02-04 cs.NI 50%

Real-World Applications of AI in LTE and 5G-NR Network Infrastructure

AI在LTE和5G-NR网络基础设施中的实际应用

Simran Saxena, Arpad Kovesdy

专题命中 规划推理 :planning(abstract)

AI总结 本文提出利用AI技术优化LTE和5G-NR网络,通过AI辅助规划、强化学习优化和边缘托管模型,提升网络性能并扩大数字服务的可及性。

Comments 6 pages and 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00509 2026-02-04 cs.DC 50%

PROBE: Co-Balancing Computation and Communication in MoE Inference via Real-Time Predictive Prefetching

PROBE: 通过实时预测预取在MoE推理中协同平衡计算与通信

Qianchao Zhu, Xucheng Ye, Yuliang Liu, Haodong Ouyang, Chengru Song

专题命中 规划推理 :planning(abstract)

AI总结 PROBE通过实时预测预取技术,在MoE推理中平衡计算与通信,减少预填延迟并提升解码吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏