arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-06 至 2026-01-06 共收录 18 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 18 篇

2601.01624 2026-01-06 cs.CL 79%

How Does Prefix Matter in Reasoning Model Tuning?

前缀在推理模型微调中起什么作用?

Raj Vardhan Tomar, Preslav Nakov, Yuxia Wang

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫莫德·本·扎耶德人工智能大学) Indian Institute of Technology Delhi(印度德里理工学院) INSAIT

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本研究探讨前缀在推理模型微调中的作用,发现其能提升安全性和推理性能,但对事实性和编程任务效果有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00978 2026-01-06 cs.RO 78%

From Perception to Symbolic Task Planning: Vision-Language Guided Human-Robot Collaborative Structured Assembly

从感知到符号任务规划:基于视觉语言的引导人机协作结构装配

Yanyi Chen, Min Deng

机构 * Department of Civil, Environmental, and Construction Engineering, Texas Tech University(土木、环境与建设工程系,德克萨斯理工大学)

专题命中 规划推理 :planning(title,abstract)

AI总结 本文提出基于视觉语言模型的人机协作结构装配框架,通过感知到符号态和人感知规划模块提升动态环境下的态估计和任务规划鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12869 2026-01-06 cs.CE cs.CL 70%

ERA-IT: Aligning Semantic Models with Revealed Economic Preference for Real-Time and Explainable Patent Valuation

ERA-IT:通过揭示的经济偏好对齐语义模型以实现实时和可解释的专利估值

Yongmin Yoo, Seungwoo Kim, Jingjiang Liu

机构 * School of Computing(计算学院) Macquarie University(麦考瑞大学) School of Computer Science(计算机科学学院) University of Technology Sydney(悉尼技术大学) School of Management(管理学院) Zhejiang University(浙江大学)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 ERA-IT通过揭示的经济偏好对齐语义模型,实现实时且可解释的专利估值,提升预测准确性并增强决策透明度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06240 2026-01-06 cs.RO cs.AI 70%

Affordance-Guided Coarse-to-Fine Exploration for Base Placement in Open-Vocabulary Mobile Manipulation

基于 affordance 的粗到细探索用于开放词汇移动操控中的基座放置

Tzu-Jung Lin, Jia-Fong Yeh, Hung-Ting Su, Chung-Yi Lin, Yi-Ting Chen, Winston H. Hsu

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出了一种基于 affordance 的粗到细探索方法,通过结合视觉语言模型的语义理解和几何可行性,提升开放词汇移动操控中基座放置的成功率。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16760 2026-01-06 cs.RO 67%

Vision-Language-Action Models for Autonomous Driving: Past, Present, and Future

面向自动驾驶的视觉-语言-动作模型:过去、现在与未来

Tianshuai Hu, Xiaolu Liu, Song Wang, Yiyao Zhu, Ao Liang, Lingdong Kong, Guoyang Zhao, Zeying Gong, Jun Cen, Zhiyu Huang, Xiaoshuai Hao, Linfeng Li, Hang Song, Xiangtai Li, Jun Ma, Shaojie Shen, Jianke Zhu, Dacheng Tao, Ziwei Liu, Junwei Liang

机构 * HKUST(香港科技大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) HKUST(GZ)(香港科技大学(广州)) DAMO Academy, Alibaba(阿里巴巴达摩院) University of California, Los Angeles(加州大学洛杉矶分校) Xiaomi EV(小米电动车) Xi'an Jiaotong University(西安交通大学) Nanyang Technological University, Singapore(新加坡南洋理工大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 本文探讨了自动驾驶中视觉-语言-动作模型的发展历程,提出两种主要范式并分析其挑战与未来方向。

Comments Survey; 47 pages, 7 figures, 9 tables; GitHub Repo at https://github.com/worldbench/awesome-vla-for-ad

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10304 2026-01-06 cs.LG cs.AI cs.CL 67%

Sample-Efficient Online Learning in LM Agents via Hindsight Trajectory Rewriting

通过回顾轨迹重写实现LM代理的样本高效在线学习

Michael Y. Hu, Benjamin Van Durme, Jacob Andreas, Harsh Jhamtani

机构 * New York University(纽约大学) Microsoft(微软)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ECHO通过回顾轨迹重写提升LM代理的样本效率,有效利用过去经验以更快适应新环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22458 2026-01-06 cs.CL cs.AI 62%

Evaluating LLM-based Agents for Multi-Turn Conversations: A Survey

评估基于大语言模型的代理在多轮对话中的性能:一项调查

Shengyue Guan, Jindong Wang, Jiang Bian, Bin Zhu, Jian-guang Lou, Haoyi Xiong

机构 * Microsoft(微软)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种基于PRISMA框架的系统方法,用于评估多轮对话中基于LLM的代理,通过两个分类系统定义评估内容和方法,涵盖任务完成、响应质量等关键维度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01816 2026-01-06 cs.AI 57%

Admissibility Alignment

可接受性对齐

Chris Duffey

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出MAP-AI架构,通过蒙特卡洛方法评估决策策略的可接受性,实现AI对齐的动态决策理论属性。

Comments 24 pages, 2 figures, 2 tables.. Decision-theoretic alignment under uncertainty

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01798 2026-01-06 cs.CV cs.AI 57%

VerLM: Explaining Face Verification Using Natural Language

通过自然语言解释面部验证

Syed Abdul Hannan, Hazim Bukhari, Thomas Cantalapiedra, Eman Ansar, Massa Baali, Rita Singh, Bhiksha Raj

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种视觉-语言模型用于面部验证,通过自然语言解释决策过程,提升验证的透明度和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01687 2026-01-06 cs.CV cs.AI 57%

FALCON: Few-Shot Adversarial Learning for Cross-Domain Medical Image Segmentation

FALCON:跨域少样本对抗学习用于医学图像分割

Abdur R. Fayjie, Pankhi Kashyap, Jutika Borah, Patrick Vandewalle

机构 * KU Leuven(卢森堡大学) IIT-Bombay(印度理工学院-孟买) Tezpur University(泰浦大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 FALCON通过跨域少样本对抗学习实现高精度医学图像分割,以更少的数据和计算开销获得更优的边界精度和分割性能。

Comments 20 pages, 6 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00818 2026-01-06 cs.AI 57%

Agentic AI for Autonomous, Explainable, and Real-Time Credit Risk Decision-Making

代理AI用于自主、可解释和实时的信用风险决策制定

Chandra Sekhar Kubam

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出代理AI框架,通过多代理系统实现自主、可解释和实时的信用风险决策,提升决策效率并应对监管与技术挑战。

Comments 8 pages

Journal ref INTELLIGENT SYSTEMS AND APPLICATIONS IN ENGINEERING, vol 12 No23, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12752 2026-01-06 cs.RO 50%

MOON: Multi-Objective Optimization-Driven Object-Goal Navigation Using a Variable-Horizon Set-Orienteering Planner

MOON:基于多目标优化的物体-目标导航变量视距集导向规划器

Daigo Nakajima, Kanji Tanaka, Daiki Iwata, Kouki Terashima

机构 * University of Fukui(福井大学)

专题命中 规划推理 :planning(abstract)

AI总结 MOON通过多目标优化解决大规模复杂环境中的导航问题,结合可变视距集导向规划和高效神经规划器,提升全局规划与实时决策效率。

Comments 9 pages, 7 figures, technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01416 2026-01-06 cs.CV 50%

AirSpatialBot: A Spatially-Aware Aerial Agent for Fine-Grained Vehicle Attribute Recognization and Retrieval

AirSpatialBot: 一种空间感知的空中智能体用于细粒度车辆属性识别与检索

Yue Zhou, Ran Ding, Xue Yang, Xue Jiang, Xingzhao Liu

机构 * Department of Electronic Engineering, Shanghai Jiao Tong University(电子工程系,上海交通大学) Department of Automation, Shanghai Jiao Tong University(自动化系,上海交通大学)

专题命中 规划推理 :planning(abstract)

AI总结 AirSpatialBot通过空间感知的VLM和两阶段训练策略,实现细粒度车辆属性识别与检索,解决遥感图像中的空间理解难题。

Comments 12 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01196 2026-01-06 cs.RO 50%

EduSim-LLM: An Educational Platform Integrating Large Language Models and Robotic Simulation for Beginners

EduSim-LLM: 一个整合大语言模型和机器人模拟的教育平台,用于初学者

Shenqi Lu, Liangwei Zhang

机构 * Hangzhou Dianzi University Information Engineering College(杭州电子科技大学信息工程学院)

专题命中 规划推理 :planning(abstract)

AI总结 EduSim-LLM通过整合大语言模型与机器人模拟,实现自然语言到机器人行为的转换,提升初学者在人机交互和多机器人协作中的控制与操作能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01139 2026-01-06 cs.RO cs.MA 50%

Latent Space Reinforcement Learning for Multi-Robot Exploration

潜在空间强化学习用于多机器人探索

Sriram Rajasekar, Ashwini Ratnoo

机构 * Department of Aerospace Engineering(航空航天工程系) Indian Institute of Science(印度科学研究所)

专题命中 规划推理 :planning(abstract)

AI总结 本文提出利用潜在空间强化学习,通过自编码器和过程生成算法提升多机器人探索效率和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00922 2026-01-06 eess.IV cs.CV 50%

MetaFormer-driven Encoding Network for Robust Medical Semantic Segmentation

基于MetaFormer的编码网络用于鲁棒的医学语义分割

Le-Anh Tran, Chung Nguyen Tran, Nhan Cach Dang, Anh Le Van Quoc, Jordi Carrabina, David Castells-Rufas, Minh Son Nguyen

专题命中 规划推理 :planning(abstract)

AI总结 本文提出MFEnNet,通过引入MetaFormer和优化模块,实现高效的医学图像语义分割,降低计算成本并提升分割精度。

Comments 10 pages, 5 figures, MCT4SD 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09907 2026-01-06 cs.CV 50%

VisualActBench: Can VLMs See and Act like a Human?

VisualActBench: VLMs能否像人一样看见并行动?

Daoan Zhang, Pai Liu, Xiaofei Zhou, Yuan Ge, Guangchen Lan, Jing Bi, Christopher Brinton, Ehsan Hoque, Jiebo Luo

机构 * University of Rochester(罗切斯特大学) Purdue University(普渡大学) Northeastern University(东北大学)

专题命中 规划推理 :reasoning(abstract)

AI总结 VisualActBench通过评估VLMs在视觉行动推理任务中的表现,揭示了其在主动推理和高优先级动作生成方面与人类能力的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16772 2026-01-06 cs.HC 50%

AI Knows Best? The Paradox of Expertise, AI-Reliance, and Performance in Educational Tutoring Decision-Making Tasks

AI知最佳?专家性、AI依赖与在教育辅导决策任务中的表现悖论

Eason Chen, Jeffrey Li, Scarlett Huang, Xinyi Tang, Jionghao Lin, Paulo Carvalho, Kenneth Koedinger

专题命中 规划推理 :reasoning(abstract)

AI总结 研究探讨AI辅助决策中专家性与AI依赖的矛盾,发现非专家更依赖AI建议而提升准确性,而专家则常忽视AI建议,导致表现差异。

Comments Paper presented at The International Conference on Learning Analytics & Knowledge (LAK26)

详情

展开后加载摘要…

URL PDF HTML 收藏