arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 18998 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 18998 篇

2603.09200 2026-03-11 cs.AI cs.CL cs.CY cs.LG 82%

The Reasoning Trap -- Logical Reasoning as a Mechanistic Pathway to Situational Awareness

推理陷阱——逻辑推理作为情境意识的机制路径

Subramanyam Sahoo, Aman Chadha, Vinija Jain, Divya Chaudhary

机构 * MARS 4.0 Fellowship, Cambridge AI Safety Hub(CAISH), University of Cambridge(MARS 4.0 Fellow,剑桥人工智能安全中心(CAISH),剑桥大学) AWS Generative AI Innovation Center, Amazon Web Services, USA(亚马逊生成AI创新中心,亚马逊网络服务,美国) Google, USA(谷歌,美国) Stanford University(斯坦福大学) Northeastern University, Seattle, WA, USA(东北大学,西雅图,华盛顿州,美国)

专题命中 推理与问题求解 :large language model(abstract,comments);language model(abstract,comments);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出RAISE框架,揭示逻辑推理能力提升与情境意识升级的机制路径,并提出安全原则与测试方法以应对潜在风险。

Comments Accepted at ICLR 2026 Workshop on Logical Reasoning of Large Language Models. 21 Pages. Position Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21344 2026-03-10 cs.AI cs.CL cs.LG 82%

Linear probes rely on textual evidence: Results from leakage mitigation studies in language models

线性探针依赖文本证据:语言模型中泄露缓解研究的结果

Gerard Boxo, Aman Neelappa, Shivam Raval

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现线性探针在依赖文本证据检测行为时性能下降,表明其在非表层模式检测中可能不够稳健。

Comments 33 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07824 2026-03-10 cs.RO 82%

Reasoning Knowledge-Gap in Drone Planning via LLM-based Active Elicitation

通过基于大语言模型的主动获取解决无人机规划中的推理知识缺口

Zeyu Fang, Beomyeol Yu, Cheng Liu, Zeyuan Yang, Rongqian Chen, Yuxin Lin, Mahdi Imani, Tian Lan

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract)

AI总结 本文提出基于大语言模型的主动信息获取框架,用于解决无人机规划中的推理知识缺口问题,通过结构化知识缺口和最小化人机交互提升复杂任务的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07725 2026-03-10 cs.IR 82%

Verifiable Reasoning for LLM-based Generative Recommendation

基于LLM的生成推荐的可验证推理

Xinyu Lin, Hanqing Zeng, Hanchao Yu, Yinglong Xia, Jiang Zhang, Aashu Singh, Fei Liu, Wenjie Wang, Fuli Feng, Tat-Seng Chua, Qifan Wang

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract)

AI总结 VRec通过引入推理-验证-推荐范式,提升LLM生成推荐的准确性和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06084 2026-03-09 cs.RO 82%

Multimodal Behavior Tree Generation: A Small Vision-Language Model for Robot Task Planning

多模态行为树生成:一种小型视觉-语言模型用于机器人任务规划

Cristiano Battistini, Riccardo Andrea Izzo, Gianluca Bardaro, Matteo Matteucci

机构 * Department of Electronics, Information, and Bioengineering, Politecnico di Milano(电子信息与生物工程系,米兰理工学院)

专题命中 推理与问题求解 :language model(title,abstract);small language model(abstract)

AI总结 本文提出一种小型视觉-语言模型,通过生成行为树提升机器人任务规划效率,实验证明其在性能和资源消耗上均优于现有闭源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02156 2026-03-04 cs.CL cs.AI cs.LG 82%

Adaptive Social Learning via Mode Policy Optimization for Language Agents

基于模式策略优化的自适应社会学习语言代理

Minzheng Wang, Yongbin Li, Haobo Wang, Xinghua Zhang, Nan Xu, Bingli Wu, Fei Huang, Haiyang Yu, Wenji Mao

专题命中 推理与问题求解 :language agent(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出ASL框架和AMPO算法,通过多粒度推理模式设计和上下文感知切换,提升语言代理在动态社交互动中的自适应推理能力,实验显示在任务表现和思考链效率上优于现有方法。

Comments Proceedings of ICLR 2026. The code and data are available, see https://github.com/MozerWang/AMPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00737 2026-03-03 cs.LO 82%

LLM-Powered Automatic Theorem Proving and Synthesis for Hybrid Systems and Game

基于大语言模型的混合系统和游戏自动定理证明与综合

Aditi Kabra, Jonathan Laurent, Ruben Martins, Stefan Mitsch, André Platzer

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract)

AI总结 本文利用大语言模型扩展混合系统和游戏的自动定理证明与综合,通过混合游戏符号逻辑和微分游戏逻辑实现对复杂CPS的验证与综合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09758 2026-03-03 cs.LO 82%

Towards Language Model Guided TLA+ Proof Automation

面向语言模型引导的TLA+证明自动化

Yuhao Zhou, Stavros Tripakis

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract)

AI总结 本文提出基于语言模型的TLA+证明自动化方法,通过引导分层分解和符号证明者验证,提升证明效率并减少错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21099 2026-02-25 cs.IR 82%

Turning Semantics into Topology: LLM-Driven Attribute Augmentation for Collaborative Filtering

将语义转化为拓扑:基于LLM的属性增强协同过滤

Junjie Meng, Ranxu zhang, Wei Wu, Rui Zhang, Chuan Qin, Qi Zhang, Qi Liu, Hui Xiong, Chao Wang

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract)

AI总结 基于LLM的属性增强协同过滤框架,通过拓扑连接性转换语义知识,提升协同过滤效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20794 2026-02-25 cs.CV 82%

VGGDrive: Empowering Vision-Language Models with Cross-View Geometric Grounding for Autonomous Driving

VGGDrive: 通过跨视角几何 grounding 为自动驾驶赋能 Vision-Language 模型

Jie Wang, Guang Li, Zhijian Huang, Chenxu Dang, Hangjun Ye, Yahong Han, Long Chen

机构 * College of Intelligence and Computing, Tianjin University(智能与计算学院,天津大学) Xiaomi EV(小米汽车)

专题命中 推理与问题求解 :language model(title,abstract);foundation model(abstract)

AI总结 VGGDrive通过引入跨视角几何 grounding 机制,提升Vision-Language模型在自动驾驶任务中的性能表现。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16072 2026-02-20 cs.RO 82%

I-FailSense: Towards General Robotic Failure Detection with Vision-Language Models

I-FailSense:面向通用机器人故障检测的视觉-语言模型

Clemence Grislain, Hamed Rahimi, Olivier Sigaud, Mohamed Chetouani

机构 * ISIR, Sorbonne Université, CNRS(ISIR,索邦大学,国家科学研究中心)

专题命中 推理与问题求解 :language model(title,abstract);post-training(abstract)

AI总结 I-FailSense通过构建专门用于检测语义错位故障的数据集,提出了一种开源视觉-语言模型框架,有效提升机器人故障检测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15237 2026-02-18 cs.HC 82%

Ground-Truth Depth in Vision Language Models: Spatial Context Understanding in Conversational AI for XR-Robotic Support in Emergency First Response

视觉语言模型中的真实深度:用于虚拟现实机器人支持的紧急急救中的空间情境理解

Rodrigo Gutierrez Maquilon, Marita Hueber, Georg Regal, Manfred Tscheligi

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract)

AI总结 本文提出了一种结合深度传感与视觉语言模型的原型,用于增强紧急急救中的空间情境理解,通过深度增强提高准确性和稳定性,同时降低工作量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01476 2026-02-10 cs.AI cs.CL cs.LG 82%

Tree Search for Language Model Agents

语言模型代理的树搜索

Jing Yu Koh, Stephen McAleer, Daniel Fried, Ruslan Salakhutdinov

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种树搜索算法,用于提升语言模型代理在现实网页任务中的表现,实验显示其在成功率上显著优于基线方法。

Comments 13 pages. Models and code available at https://jykoh.com/search-agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08194 2026-02-06 cs.CV 82%

GIQ: Benchmarking 3D Geometric Reasoning of Vision Foundation Models with Simulated and Real Polyhedra

GIQ:基于模拟和真实多面体的3D几何推理视觉基础模型基准测试

Mateusz Michalkiewicz, Anekha Sokhal, Tadeusz Michalkiewicz, Piotr Pawlikowski, Mahsa Baktashmotlagh, Varun Jampani, Guha Balakrishnan

机构 * Rice University(里士大学) The University of Queensland(昆士兰大学)

专题命中 推理与问题求解 :foundation model(title,abstract);language model(abstract)

AI总结 GIQ通过模拟和真实多面体评估视觉基础模型的3D几何推理能力,揭示了现有模型在几何理解上的不足。

Comments Accepted to ICLR 2026. Camera ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04925 2026-02-06 cs.LG cs.AI cs.CL 82%

Internalizing LLM Reasoning via Discovery and Replay of Latent Actions

将LLM推理内化:通过发现和重播潜在动作

Zhenning Shi, Yijia Zhu, Junhan Shi, Xun Zhang, Lei Wang, Congcong Miao

机构 * Tsinghua University(清华大学) National University of Singapore(新加坡国立大学) Fuzhou University(福州大学)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 STIR通过动态潜在轨迹控制实现LLM推理内化,提升准确率并减少token消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04535 2026-02-05 cs.SD 82%

HoliAntiSpoof: Audio LLM for Holistic Speech Anti-Spoofing

HoliAntiSpoof: 面向整体语音反伪装的音频大语言模型

Xuenan Xu, Yiming Ren, Liwei Liu, Wen Wu, Baoxiang Li, Chaochao Lu, Shuai Wang, Chao Zhang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Nanjing University(南京大学)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract)

AI总结 HoliAntiSpoof通过音频大语言模型实现整体语音反伪装分析,通过统一文本生成任务提升检测性能并实现可解释的语义分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03589 2026-02-04 cs.CV 82%

SlowFocus: Enhancing Fine-grained Temporal Understanding in Video LLM

SlowFocus: 提升视频大语言模型中的细粒度时间理解

Ming Nie, Dan Ding, Chunwei Wang, Yuanfan Guo, Jianhua Han, Hang Xu, Li Zhang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Noah’s Ark Lab, Huawei(华为诺亚实验室) Yinwang Intelligent Technology Co., Ltd.(亿万象智能科技有限公司)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract)

AI总结 SlowFocus通过提升等效采样频率和引入多频率混合注意力模块,提升视频大语言模型对细粒度时间理解的能力。

Comments NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22221 2026-02-03 cs.CV 82%

Towards Faithful Reasoning in Remote Sensing: A Perceptually-Grounded GeoSpatial Chain-of-Thought for Vision-Language Models

迈向遥感中的可信推理:一种基于感知的地理空间思维链用于视觉-语言模型

Jiaqi Liu, Lang Sun, Ronghao Fu, Bo Yang

机构 * Key Laboratory of Symbolic Computation and Knowledge Engineering of Ministry of Education(教育部符号计算与知识工程重点实验室)

专题命中 推理与问题求解 :language model(title,abstract);SFT(abstract)

AI总结 本研究提出Geo-CoT框架,通过两阶段策略提升遥感VLMs的推理能力,实现可验证的多步骤分析,显著优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00941 2026-02-03 cs.NI 82%

LMTE: Putting the "Reasoning" into WAN Traffic Engineering with Language Models

LMTE:利用语言模型进行WAN流量工程中的推理

Xinyu Yuan, Yan Qiao, Zonghui Wang, Meng Li, Wenzhi Chen

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract)

AI总结 LMTE利用语言模型进行WAN流量工程,通过高效多模态对齐和轻量级配置生成,实现更高效的流量规划和优化。

Comments Accepted as a conference paper at IEEE INFOCOM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23149 2026-02-02 cs.SD 82%

Hearing is Believing? Evaluating and Analyzing Audio Language Model Sycophancy with SYAUDIO

听信还是不信?评估和分析音频语言模型的趋炎附势行为 with SYAUDIO

Junchi Yao, Lokranjan Lakshmikanthan, Annie Zhao, Danielle Zhao, Shu Yang, Zikang Ding, Di Wang, Lijie Hu

机构 * University of Electronic Science and Technology of China(电子科技大学) Mohamed bin Zayed University of Artificial Intelligence(Mohamed bin Zayed人工智能大学) King Abdullah University of Science and Technology(卡布斯大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract)

AI总结 SYAUDIO是首个评估音频语言模型趋炎附势行为的基准,通过系统分析不同领域和条件下的趋炎附势现象,验证了监督微调在减少此类行为中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17641 2026-01-29 cs.CL cs.AI cs.LG cs.SD 82%

AuditoryBench++: Can Language Models Understand Auditory Knowledge without Hearing?

AuditoryBench++: 语言模型能否在不听觉的情况下理解听觉知识?

Hyunjong Ok, Suho Yoo, Hyeonjun Kim, Jaeho Lee

机构 * Pohang University of Science and Technology(坡山科学技术大学) HJ AILAB Korea Advanced Institute of Science and Technology(韩国高级科学技术研究院)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 AuditoryBench++通过AIR-CoT方法提升语言模型在听觉知识推理中的表现。

Comments ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09706 2026-01-15 cs.CL cs.AI cs.LG 82%

Value-Aware Numerical Representations for Transformer Language Models

具有价值意识的数值表示用于Transformer语言模型

Andreea Dutulescu, Stefan Ruseti, Mihai Dascalu

机构 * National University of Science and Technology(科学技术大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种价值意识的数值表示方法,通过在Transformer语言模型输入中加入前缀标记以显式编码数值,从而提升模型在算术任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25602 2026-01-13 cs.IR 82%

TRUE: A Reproducible Framework for LLM-Driven Relevance Judgment in Information Retrieval

TRUE: 一种用于信息检索中基于大语言模型的相关性判断的可重复框架

Mouly Dewan, Jiqun Liu, Chirag Shah

专题命中 推理与问题求解 :LLM(title,abstract);prompting(abstract)

AI总结 TRUE是一种用于信息检索中基于大语言模型的相关性判断的可重复框架,通过迭代数据采样和推理评估多个相关性因素,提升相关性判断的可靠性和可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06931 2026-01-12 cs.RO 82%

Non-Prehensile Tool-Object Manipulation by Integrating LLM-Based Planning and Manoeuvrability-Driven Controls

通过整合基于大语言模型的规划和机动性驱动的控制实现非抓取工具-物体 manipulation

Hoi-Yin Lee, Peng Zhou, Anqing Duan, Wanyu Ma, Chenguang Yang, David Navarro-Alarcon

机构 * organization= Department of Mechanical Engineering, The Hong Kong Polytechnic University , addressline= KLN, Hong Kong organization= School of Advanced Engineering, The Great Bay University , addressline= Dongguan, China organization= Department of Robotics, Mohamed Bin Zayed University of Artificial Intelligence , addressline= Abu Dhabi, UAE organization= Department of Surgery, The Chinese University of Hong Kong , addressline= NT, Hong Kong organization= Department of Computer Science, University of Liverpool , addressline= Liverpool, UK

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract)

AI总结 本文提出了一种结合大语言模型和机动性驱动控制的方法,用于实现非抓取工具-物体 manipulation任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01952 2026-01-06 cs.SE 82%

Context-Adaptive Requirements Defect Prediction through Human-LLM Collaboration

基于人类与大语言模型协作的上下文自适应需求缺陷预测

Max Unterbusch, Andreas Vogelsang

专题命中 推理与问题求解 :LLM(title,abstract);prompting(abstract)

AI总结 本文提出基于人类与大语言模型协作的上下文自适应需求缺陷预测方法,通过反馈循环和少量样本学习提升预测性能,优于传统方法。

Comments Accepted at ICSE-NIER 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01233 2026-01-06 cs.SE 82%

Atomizer: An LLM-based Collaborative Multi-Agent Framework for Intent-Driven Commit Untangling

Atomizer: 一种基于大语言模型的协作多智能体框架,用于意图驱动的复合提交解缠

Kangchen Zhu, Zhiliang Tian, Shangwen Wang, Mingyue Leng, Xiaoguang Mao

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract)

AI总结 Atomizer通过意图导向的思考链策略和协作多智能体框架,有效解决复合提交解缠中的语义意图识别和多轮细化问题,提升解缠效果。

Comments Accepted by ICSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19453 2025-12-23 cs.RO 82%

MaP-AVR: A Meta-Action Planner for Agents Leveraging Vision Language Models and Retrieval-Augmented Generation

MaP-AVR: 一种利用视觉语言模型和检索增强生成的元动作规划器

Zhenglong Guo, Yiming Zhao, Feng Jiang, Heng Jin, Zongbao Feng, Jianbin Zhou, Siyuan Xu

机构 * Li Auto

专题命中 推理与问题求解 :language model(title);LLM(abstract);prompting(abstract)

AI总结 MaP-AVR通过元动作规划和检索增强生成技术,提升机器人在复杂环境中的任务规划能力。

Comments 8 pages, 10 figures, This work was completed in December 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19360 2025-12-23 cs.IR 82%

Generative vector search to improve pathology foundation models across multimodal vision-language tasks

生成向量搜索以提升多模态视觉-语言任务中的病理基础模型

Markus Ekvall, Ludvig Bergenstråhle, Patrick Truong, Ben Murrell, Joakim Lundeberg

专题命中 推理与问题求解 :foundation model(title);large language model(abstract);language model(abstract)

AI总结 STHLM通过生成向量搜索方法提升多模态视觉-语言任务中病理基础模型的检索性能,实现10-30%的性能提升和10倍的维度压缩

Comments 13 pages main (54 total), 2 main figures (9 total)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18966 2025-12-23 cs.SE 82%

Scrum Sprint Planning: LLM-based and algorithmic solutions

Scrum迭代规划:基于大语言模型和算法的解决方案

Yuwon Yoon, Kevin Iwan, Madeleine Zwart, Xiaohan Qin, Hina Lee, Maria Spichkova

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract)

AI总结 本文探讨了大语言模型在Scrum迭代规划中的应用,通过实验发现其结果质量不满足直接使用需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07276 2025-12-23 cs.CV 82%

Geo3DVQA: Evaluating Vision-Language Models for 3D Geospatial Reasoning from Aerial Imagery

Geo3DVQA:基于航拍影像评估视觉-语言模型在三维地理空间推理中的表现

Mai Tsujimoto, Junjue Wang, Weihao Xuan, Naoto Yokoya

机构 * The University of Tokyo(东京大学) RIKEN AIP(日本理化学研究所AIP)

专题命中 推理与问题求解 :language model(title,abstract);instruction tuning(abstract)

AI总结 Geo3DVQA通过评估视觉-语言模型在三维地理空间推理中的表现,揭示了RGB影像在3D空间分析中的局限性,并展示了领域特定指令微调对模型性能的提升。

Comments Accepted at WACV 2026. 32 pages long including the appendix. Revision details are provided in the supplements

详情

展开后加载摘要…

URL PDF HTML 收藏