arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-16 至 2026-02-16 共收录 28 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 28 篇

2602.12574 2026-02-16 cs.DB cs.AI 89%

Monte Carlo Tree Search with Reasoning Path Refinement for Small Language Models in Conversational Text-to-NoSQL

具有推理路径细化的蒙特卡洛树搜索用于对话文本到NoSQL

Xubang Xiong, Raymond Chi-Wing Wong, Yuanfeng Song

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 推理与问题求解 :language model(title,abstract);small language model(title,abstract);SFT(abstract);分类 cs.AI

AI总结 本文提出Stage-MCTS框架,通过蒙特卡洛树搜索和推理路径细化,提升小型语言模型在对话文本到NoSQL任务中的查询生成能力,实验显示其EVM准确性提升达7.93%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12846 2026-02-16 cs.LG cs.AI 88%

Amortized Reasoning Tree Search: Decoupling Proposal and Decision in Large Language Models

渐进推理树搜索:在大语言模型中解耦提案与决策

Zesheng Hong, Jiadong Yu, Hui Pan

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 ARTS通过解耦生成与验证,有效解决大语言模型中推理路径被压制的问题,实现74.6%的性能,优于完全微调策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12889 2026-02-16 cs.CL 88%

BaziQA-Benchmark: Evaluating Symbolic and Temporally Compositional Reasoning in Large Language Models

BaziQA-Benchmark:评估大语言模型中的符号性和时间组合推理

Jiangxi Chen, Qian Liu

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 BaziQA-Benchmark通过结构化推理协议评估大语言模型在符号性和时间组合推理中的表现,揭示其在时间难度和推理顺序上的敏感性及系统性缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19135 2026-02-16 cs.AI 88%

Understanding Chain-of-Thought in Large Language Models via Topological Data Analysis

通过拓扑数据分析理解大语言模型中的推理链

Chenghao Li, Chaoning Zhang, Yi Lu, Shuxu Chen, Xudong Wang, Jiaquan Zhang, Zhicheng Wang, Zhengxun Jin, Kuien Liu, Sung-Ho Bae, Guoqing Wang, Yang Yang, Heng Tao Shen

机构 * UESTC CNU KHU CAS Tongji Univ(同济大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文通过拓扑数据分析评估大语言模型推理链的结构复杂性,揭示其与准确性的正相关关系,为优化推理过程提供新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05004 2026-02-16 cs.LG cs.AI cs.CL 87%

R-Zero: Self-Evolving Reasoning LLM from Zero Data

R-Zero:从零数据自演化推理大语言模型

Chengsong Huang, Wenhao Yu, Xiaoyang Wang, Hongming Zhang, Zongxia Li, Ruosen Li, Jiaxin Huang, Haitao Mi, Dong Yu

机构 * Tencent AI Seattle Lab(腾讯AI西雅图实验室) Washington University in St. Louis(华盛顿大学圣路易斯分校) University of Maryland, College Park(马里兰大学科廷分校) The University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 R-Zero通过自动生成训练数据,实现无需人工干预的自演化推理大语言模型,显著提升推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12285 2026-02-16 cs.CL cs.AI 86%

From Biased Chatbots to Biased Agents: Examining Role Assignment Effects on LLM Agent Robustness

从有偏聊天机器人到有偏代理:检验角色分配对LLM代理鲁棒性的影响

Linbo Cao, Lihao Sun, Yang Yue

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究发现基于人口统计学的人设分配会影响LLM代理的行为和性能,导致高达26.2%的降级,揭示了代理系统中隐含偏见和行为波动的风险。

Comments Accepted to the AAAI 2026 TrustAgent Workshop. 6 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10246 2026-02-16 cs.DC cs.AI 85%

KORAL: Knowledge Graph Guided LLM Reasoning for SSD Operational Analysis

KORAL: 基于知识图谱的LLM推理用于SSD运维分析

Mayur Akewar, Sandeep Madireddy, Dongsheng Luo, Janki Bhimani

机构 * Florida International University, Miami, FL, USA(佛罗里达国际大学) Argonne National Laboratory, Lemont, IL, USA(阿贡国家实验室)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 KORAL结合LLM和知识图谱,实现SSD的端到端推理分析,提供专家级诊断和可解释的运维建议。

Journal ref Proc. IEEE International Parallel and Distributed Processing Symposium (IPDPS), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20577 2026-02-16 cs.RO 85%

MeCo: Enhancing LLM-Empowered Multi-Robot Collaboration via Similar Task Memoization

MeCo:通过相似任务记忆增强基于大语言模型的多机器人协作

Baiqing Wang, Helei Cui, Bo Zhang, Xiaolong Zheng, Bin Guo, Zhiwen Yu

机构 * Northwestern Polytechnical University(西北工业大学) Beijing University of Posts and Telecommunications(北京邮电大学) Harbin Engineering University(哈尔滨工程大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 MeCo通过引入相似任务记忆化机制,有效提升多机器人协作的效率和成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02995 2026-02-16 cs.SD 85%

AudioToolAgent: An Agentic Framework for Audio-Language Models

AudioToolAgent: 一种用于音频-语言模型的代理框架

Gijs Wijngaard, Elia Formisano, Michel Dumontier, Jenia Jitsev

机构 * Maastricht University(马斯特里赫特大学) LAION Juelich Supercomputing Center (JSC), Research Center Juelich (FZJ)(尤利希超级计算中心(JSC),尤利希研究中心(FZJ))

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);large language model(abstract)

AI总结 AudioToolAgent通过中央LLM代理协调音频-语言模型作为工具,提升音频理解任务的多步骤推理和工具调用能力,实验结果显示在多个基准测试中达到最先进的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25889 2026-02-16 cs.CV cs.CL 83%

Multimodal LLM With Hierarchical Mixture-of-Experts for VQA on 3D Brain MRI

多模态大语言模型与分层混合专家用于3D脑部MRI的视觉问答

Arvind Murari Vepa, Yannan Yu, Jingru Gan, Anthony Cuturrufo, Michael F. Romano, Weikai Li, Fabien Scalzo, Wei Wang, Yizhou Sun

机构 * UCLA Computer Science(UCLA计算机科学系) UCSF Radiology(UCSF放射学) UCLA Medicine(UCLA医学)

专题命中 推理与问题求解 :LLM(title,abstract);pretraining(abstract);分类 cs.CL

AI总结 本研究提出了一种多模态大语言模型mpLLM,用于3D脑部MRI的视觉问答,通过分层混合专家架构提升肿瘤描述的临床可解释性,并在多个数据集上优于现有基线模型。

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19852 2026-02-16 cs.SD cs.AI 79%

Eliminating stability hallucinations in llm-based tts models via attention guidance

通过注意力引导消除基于大语言模型的TTS模型中的稳定性幻觉

ShiMing Wang, ZhiHao Du, Yang Xiang, TianYu Zhao, Han Zhao, Qian Chen, XianGang Li, HanJie Guo, ZhenHua Ling

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI

AI总结 本文通过改进注意力机制,减少基于大语言模型的TTS模型中的稳定性幻觉,提升语音合成的稳定性和连续性。

Comments The authors are withdrawing this preprint as it was submitted prematurely without the final approval of all collaborating institutions. We apologize for any inconvenience

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12405 2026-02-16 cs.RO cs.LG 79%

Self-Refining Vision Language Model for Robotic Failure Detection and Reasoning

自适应多任务视觉语言模型用于机器人故障检测与推理

Carl Qi, Xiaojie Wang, Silong Yong, Stephen Sheng, Huitan Mao, Sriram Srinivasan, Manikantan Nambi, Amy Zhang, Yesh Dattatreya

机构 * UT Austin(德克萨斯大学) Amazon Robotics(亚马逊机器人技术) Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理与问题求解 :language model(title);LLM(abstract);分类 cs.LG

AI总结 ARMOR是一种自适应多任务视觉语言模型,通过多任务自 refinement 过程提升机器人故障检测与推理性能,实现故障检测率提升30%和推理表现提升100%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12422 2026-02-16 cs.AR cs.AI cs.LG 79%

CacheMind: From Miss Rates to Why -- Natural-Language, Trace-Grounded Reasoning for Cache Replacement

CacheMind: 从缺失率到原因 -- 基于自然语言和跟踪数据的缓存替换推理

Kaushal Mhapsekar, Azam Ghanbari, Bita Aslrousta, Samira Mirbagher-Ajorpaz

机构 * North Carolina State University(北卡罗来纳州立大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 CacheMind通过自然语言和跟踪数据推理提升缓存替换性能,实现高准确率和实际应用效果。

Comments 16 pages, 13 figures, ASPLOS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12500 2026-02-16 cs.SE cs.AI cs.CR 77%

Favia: Forensic Agent for Vulnerability-fix Identification and Analysis

Favia:漏洞修复识别与分析的取证代理

André Storhaug, Jiamou Sun, Jingyue Li

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Favia通过结合可扩展的候选排名与深入语义推理,有效识别漏洞修复,优于传统和LLM基方法。

Comments 44 pages, 12 figures, 5 tables, 3 listings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13444 2026-02-16 cs.HC 75%

DuetUI: A Bidirectional Context Loop for Human-Agent Co-Generation of Task-Oriented Interfaces

DuetUI: 人机协同生成面向任务的界面的双向上下文循环

Yuan Xu, Shaowen Xiang, Yizhi Song, Ruoting Sun, Xin Tong

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 DuetUI通过双向上下文循环实现人机协同生成面向任务的界面,提升任务效率和界面可用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12597 2026-02-16 cs.RO cs.HC 75%

PISHYAR: A Socially Intelligent Smart Cane for Indoor Social Navigation and Multimodal Human-Robot Interaction for Visually Impaired People

PISHYAR:一种具有社会智能的智能拐杖,用于室内社交导航和多模态人机交互,以支持视障人士

Mahdi Haghighat Joo, Maryam Karimi Jafari, Alireza Taheri

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 PISHYAR是一款结合社会智能导航与多模态交互的智能拐杖,通过多模态技术提升视障人士的移动辅助与社交互动能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00020 2026-02-16 cs.CY cs.AI 74%

Beyond Static Question Banks: Dynamic Knowledge Expansion via LLM-Automated Graph Construction and Adaptive Generation

超越静态问题库:通过LLM自动图构建与自适应生成实现动态知识扩展

Yingquan Wang, Tianyu Wei, Qinsi Li, Li Zeng

机构 * Dalian University of Technology(大连理工大学) Chengdu Technological University(成都理工大学) Shenzhen Research Institute of Big Data(深圳大数据研究院)

专题命中 推理与问题求解 :LLM(title);分类 cs.AI

AI总结 本文提出生成式图RAG框架,通过自动图构建和自适应生成,实现动态知识扩展,提升个性化教育系统的适应性和有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12287 2026-02-16 cs.CL cs.AI eess.AS 73%

Retrieval-Augmented Self-Taught Reasoning Model with Adaptive Chain-of-Thought for ASR Named Entity Correction

带有自适应思维链的检索增强自教推理模型用于ASR命名实体修正

Junjie An, Jingguang Tian, Tianyi Wang, Yu Gao, Xiaofeng Mou, Yi Xu

机构 * AI Research Institute, Midea Group (Shanghai) Co.,Ltd., China(美的集团(上海)研究院) Zhejiang University, China(浙江大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种检索增强自教推理模型,用于改进ASR中命名实体修正,通过自适应思维链和音节级编辑距离提升纠错效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16198 2026-02-16 cs.CL cs.AI cs.SE 73%

RPG: A Repository Planning Graph for Unified and Scalable Codebase Generation

RPG:一个用于统一和可扩展代码库生成的仓库规划图

Jane Luo, Xin Zhang, Steven Liu, Jie Wu, Jianfeng Liu, Yiming Huang, Yangyu Huang, Chengyu Yin, Ying Xin, Yuefeng Zhan, Hao Sun, Qi Chen, Scarlett Li, Mao Yang

机构 * Microsoft(微软公司) Tsinghua University(清华大学) University of California, San Diego(加州大学圣地亚哥分校) Beijing Jiaotong University(北京交通大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 RPG通过统一的图结构提升代码库生成效率,ZeroRepo在真实项目基准上实现显著更高的代码生成量和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12395 2026-02-16 cs.CV cs.AI 70%

What does RL improve for Visual Reasoning? A Frankenstein-Style Analysis

强化学习在视觉推理中提升了什么?一种弗兰肯斯坦式分析

Xirui Li, Ming Li, Tianyi Zhou

机构 * University of Maryland(马里兰大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 推理与问题求解 :language model(abstract);post-training(abstract);分类 cs.AI

AI总结 本文通过弗兰肯斯坦式分析框架,揭示强化学习在视觉推理中通过中到晚期变压器计算的系统性细化,改进了视觉到推理的对齐和推理性能,而非单纯的视觉感知增强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14746 2026-02-16 cs.LG 57%

MissionHD: Hyperdimensional Refinement of Distribution-Deficient Reasoning Graphs for Video Anomaly Detection

MissionHD: 分布匮乏的推理图超维度细化用于视频异常检测

Sanggeon Yun, Raheeb Hassan, Ryozo Masukawa, Nathaniel D. Bastian, Mohsen Imani

机构 * Department of Computer Science University of California, Irvine(计算机科学系加州大学伊维奇分校) Department of Electrical Engineering & Computer Science United States Military Academy, West Point(电气工程与计算机科学系美国军事学院西点分校)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.LG

AI总结 MissionHD通过超维度计算优化任务对齐的图表示,提升视频异常检测与识别的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12665 2026-02-16 cs.AI 57%

Evaluating Robustness of Reasoning Models on Parameterized Logical Problems

评估参数化逻辑问题上推理模型的鲁棒性

Naïm Es-sebbani, Esteban Marquer, Yakoub Salhi, Zied Bouraoui

机构 * CRIL UMR 8188, Univ Artois, CNRS, France(CRIL UMR 8188,阿维尼翁大学,法国国家科学研究中心)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 本文提出了一种针对2-SAT的诊断基准,用于评估推理模型在参数化逻辑问题上的鲁棒性,通过隔离不同能力与失败模式,揭示模型在结构干预下的性能变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12322 2026-02-16 cs.RO cs.AI 57%

ForeAct: Steering Your VLA with Efficient Visual Foresight Planning

ForeAct: 通过高效的视觉前瞻性规划控制您的VLA

Zhuoyang Zhang, Shang Yang, Qinghao Hu, Luke J. Huang, James Hou, Yufei Sun, Yao Lu, Song Han

机构 * MIT(麻省理工学院) NVIDIA(英伟达) Caltech(加州理工学院)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 ForeAct通过高效的视觉前瞻性规划提升VLA在开放环境中的执行精度与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13134 2026-02-16 cs.IR 50%

Awakening Dormant Users: Generative Recommendation with Counterfactual Functional Role Reasoning

唤醒沉睡用户:基于反事实功能角色推理的生成推荐

Huishi Luo, Shuokai Li, Hanchen Yang, Zhongbo Sun, Haojie Ding, Boheng Zhang, Zijia Cai, Renliang Qian, Fan Yang, Tingting Gao, Chenyi Lei, Wenwu Ou, Fuzhen Zhuang

专题命中 推理与问题求解 :LLM(abstract)

AI总结 RoleGen通过反事实功能角色推理和生成行为骨干,有效提升沉睡用户转化率,实现Recall@1和订单量的显著增长。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14978 2026-02-16 cs.RO 50%

PA-MPPI: Perception-Aware Model Predictive Path Integral Control for Quadrotor Navigation in Unknown Environments

PA-MPPI:感知-aware的模型预测路径积分控制用于未知环境中的四旋翼导航

Yifan Zhai, Rudolf Reiter, Davide Scaramuzza

机构 * University of Zurich(苏黎世大学)

专题命中 推理与问题求解 :foundation model(abstract)

AI总结 PA-MPPI通过结合感知信息,提升了四旋翼在未知环境中的导航能力,能够有效探索未知区域并规划替代路径。

Journal ref IEEE Robotics and Automation Letters (RA-L), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08440 2026-02-16 cs.RO 50%

SteerVLA: Steering Vision-Language-Action Models in Long-Tail Driving Scenarios

SteerVLA:在长尾驾驶场景中引导视觉-语言-动作模型

Tian Gao, Celine Tan, Catherine Glossop, Timothy Gao, Jiankai Sun, Kyle Stachowicz, Shirley Wu, Oier Mees, Dorsa Sadigh, Sergey Levine, Chelsea Finn

机构 * Stanford University(斯坦福大学) University of California, Berkeley(加州大学伯克利分校) Microsoft(微软公司)

专题命中 推理与问题求解 :language model(abstract)

AI总结 SteerVLA通过结合视觉-语言模型的推理能力,生成细粒度语言指令以提升驾驶策略的稳健性和长尾场景下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16925 2026-02-16 cs.IR 50%

Towards Context-aware Reasoning-enhanced Generative Searching in E-commerce

面向情境感知的推理增强生成搜索

Zhiding Liu, Ben Chen, Mingyue Cheng, Enhong Chen, Li Li, Chenyi Lei, Wenwu Ou, Han Li, Kun Gai

专题命中 推理与问题求解 :post-training(abstract)

AI总结 本文提出了一种面向情境感知的推理增强生成搜索框架,通过整合上下文信息和改进推理能力,提升电子商务搜索推荐的性能。

Comments Accepted by WWW'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14058 2026-02-16 cs.RO cs.CV 50%

What Matters in Building Vision-Language-Action Models for Generalist Robots

在通用机器人中构建视觉-语言-动作模型所关注的关键因素

Xinghang Li, Peiyan Li, Long Qian, Minghuan Liu, Dong Wang, Jirong Liu, Bingyi Kang, Xiao Ma, Xinlong Wang, Di Guo, Tao Kong, Hanbo Zhang, Huaping Liu

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) ByteDance Research(字节跳动研究院) CASIA MAIS-NLPR Shanghai Jiao Tong University(上海交通大学) National University of Singapore(新加坡国立大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 推理与问题求解 :language model(abstract)

AI总结 本研究揭示了构建通用机器人视觉-语言-动作模型的关键因素,开发了无需大量手动设计的RoboVLMs,实现了模拟和现实任务中的新状态-of-the-art性能。

Comments Project page: robovlms.github.io. Added limitations and future works. Fix categorization

详情

展开后加载摘要…

URL PDF HTML 收藏