arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-11 至 2026-02-11 共收录 34 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 34 篇

2602.09637 2026-02-11 cs.CV cs.MM 90%

Towards Training-free Multimodal Hate Localisation with Large Language Models

无需训练的多模态仇恨定位与大型语言模型

Yueming Sun, Long Yang, Jianbo Jiao, Zeyu Fu

机构 * Hybrid Intelligence Lab, University of Durham(杜伦大学混合智能实验室) Multimodal Intelligence Lab, University of Exeter(埃克塞特大学多模态智能实验室) The MIx Group University of Birmingham(伯明翰大学MIx集团)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 提出无需训练的多模态仇恨视频定位框架LELA,通过多阶段提示方案和跨模态推理机制实现高精度定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09517 2026-02-11 cs.CL 88%

Knowledge Integration Decay in Search-Augmented Reasoning of Large Language Models

在大语言模型的搜索增强推理中知识整合衰减

Sangwon Yu, Ik-hwan Kim, Donghun Kang, Bongkyu Hwang, Junhwa Choi, Suk-hoon Jung, Seungki Hong, Taehee Lee, Sungroh Yoon

机构 * Department of Electrical and Computer Engineering, Seoul National University, Seoul, Korea(电气与计算机工程系,首尔国立大学,韩国首尔) Interdisciplinary Program in Artificial Intelligence, Seoul National University, Seoul, Korea(人工智能交叉学科项目,首尔国立大学,韩国首尔)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本研究提出SAKE方法,通过在推理过程前后锚定检索知识,缓解大语言模型在搜索增强推理中的知识整合衰减问题,提升多跳问答和复杂推理任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15214 2026-02-11 cs.CL 88%

Self-Guided Function Calling in Large Language Models via Stepwise Experience Recall

通过逐步经验回忆实现大语言模型的自引导函数调用

Sijia Cui, Aiyao He, Shuai Xu, Hongming Zhang, Yanna Wang, Qingyang Zhang, Yajing Wang, Bo Xu

机构 * The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(认知与决策智能复杂系统重点实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学) Nanjing University of Information Science & Technology(南京信息工程大学) Institute of Computing Technology, Chinese Academy of Sciences(计算技术研究所,中国科学院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 SEER通过逐步经验回忆方法,提升大语言模型在多步骤工具使用中的准确性和效率。

Comments Accepted to EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09638 2026-02-11 cs.CV 88%

VideoAfford: Grounding 3D Affordance from Human-Object-Interaction Videos via Multimodal Large Language Model

VideoAfford: 通过多模态大语言模型实现人类-物体交互视频中的3D affordance grounding

Hanqing Wang, Mingyu Liu, Xiaoyu Chen, Chengwei MA, Yiming Zhong, Wenti Yin, Yuhao Liu, Zhiqing Cui, Jiahao Yuan, Lu Dai, Zhiyuan Ma, Hui Xiong

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 VideoAfford通过多模态大语言模型实现人类-物体交互视频中的3D affordance grounding,结合动态交互先验和空间感知损失函数,提升机器人操作的可操作区域识别能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09341 2026-02-11 cs.AI 87%

Auditing Multi-Agent LLM Reasoning Trees Outperforms Majority Vote and LLM-as-Judge

对多智能体大语言模型推理树进行审计优于多数投票和LLM作为裁判

Wei Yang, Shixuan Li, Heng Ping, Peiyu Zhang, Paul Bogdan, Jesse Thomason

机构 * University of Southern California, Los Angeles, CA, USA(美国南加州大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 通过构建推理树路径搜索机制,AgentAuditor在多智能体系统中实现了优于多数投票和LLM作为裁判的推理准确性提升

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09832 2026-02-11 cs.CL 85%

LLM Reasoning Predicts When Models Are Right: Evidence from Coding Classroom Discourse

大语言模型推理可预测模型何时正确:来自编程课堂对话的证据

Bakhtawar Ahtisham, Kirk Vanacore, Zhuqian Zhou, Jinsook Lee, Rene F. Kizilcec

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究通过分析课堂对话中的教师发言,发现LLM生成的推理能有效预测模型预测的正确性,使用随机森林分类器达到F1得分0.83,表明基于推理的错误检测在教育对话分析中具有实用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09817 2026-02-11 cs.CL cs.DL 85%

AnalyticsGPT: An LLM Workflow for Scientometric Question Answering

AnalyticsGPT: 一个基于大语言模型的科学度量问答工作流

Khang Ly, Georgios Cheirmpos, Adrian Raudaschl, Christopher James, Seyed Amin Tabatabaei

机构 * Elsevier B.V.(埃塞尔弗斯有限公司)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 AnalyticsGPT通过LLM实现科学度量问答,结合检索增强生成和代理概念,提升科学数据分析效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08658 2026-02-11 cs.CL 85%

Fundamental Reasoning Paradigms Induce Out-of-Domain Generalization in Language Models

基本推理范式诱导语言模型的领域外泛化

Mingzi Cao, Xingwei Tan, Mahmud Elahi Akhter, Marco Valentino, Maria Liakata, Xi Wang, Nikolaos Aletras

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL

AI总结 本研究通过诱导基本推理范式提升语言模型的领域外泛化能力,实验表明方法在现实任务中性能提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02424 2026-02-11 cs.AI 85%

ReAcTree: Hierarchical LLM Agent Trees with Control Flow for Long-Horizon Task Planning

ReAcTree:具有控制流的分层LLM代理树用于长时间任务规划

Jae-Woo Choi, Hyungmin Kim, Hyobin Ong, Youngwoo Yoon, Minsu Jang, Dohyung Kim, Jaehong Kim

机构 * ETRI & UST(ETRI与UST) UST

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ReAcTree通过分层代理树和控制流实现复杂任务规划,显著提升长周期任务的完成效率和成功率。

Comments Accepted as a Full Paper at AAMAS 2026. This is the extended version including full appendices. Code is available at https://github.com/Choi-JaeWoo/ReAcTree.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11362 2026-02-11 cs.LG cs.CV 85%

PersonaX: Multimodal Datasets with LLM-Inferred Behavior Traits

PersonaX: 多模态数据集与LLM推断行为特征

Loka Li, Wong Yu Kang, Minghao Fu, Guangyi Chen, Zhenhao Chen, Gongxu Luo, Yuewen Sun, Salman Khan, Peter Spirtes, Kun Zhang

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) Carnegie Mellon University(卡内基梅隆大学) University of California San Diego(加州大学圣地亚哥分校) Australian National University(澳大利亚国立大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 PersonaX通过多模态数据集结合LLM推断行为特征,推动多模态特征分析与因果推理发展。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21540 2026-02-11 cs.AI 85%

HealthProcessAI: A Technical Framework and Proof-of-Concept for LLM-Enhanced Healthcare Process Mining

HealthProcessAI: 一种基于大语言模型的医疗流程挖掘技术框架及证明概念

Eduardo Illueca-Fernandez, Kaile Chen, Fernando Seoane, Farhad Abtahi

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 HealthProcessAI通过整合大语言模型实现医疗流程挖掘的自动化解释和报告生成,提升其在医疗和流行病学中的可访问性和实用性。

Comments Figure 1 updated, typos corrected, references added, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10936 2026-02-11 cs.CL 85%

Cochain: Balancing Insufficient and Excessive Collaboration in LLM Agent Workflows

Cochain: 在LLM代理工作流中平衡不足与过度的合作

Jiaxing Zhao, Hongbin Xie, Yuzhen Lei, Xuan Song, Zhuoran Shi, Lianxin Li, Shuangxue Liu, Linguo Xie, Haoran Zhang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Department of Computer Science and Engineering, Southern University of Science and Technology(南方科技大学计算机科学与工程系) School of Urban Planning and Design, Peking University(北京大学城市规划与设计学院)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 Cochain通过整合知识图谱和提示树,有效解决业务工作流中LLM代理合作问题,优于基线模型。

Comments 35 pages, 23 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09384 2026-02-11 cs.CL cs.AI 85%

Contractual Deepfakes: Can Large Language Models Generate Contracts?

合同型深度伪造:大语言模型能生成合同吗?

Eliza Mik

专题命中 推理与问题求解 :large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 本文指出大语言模型生成的合同可能不具法律效力,质疑其在法律领域应用的可行性。

Comments Accepted for publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09173 2026-02-11 cs.LG cs.AI 84%

$n$-Musketeers: Reinforcement Learning Shapes Collaboration Among Language Models

$n$-Musketeers: 通过强化学习塑造语言模型间的协作

Ryozo Masukawa, Sanggeon Yun, Hyunwoo Oh, SuhgHeon Jeong, Raheeb Hassa, Hanning Chen, Wenjun Huang, Mahdi Imani, Pietro Mercati, Nathaniel D. Bastian, Mohsen Imani

专题命中 推理与问题求解 :language model(title,abstract);SLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出软隐藏状态协作方法,通过可训练的注意力接口整合多个冻结的SLM专家,实验证明其在推理任务中与强基线竞争,并揭示了专家利用的双机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25666 2026-02-11 cs.LG cs.CL 81%

Nudging the Boundaries of LLM Reasoning

推动大语言模型推理边界的 nudging

Justin Chih-Yao Chen, Becky Xiangyu Peng, Prafulla Kumar Choubey, Kung-Hsiang Huang, Jiaxin Zhang, Mohit Bansal, Chien-Sheng Wu

机构 * Salesforce AI Research(Salesforce AI研究)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.CL、cs.LG

AI总结 NuRL通过自动生成提示提升大语言模型推理上限,解决传统RL无法学习无法解决样本的问题。

Comments ICLR 2026 (Camera-Ready)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09598 2026-02-11 cs.CL 79%

Learning from the Irrecoverable: Error-Localized Policy Optimization for Tool-Integrated LLM Reasoning

从不可恢复中学习:用于工具集成大语言模型推理的误差局部化策略优化

Qiao Liang, Yuke Zhu, Chao Ge, Lei Yang, Ying Shen, Bo Zheng, Sheng Guo

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.CL

AI总结 ELPO通过误差局部化策略优化提升工具集成大语言模型推理的性能,有效解决稀疏奖励和信用分配问题。

Comments 20 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09501 2026-02-11 cs.CL 79%

Where-to-Unmask: Ground-Truth-Guided Unmasking Order Learning for Masked Diffusion Language Models

Where-to-Unmask: 基于真实情况引导的去掩码顺序学习用于掩码扩散语言模型

Hikaru Asano, Tadashi Kozuno, Kuniaki Saito, Yukino Baba

机构 * The University of Tokyo, Tokyo, Japan(东京大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL

AI总结 本文提出Gt-Margin方法,通过真实标记计算去掩码顺序,提升MDLM在逻辑推理任务中的生成质量。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09442 2026-02-11 cs.CL cs.AI 79%

Evaluating Social Bias in RAG Systems: When External Context Helps and Reasoning Hurts

评估RAG系统中的社会偏见:当外部上下文有助于而推理有害

Shweta Parihar, Lu Cheng

机构 * University of Illinois at Chicago(伊利诺伊大学芝加哥分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本研究评估RAG系统中的社会偏见,发现外部上下文可减少偏见,但链式思维提示反而增加偏见,凸显了需要偏见意识推理框架的重要性。

Comments Accepted as a full paper with an oral presentation at the 30th Pacific-Asia Conference on Knowledge Discovery and Data Mining (PAKDD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24592 2026-02-11 cs.CL 77%

ReForm: Reflective Autoformalization with Prospective Bounded Sequence Optimization

ReForm:具有前瞻性有界序列优化的反思自动形式化

Guoxin Chen, Jing Wu, Xinjie Chen, Wayne Xin Zhao, Ruihua Song, Chengxi Li, Kai Fan, Dayiheng Liu, Minpeng Liao

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室) Zhejiang University(浙江大学) Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大模型与智能治理重点实验室)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 ReForm通过整合语义一致性评估和前瞻性有界序列优化,提升自动形式化任务的准确性和语义保真度,实验表明其在四个基准上的性能提升了22.6个百分点。

Comments Camera Ready version for ICLR 2026. Code: https://github.com/Chen-GX/ReForm

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06544 2026-02-11 cs.IR 75%

Reason to Retrieve: Enhancing Query Understanding through Decomposition and Interpretation

为检索而思考:通过分解与解释增强查询理解

Yunfei Zhong, Jun Yang, Yixing Fan, Lixin Su, Maarten de Rijke, Ruqing Zhang, Xueqi Cheng

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 ReDI通过分解与解释增强查询理解,有效提升长形式复杂查询的检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14406 2026-02-11 cs.AI cs.CL 73%

IMAGINE: Integrating Multi-Agent System into One Model for Complex Reasoning and Planning

IMAGINE:将多智能体系统整合到一个模型中以实现复杂推理和规划

Xikai Zhang, Bo Wang, Likang Xiao, Yongzhi Li, Quan Chen, Wenjun Wu, Liu Liu

机构 * Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院) School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) Kuaishou Technology(快手科技)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 IMAGINE通过整合多智能体系统的推理与规划能力,实现高效复杂推理和规划,实验显示其在TravelPlanner任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13761 2026-02-11 cs.AI cs.CL 73%

THOR: Tool-Integrated Hierarchical Optimization via RL for Mathematical Reasoning

THOR:通过强化学习进行工具集成的分层优化以实现数学推理

Qikai Chang, Zhenrong Zhang, Pengfei Hu, Jun Du, Jiefeng Ma, Yicheng Pan, Jianshu Zhang, Quan Liu, Jianqing Gao

机构 * University of Science and Technology of China(中国科学技术大学) iFLYTEK Research(iFLYTEK研究院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 THOR通过强化学习实现工具集成的分层优化,提升数学推理和代码生成能力。

Comments 22 pages, 13 figures, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10092 2026-02-11 cs.CL 70%

Quantum-Audit: Evaluating the Reasoning Limits of LLMs on Quantum Computing

量子审计:评估大语言模型在量子计算上的推理极限

Mohamed Afane, Kayla Laufer, Wenqi Wei, Ying Mao, Junaid Farooq, Ying Wang, Juntao Chen

机构 * Fordham University(福特汉姆大学) University of Michigan-Dearborn(密歇根大学-迪尔本分校) Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 推理与问题求解 :LLM(abstract);language model(abstract);分类 cs.CL

AI总结 Quantum-Audit通过2700个问题评估大语言模型在量子计算概念理解上的推理能力,发现顶级模型在专家问题上表现不如LLM生成问题,且在高级主题上准确率显著下降。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09438 2026-02-11 cs.CL 70%

Breaking the Pre-Sampling Barrier: Activation-Informed Difficulty-Aware Self-Consistency

突破预采样障碍:基于激活的难度感知自一致性

Taewoong Yoon, Geunyeong Jeong, Geon Park, Sihyeong Yeom, Harksoo Kim

机构 * Konkuk University(韩国康克大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 ACTSC通过利用神经元激活信号构建轻量级难度估计探针,无需额外调用或预采样,有效降低推理成本并保持准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10192 2026-02-11 cs.CL cs.DB 70%

Text2SQL-Flow: A Robust SQL-Aware Data Augmentation Framework for Text-to-SQL

Text2SQL-Flow:一种鲁棒的SQL感知数据增强框架用于文本到SQL

Qifeng Cai, Hao Liang, Chang Xu, Tao Xie, Wentao Zhang, Bin Cui

机构 * Peking University, Beijing, China(北京大学,北京,中国)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 Text2SQL-Flow提出了一种SQL感知的数据增强框架,通过生成高质量的文本到SQL数据集,提升大型语言模型在问题解决和检索任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17653 2026-02-11 cs.AI 70%

GeoGramBench: Benchmarking the Geometric Program Reasoning in Modern LLMs

GeoGramBench: 评估现代大语言模型中的几何程序推理

Shixian Luo, Zezhou Zhu, Yu Yuan, Yuncheng Yang, Lianlei Shan, Yong Wu

机构 * Li Auto Inc.(利亚特公司)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 GeoGramBench通过评估现代大语言模型在几何程序推理中的能力,揭示了其在空间推理任务中的显著不足。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09367 2026-02-11 cs.RO 67%

CAPER: Constrained and Procedural Reasoning for Robotic Scientific Experiments

CAPER:用于机器人科学实验的约束和程序性推理

Jinghan Yang, Jingyi Hou, Xinbo Yu, Wei He, Yifan Wu

机构 * University of Science and Technology Beijing(北京科技大学) Beijing Information Science and Technology University(北京信息科技大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 CAPER通过约束和程序性推理框架提升机器人在科学实验中的可控性、鲁棒性和数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14622 2026-02-11 cs.DB 67%

Beyond Text-to-SQL: Autonomous Research-Driven Database Exploration with DAR

超越文本到SQL:基于DAR的自主研究驱动数据库探索

Ostap Vykhopen, Viktoria Skorik, Maksym Tereshchenko, Veronika Solopova

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 DAR是一种多代理系统,通过自主探索数据完成端到端数据库研究,显著提升分析效率并生成基于证据的洞察。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09902 2026-02-11 cs.GT cs.AI cs.LG 62%

Routing, Cascades, and User Choice for LLMs

路由、级联与用户选择用于大语言模型

Rafid Mahmood

机构 * University of Ottawa(渥太华大学) NVIDIA(NVIDIA公司)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了大语言模型路由策略与用户行为之间的博弈,揭示了提供者与用户在效用和成本排序上的不一致,提出了基于Stackelberg博弈的路由优化方法,并得出了单用户单提供者互动的阈值规则。

Comments 23 pages, accepted in ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09945 2026-02-11 cs.AI 57%

Closing Reasoning Gaps in Clinical Agents with Differential Reasoning Learning

通过差异推理学习关闭临床代理中的推理差距

Jinsong Liu, Yuhang Jiang, Ramayya Krishnan, Rema Padman, Yiye Zhang, Jiang Bian

机构 * Dept. of Population Health Sciences, Weill Cornell Medicine, Cornell University(人口健康科学系,韦尔·科恩医学中心,康奈尔大学)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 DRL通过学习推理差异改进临床代理,提升问答和预测任务的准确性和推理可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏