arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-01 至 2026-01-01 共收录 27 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 27 篇

2508.00743 2026-01-01 cs.CL cs.AI cs.LG 90%

Multi-step retrieval and reasoning improves radiology question answering with large language models

多步检索与推理提升大型语言模型在放射学问答中的表现

Sebastian Wind, Jeta Sopa, Daniel Truhn, Mahshad Lotfinia, Tri-Thien Nguyen, Keno Bressem, Lisa Adams, Mirabela Rusu, Harald Köstler, Gerhard Wellein, Andreas Maier, Soroosh Tayebi Arasteh

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 RaR通过多步检索与推理提升放射学问答中大型语言模型的诊断准确性和事实一致性。

Comments Published in npj Digital Medicine

Journal ref npj Digit. Med. 8, 790 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24661 2026-01-01 cs.CL cs.AI 90%

Do Large Language Models Know What They Are Capable Of?

大语言模型是否了解自己的能力?

Casey O. Barkan, Sid Black, Oliver Sourbut

机构 * RAND Corporation(RAND公司) UK AI Security Institute(英国人工智能安全研究所) The Future of Life Foundation(未来生命基金会)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 研究发现大语言模型在预测自身能力时存在过度自信,且随着任务推进可能恶化,但通过失败经验可部分缓解,揭示了其能力认知不足的问题。

Comments 23 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24014 2026-01-01 cs.CL cs.AI 90%

iCLP: Large Language Model Reasoning with Implicit Cognition Latent Planning

iCLP: 基于隐式认知潜在规划的大语言模型推理

Sijia Chen, Di Niu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Alberta(阿尔伯塔大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 iCLP通过隐式认知潜在规划提升大语言模型的推理准确性和效率,实现跨领域泛化与可解释性。

Comments 9 pages, 6 figures. The source code is publicly available at https://github.com/AgenticFinLab/latent-planning

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23932 2026-01-01 cs.AI 89%

A Proof-of-Concept for Explainable Disease Diagnosis Using Large Language Models and Answer Set Programming

可解释疾病诊断的大型语言模型与答案集编程证明概念

Ioanna Gemou, Evangelos Lamprou

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本研究提出McCoy框架,结合大型语言模型与答案集编程,实现可解释的疾病诊断,初步结果显示其在小规模诊断任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22942 2026-01-01 cs.RO cs.AI 89%

AINav: Large Language Model-Based Adaptive Interactive Navigation

AINav: 基于大语言模型的自适应交互导航

Kangjie Zhou, Yao Mu, Haoyang Song, Yi Zeng, Pengying Wu, Han Gao, Chang Liu

机构 * School of Advanced Manufacturing and Robotics, Peking University(北京大学先进制造与机器人学院) AI Institute, School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机学院人工智能研究所)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 AINav通过基于大语言模型的自适应交互导航方法,实现复杂环境中的路径规划与目标达成。

Comments 13 pages, 12 figures, accepted to IEEE Robotics & Automation Magazine

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01930 2026-01-01 cs.RO 89%

Large Language Model-Driven Closed-Loop UAV Operation with Semantic Observations

基于大语言模型的闭环无人机操作与语义观测

Wenhao Wang, Yanyan Li, Long Jiao, Jiawei Yuan

机构 * Department of CIS, University of Massachusetts Dartmouth(CIS系,马萨诸塞大学达特茅斯分校) Department of CSIS, California State University San Marcos(CSIS系,加州州立大学桑马科斯分校)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出基于大语言模型的闭环无人机操作框架,通过代码生成器和评估器实现可靠操作,提升复杂任务的成功率和完整性。

Comments 13 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24063 2026-01-01 cs.LG 87%

How and Why LLMs Generalize: A Fine-Grained Analysis of LLM Reasoning from Cognitive Behaviors to Low-Level Patterns

LLMs如何泛化:从认知行为到低级模式的细粒度分析

Haoyue Bai, Yiyou Sun, Wenjie Hu, Shi Qiu, Maggie Ziyu Huan, Peiyang Song, Robert Nowak, Dawn Song

机构 * University of Wisconsin, Madison(威斯康星大学麦迪逊分校) University of California, Berkeley(加州大学伯克利分校) University of Pennsylvania(宾夕法尼亚大学) California Institute of Technology(加州理工学院)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文通过细粒度分析揭示LLMs在SFT和RL微调下的泛化差异,提出基于核心技能的基准测试,揭示RL模型在推理稳定性上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24686 2026-01-01 cs.AI cs.SY eess.SY 85%

BatteryAgent: Synergizing Physics-Informed Interpretation with LLM Reasoning for Intelligent Battery Fault Diagnosis

BatteryAgent: 将物理信息解释与LLM推理相结合用于智能电池故障诊断

Songqi Zhou, Ruixue Liu, Boman Su, Jiazhou Wang, Yixing Wang, Benben Jiang

机构 * Department of Automation Tsinghua University Beijing, China(自动化系 清华大学 北京)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 BatteryAgent结合物理知识与LLM推理,实现智能电池故障诊断的可解释性与高准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23738 2026-01-01 cs.PL cs.AI cs.FL cs.LO 83%

Enforcing Temporal Constraints for LLM Agents

为LLM代理强制执行时间约束

Adharsh Kamath, Sishen Zhang, Calvin Xu, Shubham Ugare, Gagandeep Singh, Sasa Misailovic

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Illinois at Urbana-Champaign, USA(伊利诺伊大学厄巴纳-香槟分校,美国) Meta

专题命中 推理与问题求解 :LLM(title,abstract);language model(abstract);分类 cs.AI

AI总结 Agent-C通过运行时保证确保LLM代理遵守时间安全属性,提高任务实用性并实现完美安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06337 2026-01-01 cs.AI 81%

DaGRPO: Rectifying Gradient Conflict in Reasoning via Distinctiveness-Aware Group Relative Policy Optimization

DaGRPO:通过意识性群相对策略优化纠正推理中的梯度冲突

Xuan Xie, Xuan Wang, Wenjie Wang, Shuai Chen, Wei Lin

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);post-training(abstract);SFT(abstract)

AI总结 DaGRPO通过意识性群相对策略优化纠正推理中的梯度冲突,提升推理能力和样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24103 2026-01-01 cs.LG cs.AI 81%

Enhancing LLM Planning Capabilities through Intrinsic Self-Critique

通过内在自我批评增强大语言模型的规划能力

Bernd Bohnet, Pierre-Alexandre Kamienny, Hanie Sedghi, Dilan Gorur, Pranjal Awasthi, Aaron Parisi, Kevin Swersky, Rosanne Liu, Azade Nova, Noah Fiedel

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 通过内在自我批评方法提升大语言模型的规划能力,实现Blocksworld、Logistics和Mini-grid数据集上的性能改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.15834 2026-01-01 cs.DC cs.AI cs.CR cs.LG 81%

FEDSTR: Money-In AI-Out | A Decentralized Marketplace for Federated Learning and LLM Training on the NOSTR Protocol

FEDSTR: 人工智能无钱 | 基于NOSTR协议的去中心化市场

Konstantinos E. Nikolakakis, George Chantzialexiou, Dionysis Kalogerias

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 FEDSTR提出基于NOSTR协议的去中心化市场,允许用户通过数据集训练AI模型并支付费用获取优化模型,旨在实现公平且开放的AI训练市场。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.25014 2026-01-01 cs.LG cs.CC 79%

Diffusion Language Models are Provably Optimal Parallel Samplers

扩散语言模型是可证明最优的并行采样器

Haozhe Jiang, Nika Haghtalab, Lijie Chen

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.LG

AI总结 本文证明了通过链式思维和修订,扩散语言模型能够以最优步骤和空间复杂度模拟并行采样算法,从而提升其作为高效并行采样器的理论基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24702 2026-01-01 cs.CV cs.AI 79%

Evolving, Not Training: Zero-Shot Reasoning Segmentation via Evolutionary Prompting

进化,而非训练:通过进化提示实现零样本推理分割

Kai Ye, Xiaotong You, Jianghang Lin, Jiayi Ji, Pingyang Dai, Liujuan Cao

专题命中 推理与问题求解 :prompting(title);SFT(abstract);分类 cs.AI

AI总结 本文提出EVOL-SAM3,通过进化提示方法实现零样本推理分割,克服传统方法的局限性,提升分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24505 2026-01-01 cs.AI 77%

Evaluating the Reasoning Abilities of LLMs on Underrepresented Mathematics Competition Problems

评估大语言模型在不常见数学竞赛问题上的推理能力

Samuel Golladay, Majid Bani-Yaghoub

机构 * University of Missouri: Kansas City(密苏里大学:堪萨斯城)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究评估了三种LLM在不常见数学竞赛问题上的推理能力,发现DeepSeek-V3在微积分、解析几何和离散数学中表现最佳,但所有模型在几何学上均表现较弱。

Comments 7 pages, submitted to ACM Transactions on Intelligent Systems and Technology

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24040 2026-01-01 cs.AI 77%

ROAD: Reflective Optimization via Automated Debugging for Zero-Shot Agent Alignment

ROAD: 通过自动调试实现零样本智能体对齐的反思优化

Natchaya Temyingyong, Daman Jain, Neeraj Kumarsahu, Prabhat Kumar, Rachata Phondi, Wachiravit Modecrua, Krittanon Kaewtawee, Krittin Pachtrachai, Touchapon Kraisingkorn

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ROAD通过自动调试实现零样本智能体对齐的反思优化,利用多智能体架构将无结构故障日志转化为结构化决策树协议,提升智能体性能和样本效率。

Comments 22 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00742 2026-01-01 cs.CV cs.AI eess.IV 77%

Zoomer: Adaptive Image Focus Optimization for Black-box MLLM

Zoomer: 为黑盒大语言模型实现自适应图像聚焦优化

Jiaxu Qian, Chendong Wang, Yifan Yang, Chaoyun Zhang, Huiqiang Jiang, Xufang Luo, Yu Kang, Qingwei Lin, Anlan Zhang, Shiqi Jiang, Ting Cao, Tianjun Mao, Suman Banerjee, Guyue Liu, Saravan Rajmohan, Dongmei Zhang, Yuqing Yang, Qi Zhang, Lili Qiu

机构 * Microsoft(微软公司) Peking University(北京大学) University of Wisconsin Madison(威斯康星大学麦迪逊分校) University of Southern California(南加州大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 Zoomer通过自适应图像聚焦优化提升黑盒MLLM的多模态理解能力,显著提升准确性并减少token使用

Comments TMLR accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24940 2026-01-01 cs.AI cs.CL cs.LG 75%

Iterative Deployment Improves Planning Skills in LLMs

迭代部署提升大语言模型的规划能力

Augusto B. Corrêa, Yoav Gelberg, Luckeciano C. Melo, Ilia Shumailov, André G. Pereira, Yarin Gal

机构 * University of Oxford(牛津大学) AI Sequrity Company(AI安全公司) UFRGS(乌拉圭联邦大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过迭代部署大语言模型,利用用户编纂的数据提升规划能力,展现隐含奖励函数的强化学习机制,具有AI安全和训练制度替代的双重意义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23988 2026-01-01 cs.CL cs.AI cs.LG 75%

Fantastic Reasoning Behaviors and Where to Find Them: Unsupervised Discovery of the Reasoning Process

非凡的推理行为及其发现位置:无监督发现推理过程

Zhenyu Zhang, Shujian Zhang, John Lambert, Wenxuan Zhou, Zhangyang Wang, Mingqing Chen, Andrew Hard, Rajiv Mathews, Lun Wang

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Google DeepMind(谷歌DeepMind)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出无监督框架RISE,通过稀疏自编码器发现LLM推理行为,揭示可解释的推理特征并控制推理轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24532 2026-01-01 cs.AI cs.CL 73%

From Building Blocks to Planning: Multi-Step Spatial Reasoning in LLMs with Reinforcement Learning

从积木到规划:通过强化学习在LLMs中实现多步骤空间推理

Amir Tahmasbi, Sadegh Majidi, Kazem Taram, Aniket Bera

机构 * Department of Computer Science(计算机科学系)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种两阶段方法,通过强化学习在LLMs中实现多步骤空间推理,通过微调和LoRA适配器提升模型在结构环境中的空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24613 2026-01-01 cs.AI 70%

Group Deliberation Oriented Multi-Agent Conversational Model for Complex Reasoning

面向复杂推理的群体讨论导向多智能体对话模型

Zheyu Shi, Dong Qiu, Shanlong Yu

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种群体讨论导向的多智能体对话模型,通过三级角色架构和改进的优化策略,提升复杂推理任务的准确性和一致性。

Comments Accepted by IEEE ITCA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22998 2026-01-01 cs.AI 70%

TIM-PRM: Verifying multimodal reasoning with Tool-Integrated PRM

TIM-PRM:利用工具集成PRM验证多模态推理

Peng Kuang, Xiangxiang Wang, Wentao Liu, Jian Dong, Kaidi Xu

机构 * Zhejiang University(浙江大学) iFLYTEK AI Research Institute(iFLYTEK人工智能研究院) City University of Hong Kong(香港城市大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 TIM-PRM通过工具集成PRM验证多模态推理,有效解决视觉幻觉和逻辑不一致问题,实验表明其在性能和可解释性上优于现有模型。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24165 2026-01-01 cs.CV 67%

DiffThinker: Towards Generative Multimodal Reasoning with Diffusion Models

DiffThinker: 向基于扩散模型的生成多模态推理迈进

Zefeng He, Xiaoye Qu, Yafu Li, Tong Zhu, Siyuan Huang, Yu Cheng

机构 * Shanghai AI Laboratory(上海人工智能实验室) Nanjing University(南京大学) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 DiffThinker通过基于扩散模型的生成方法,在多模态推理任务中实现了更高效的视觉推理和更精确的空间处理,显著优于现有模型。

Comments Project page: https://diffthinker-project.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24156 2026-01-01 cs.AI 57%

Graph-Based Exploration for ARC-AGI-3 Interactive Reasoning Tasks

基于图的探索用于ARC-AGI-3交互推理任务

Evgenii Rudakov, Jonathan Shock, Benjamin Ultan Cowley

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 基于图的探索方法在ARC-AGI-3任务中实现高效交互推理,无需训练即可解决大量级别,优于LLM方法。

Journal ref AAAI 2026 Workshop on AI for Scientific Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21614 2026-01-01 cs.CL 57%

A Survey of Efficient Reasoning for Large Reasoning Models: Language, Multimodality, and Beyond

大推理模型高效推理的综述:语言、多模态与更远的探索

Xiaoye Qu, Yafu Li, Zhao-Chen Su, Weigao Sun, Jianhao Yan, Dongrui Liu, Ganqu Cui, Daizong Liu, Shuxian Liang, Junxian He, Peng Li, Wei Wei, Jing Shao, Chaochao Lu, Yue Zhang, Xian-Sheng Hua, Bowen Zhou, Yu Cheng

机构 * Shanghai AI Laboratory(上海人工智能实验室) Soochow University(苏州大学) Westlake University(西湖大学) Peking University(北京大学) Tongji University(同济大学) The Hong Kong University of Science and Technology(香港科技大学) Tsinghua University(清华大学) Huazhong University of Science and Technology(华中科技大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 推理与问题求解 :pretraining(abstract);分类 cs.CL

AI总结 本文综述了大推理模型在提升推理效率方面的最新研究,聚焦于语言、多模态及未来方向,旨在推动该领域的发展。

Comments Update recent RL papers. Project page: https://github.com/XiaoYee/Awesome_Efficient_LRM_Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.01424 2026-01-01 cs.CL 57%

CascadeNS: Confidence-Cascaded Neurosymbolic Model for Sarcasm Detection

CascadeNS: 一种基于置信度的神经符号模型用于讽刺检测

Swapnil Mane, Vaibhav Khatavkar

机构 * IIT Jodhpur, India(印度拉贾斯坦理工学院) DES Pune University, Pune, India(印度德化大学) COEP Technological University, Pune, India(印度科帕尔技术大学)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.CL

AI总结 CascadeNS通过结合符号推理和神经推理,利用置信度校准实现更高效的讽刺检测,实验表明其性能优于现有基线方法。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23875 2026-01-01 cs.SE 50%

From Illusion to Insight: Change-Aware File-Level Software Defect Prediction Using Agentic AI

从幻觉到洞察:利用代理AI的变更感知文件级软件缺陷预测

Mohsen Hesamolhokama, Behnam Rohani, Amirahmad Shafiee, MohammadAmin Fazli, Jafar Habibi

专题命中 推理与问题求解 :LLM(abstract)

AI总结 本文提出了一种基于代理AI的变更感知文件级软件缺陷预测方法,通过多代理辩论框架提升缺陷预测的准确性和敏感性。

详情

展开后加载摘要…

URL PDF HTML 收藏