arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-18 至 2026-02-18 共收录 19 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 19 篇

2602.15725 2026-02-18 cs.AI cs.CL cs.LG 90%

Recursive Concept Evolution for Compositional Reasoning in Large Language Models

递归概念演化用于大语言模型的组合推理

Sarim Chaudhry

机构 * Purdue University(普渡大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 递归概念演化(RCE)通过动态生成低秩概念子空间,使大语言模型在推理过程中能够构建新抽象,从而提升组合推理任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22389 2026-02-18 cs.DL cs.AI 90%

Can Small and Reasoning Large Language Models Score Journal Articles for Research Quality and Do Averaging and Few-shot Help?

小模型和推理大模型能否对期刊文章进行科研质量评分?平均和少样本学习是否有帮助?

Mike Thelwall, Ehsan Mohammadi

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文评估了小模型和推理模型对期刊文章科研质量评分的能力,发现4b以上的小模型在使用评分平均时表现良好,但推理模型无明显优势。

Comments Thelwall, M. & Mohammadi, E. (2026). Can small and reasoning Large Language Models score journal articles for research quality and do averaging and few-shot help? Scientometrics

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13209 2026-02-18 q-fin.GN cs.AI 88%

LemonadeBench: Evaluating the Economic Intuition of Large Language Models in Simple Markets

LemonadeBench:评估大语言模型在简单市场中的经济直觉

Aidan Vyas

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 LemonadeBench通过模拟柠檬摊业务评估大语言模型的经济直觉、长期规划和不确定性下的决策能力,揭示模型在局部优化上的表现与全局优化的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15325 2026-02-18 cs.AI 87%

AgriWorld:A World Tools Protocol Framework for Verifiable Agricultural Reasoning with Code-Executing LLM Agents

AgriWorld:一个用于可验证农业推理的代码执行LLM代理工具协议框架

Zhixing Zhang, Jesen Zhang, Hao Liu, Qinhan Lv, Jing Yang, Kaitong Cai, Keze Wang

机构 * Sun Yat-sen University(中山大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 AgriWorld通过代码执行LLM代理实现农业推理,结合执行-观察-反思循环提升农业数据处理与预测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18579 2026-02-18 cs.LG cs.AI q-bio.QM 86%

DrugReasoner: Interpretable Drug Approval Prediction with a Reasoning-augmented Language Model

DrugReasoner: 基于推理增强的语言模型的可解释药物审批预测

Mohammadreza Ghaffarzadeh-Esfahani, Ali Motahharynia, Nahid Yousefian, Navid Mazrouei, Jafar Ghaisari, Yousof Gheisari

机构 * Regenerative Medicine Research Center, Isfahan University of Medical Sciences(再生医学研究中心,伊斯法罕医科大学) Isfahan University of Medical Sciences(伊斯法罕医科大学) Isfahan Neuroscience Research Center, Isfahan University of Medical Sciences(伊斯法罕神经科学研究中心,伊斯法罕医科大学) Department of Electrical and Computer Engineering, Isfahan University of Technology(电气与计算机工程系,伊斯法罕技术大学)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.AI、cs.LG

AI总结 DrugReasoner通过推理增强的语言模型预测药物审批,实现高精度和可解释性,优于传统方法和最新模型。

Comments 13 pages, 2 figures. Corresponding author: alimotahharynia@gmail.com Kaggle notebook: https://www.kaggle.com/code/mohammadgh009/drugreasoner

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20373 2026-02-18 cs.CL cs.AI cs.LG 86%

NPG-Muse: Scaling Long Chain-of-Thought Reasoning with NP-Hard Graph Problems

NPG-Muse: 通过NP难图问题扩展长链推理

Yuyao Wang, Bowen Liu, Jianheng Tang, Nuo Chen, Yuhan Li, Qifan Zhang, Chenyi Zi, Chen Zhang, Jia Li

机构 * HKUST (GZ)(香港科技大学(广州)) Createlink Technology(创联科技)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 NPG-Muse通过引入NP难图问题作为合成训练语料库,提升大规模语言模型的长链推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03581 2026-02-18 cs.AI 85%

Learning When to Plan: Efficiently Allocating Test-Time Compute for LLM Agents

学习何时计划:高效分配测试时计算用于LLM代理

Davide Paglieri, Bartłomiej Cupiał, Jonathan Cook, Ulyana Piterbarg, Jens Tuyls, Edward Grefenstette, Jakob Nicolaus Foerster, Jack Parker-Holder, Tim Rocktäschel

机构 * University of Warsaw(华沙大学) University of Oxford(牛津大学) New York University(纽约大学) Princeton University(普林斯顿大学) University College London(伦敦大学学院)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种动态规划框架,通过两阶段训练提升LLM在长周期任务中的样本效率和复杂目标达成能力,同时展示人类计划对代理系统性能的增强作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19923 2026-02-18 cs.AI cs.LG 82%

Prover Agent: An Agent-Based Framework for Formal Mathematical Proofs

Prover Agent:一个基于代理的正式数学证明框架

Kaito Baba, Chaoran Liu, Shuhei Kurita, Akiyoshi Sannai

机构 * The University of Tokyo, Tokyo, Japan(东京大学) National Institute of Informatics, Tokyo, Japan(日本信息处理学会) Research and Development Center for Large Language Models, National Institute of Informatics, Tokyo, Japan(大型语言模型研究开发中心) Kyoto University, Kyoto, Japan(京都大学) Shiga University, Shiga, Japan(滋贺大学) RIKEN Center for Advanced General Intelligence for Science Program, Kobe, Japan(理化学研究所高级一般智能科学项目中心) National Institute of Science Technology Policy (NISTEP), Tokyo, Japan(科学与技术政策国立研究所)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 Prover Agent结合大语言模型与Lean,通过生成辅助引理提升形式证明效率,在MiniF2F和PutnamBench上取得新突破。

Comments 49 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06438 2026-02-18 cs.CL cs.AI 82%

Don't Let It Hallucinate: Premise Verification via Retrieval-Augmented Logical Reasoning

不要让它幻觉:通过检索增强的逻辑推理进行前提验证

Yuehan Qin, Shawn Li, Yi Nian, Xinyan Velocity Yu, Yue Zhao, Xuezhe Ma

机构 * University of Southern California(南加州大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出一种基于检索增强的逻辑推理方法,用于在生成前验证用户查询中的前提,从而减少幻觉并提高事实准确性。

Comments TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15237 2026-02-18 cs.HC 82%

Ground-Truth Depth in Vision Language Models: Spatial Context Understanding in Conversational AI for XR-Robotic Support in Emergency First Response

视觉语言模型中的真实深度:用于虚拟现实机器人支持的紧急急救中的空间情境理解

Rodrigo Gutierrez Maquilon, Marita Hueber, Georg Regal, Manfred Tscheligi

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract)

AI总结 本文提出了一种结合深度传感与视觉语言模型的原型,用于增强紧急急救中的空间情境理解,通过深度增强提高准确性和稳定性,同时降低工作量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11733 2026-02-18 cs.CL 79%

Human-like Affective Cognition in Foundation Models

基础模型中的人类样情感认知

Kanishk Gandhi, Zoe Lynch, Jan-Philipp Fränken, Kayla Patterson, Sharon Wambu, Tobias Gerstenberg, Desmond C. Ong, Noah D. Goodman

专题命中 推理与问题求解 :foundation model(title,abstract);分类 cs.CL

AI总结 本文提出了一种评估框架,测试基础模型在情感认知方面的表现,发现模型在某些条件下能超越人类直觉,展现出人类样情感理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05705 2026-02-18 cs.CV cs.AI cs.CL 73%

Long Grounded Thoughts: Synthesizing Visual Problems and Reasoning Chains at Scale

长 grounded 思考:大规模合成视觉问题和推理链

David Acuna, Chao-Han Huck Yang, Yuntian Deng, Jaehun Jung, Ximing Lu, Prithviraj Ammanabrolu, Hyunwoo Kim, Yuan-Hong Liao, Yejin Choi

机构 * nvidia(NVIDIA公司) uoft(多伦多大学) uwaterloo(滑铁卢大学)

专题命中 推理与问题求解 :post-training(abstract);SFT(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种大规模合成视觉问题和推理链的框架,通过生成高质量数据集提升多模态推理性能,验证了其在视觉、文本和音频任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17812 2026-02-18 cs.CL cs.LG 73%

Can Multimodal LLMs Perform Time Series Anomaly Detection?

多模态大语言模型能否进行时间序列异常检测?

Xiongxiao Xu, Haoran Wang, Yueqing Liang, Philip S. Yu, Yue Zhao, Kai Shu

机构 * Illinois Institute of Technology(伊利诺伊理工学院) Emory University(埃默里大学) University of Illinois Chicago(伊利诺伊大学香槟分校) University of Southern California(南加州大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出基于多代理框架的TSAD-Agents,利用多模态大语言模型实现自动时间序列异常检测。

Comments ACM Web Conference 2026 (WWW'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15460 2026-02-18 cs.LG cs.CV 70%

On the Out-of-Distribution Generalization of Reasoning in Multimodal LLMs for Simple Visual Planning Tasks

在简单视觉规划任务中多模态大语言模型推理的分布外泛化

Yannic Neuhaus, Nicolas Flammarion, Matthias Hein, Francesco Croce

机构 * Tübingen AI Center -- University of Tübingen(图宾根人工智能中心 -- 图宾根大学) EPFL(瑞士联邦理工学院) ELLIS Institute Finland -- Aalto University(芬兰ELLIS研究所 -- 阿尔托大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究多模态大语言模型在简单视觉规划任务中推理能力的分布外泛化,发现结合多种文本格式的推理方法效果最佳,纯文本模型表现优于图像输入模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00287 2026-02-18 cs.AI cs.CY 70%

SIGMUS: Semantic Integration for Knowledge Graphs in Multimodal Urban Spaces

SIGMUS:多模态城市空间中知识图谱的语义整合

Brian Wang, Mani Srivastava

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SIGMUS通过大型语言模型实现多模态城市数据的自动语义整合,构建知识图谱以连接不同数据源与事件关系。

Comments 9 pages, accepted at UrbComp 2025 KDD 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15228 2026-02-18 cs.SE 67%

An Empirical Study on the Effects of System Prompts in Instruction-Tuned Models for Code Generation

对指令微调模型在代码生成中系统提示效果的实证研究

Zaiyu Cheng, Antonio Mastropaolo

专题命中 推理与问题求解 :language model(abstract);prompting(abstract)

AI总结 本研究探讨了系统提示对代码生成模型性能的影响,发现提示具体性与模型规模、编程语言等因素相关,且不同语言对提示敏感性存在差异。

Comments 34 pages, 12 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13629 2026-02-18 cs.HC 67%

Search in Transition: A Study of University Students Perspectives on Using LLMs and Traditional Search Engines in English Test Problem Solving for Higher Study

在过渡中搜索:大学生对使用LLMs和传统搜索引擎进行英语测试问题解决的视角研究

Tarek Rahman, Md Shaharia Hossen, Mark Protik Mondol, Jannatun Noor Mukta

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本研究探讨大学生在英语测试问题解决中使用LLMs和传统搜索引擎的视角,发现学生根据任务需求在两者间切换,提出整合GPT与谷歌的聊天机器人以提升准备效率。

Comments arXiv admin note: substantial text overlap with arXiv:2510.17726 by other authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11824 2026-02-18 cs.LG cs.AI 62%

Latent Veracity Inference for Identifying Errors in Stepwise Reasoning

潜在真实性推断用于识别逐步推理中的错误

Minsu Kim, Jean-Pierre Falet, Oliver E. Richardson, Xiaoyin Chen, Moksh Jain, Sungjin Ahn, Sungsoo Ahn, Yoshua Bengio

机构 * Mila – Québec AI Institute(魁北克人工智能研究所) KAIST(韩国科学技术院) Université de Montréal(蒙特利尔大学) LawZero(法零)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过引入潜在真实性变量和Veracity Search算法,提升语言模型在逐步推理中的准确性和可信度,并通过Amortized Veracity Inference实现零样本真实性推断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15549 2026-02-18 cs.RO cs.AI 57%

VLM-DEWM: Dynamic External World Model for Verifiable and Resilient Vision-Language Planning in Manufacturing

VLM-DEWM:动态外部世界模型用于制造中的可验证和抗毁视觉语言规划

Guoqin Tang, Qingxuan Jia, Gang Chen, Tong Li, Zeyuan Huang, Zihang Lv, Ning Ji

机构 * School of Intelligent Engineering and Automation(智能工程与自动化学院)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 VLM-DEWM通过动态外部世界模型提升制造中视觉语言规划的可验证性和抗毁性,显著提高状态跟踪精度和恢复成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏