arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-10 至 2026-02-10 共收录 455 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 79 篇

2512.16909 2026-02-10 cs.CV cs.RO 78%

MomaGraph: State-Aware Unified Scene Graphs with Vision-Language Model for Embodied Task Planning

MomaGraph: 体感任务规划中的状态感知统一场景图

Yuanchen Ju, Yongyuan Liang, Yen-Jen Wang, Nandiraju Gireesh, Yuanliang Ju, Seungjae Lee, Qiao Gu, Elvis Hsieh, Furong Huang, Koushil Sreenath

机构 * University of California, Berkeley(加州大学伯克利分校) University of Maryland, College Park(马里兰大学学院公园分校) University of Toronto(多伦多大学)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 MomaGraph通过统一场景图与强化学习模型,实现家庭环境中体感任务规划的高效任务规划与场景理解。

Comments 25 pages, 10 figures. Project page:https://hybridrobotics.github.io/MomaGraph/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08401 2026-02-10 cs.AI cs.CR 77%

On Protecting Agentic Systems' Intellectual Property via Watermarking

通过水印技术保护代理系统知识产权

Liwen Wang, Zongjie Li, Yuchong Xie, Shuai Wang, Dongdong She, Wei Wang, Juergen Rahmel

机构 * The Hong Kong University of Science(香港科学与技术大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出AGENTWM框架,通过水印技术保护代理系统知识产权,有效抵御适应性对手的攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17891 2026-02-10 cs.SE cs.LG 77%

TritonRL: Training LLMs to Think and Code Triton Without Cheating

TritonRL: 训练 LLM 以无作弊方式思考和编写 Triton

Jiin Woo, Shaowei Zhu, Allen Nie, Zhen Jia, Yida Wang, Youngsuk Park

机构 * Carnegie Mellon University(卡内基梅隆大学) Amazon Web Services(亚马逊网络服务) Google DeepMind(谷歌DeepMind)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 TritonRL 通过强化学习框架训练出专门用于 Triton 编程的 8B 级 LLM,实现高正确性和运行时加速,优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07553 2026-02-10 cs.AI 77%

VirtualEnv: A Platform for Embodied AI Research

VirtualEnv: 一个用于具身AI研究的平台

Kabir Swain, Sijie Han, Ayush Raina, Jin Zhang, Shuang Li, Michael Stopa, Antonio Torralba

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 VirtualEnv是一个基于Unreal Engine 5的开源平台,用于评估LLM在具身和交互场景中的能力,支持多智能体协作和程序生成任务,旨在推动AI与游戏的交叉研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07213 2026-02-10 cs.LG 77%

Adaptive Retrieval helps Reasoning in LLMs -- but mostly if it's not used

自适应检索有助于增强大语言模型的推理能力——但主要是当它不被使用时

Srijan Shakya, Anamaria-Roberta Hartl, Sepp Hochreiter, Korbinian Pöppel

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究发现自适应检索在某些情况下反而有助于提升大语言模型的推理能力,表明模型在无需检索时可能表现更佳。

Comments Eurips Workshop on Principles of Generative Modeling (PriGM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11840 2026-02-10 cs.AI cs.LO cs.SE 77%

Imandra CodeLogician: Neuro-Symbolic Reasoning for Precise Analysis of Software Logic

Imandra CodeLogician: 用于软件逻辑精确分析的神经符号推理

Hongyu Lin, Samer Abdallah, Makar Valentinov, Paul Brennan, Elijah Kagan, Christoph M. Wintersteiger, Denis Ignatovich, Grant Passmore

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Imandra CodeLogician通过神经符号推理提升软件逻辑分析的精确性,结合形式方法与LLM,实现更严谨的程序验证与分析。

Comments 52 pages, 23 figures. Includes a new benchmark dataset (code-logic-bench) and evaluation of neurosymbolic reasoning for software analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08263 2026-02-10 cs.SE 75%

Specification Vibing for Automated Program Repair

基于规范的自动化程序修复

Taohong Zhu, Lucas C. Cordeiro, Mustafa A. Mustafa, Youcheng Sun

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 VibeRepair通过行为规范修复替代传统代码编辑,提升自动化程序修复的准确性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07007 2026-02-10 cs.RO 75%

ARGOS: Automated Functional Safety Requirement Synthesis for Embodied AI via Attribute-Guided Combinatorial Reasoning

ARGOS:通过属性引导的组合推理实现具身AI的自动功能安全需求合成

Dongsheng Chen, Yuxuan Li, Yi Lin, Guanhua Chen, Jiaxin Zhang, Xiangyu Zhao, Lei Ma, Xin Yao, Xuetao Wei

机构 * Southern University of Science and Technology, Shenzhen, China(南方科技大学, 深圳, 中国) City University of Hong Kong, Hong Kong, China(香港城市大学, 香港, 中国) The University of Tokyo, Tokyo, Japan(东京大学, 东京, 日本) Lingnan University, Hong Kong, China(岭南大学, 香港, 中国)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 ARGOS通过属性引导的组合推理,实现具身AI自动功能安全需求生成,提升开放环境中的安全性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08332 2026-02-10 cs.CL cs.AI 73%

Latent Reasoning with Supervised Thinking States

基于监督思考状态的潜在推理

Ido Amos, Avi Caciularu, Mor Geva, Amir Globerson, Jonathan Herzig, Lior Shani, Idan Szpektor

机构 * Google Research(谷歌研究)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Thinking States方法,通过在输入处理过程中生成思考token,实现更高效的潜在推理,实验表明其在多个推理任务中表现优异,且在延迟和长序列外推方面优于CoT。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03950 2026-02-10 cs.AI cs.LG cs.MA 73%

Enhancing Mathematical Problem Solving in LLMs through Execution-Driven Reasoning Augmentation

通过执行驱动推理增强提升大语言模型的数学问题解决能力

Aditya Basarkar, Benyamin Tabarsi, Tiffany Barnes, Dongkuan Xu

机构 * North Carolina State University(北卡罗来纳州立大学)

专题命中 推理与问题求解 :LLM(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出IIPC方法,通过迭代优化程序推理链并结合执行反馈,提升大语言模型的数学问题解决能力。

Comments 9 pages, 7 figures, submitted to ACL ARR 2026, hyperlink to code repository provided in the abstract

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11239 2026-02-10 cs.AI cs.CL 73%

Nondeterministic Polynomial-time Problem Challenge: An Ever-Scaling Reasoning Benchmark for LLMs

非确定多项式时间问题挑战:为大语言模型构建的持续扩展推理基准

Chang Yang, Ruiyu Wang, Junzhe Jiang, Qi Jiang, Qinggang Zhang, Yanchen Deng, Shuxin Li, Shuyue Hu, Bo Li, Florian T. Pokorny, Xiao Huang, Xinrun Wang

机构 * The Hong Kong Polytechnic University(香港理工大学) KTH Royal Institute of Technology(皇家理工学院) Carnegie Mellon University(卡内基梅隆大学) Nanyang Technological University(南洋理工大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Singapore Management University(新加坡管理学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 NPPC是一个持续扩展的推理基准,通过三个模块评估LLMs的推理能力,揭示其性能极限和改进方向。

Comments Accepted to TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21549 2026-02-10 cs.AI 72%

Correct Reasoning Paths Visit Shared Decision Pivots

正确推理路径访问共享决策枢纽

Dongkyu Cho, Amy B. Z. Zhang, Bilel Fehri, Sheng Wang, Rumi Chunara, Hengrui Cai, Rui Song

专题命中 推理与问题求解 :language model(abstract,journal_ref);large language model(abstract);分类 cs.AI

AI总结 本文提出了一种基于决策枢纽的自训练方法,通过挖掘共享决策点提升大语言模型的推理能力。

Comments 18 pages, 10 figures

Journal ref NeurIPS 2025 Workshop on Foundations of Reasoning in Language Models (FoRLM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09002 2026-02-10 cs.RO cs.AI 70%

From Obstacles to Etiquette: Robot Social Navigation with VLM-Informed Path Selection

从障碍到礼仪:基于VLM引导路径选择的机器人社交导航

Zilin Fang, Anxing Xiao, David Hsu, Gim Hee Lee

机构 * School of Computing(计算机学院) Smart Systems Institute(智能系统研究所)

专题命中 推理与问题求解 :language model(abstract);foundation model(abstract);分类 cs.AI

AI总结 本文提出了一种结合几何规划与上下文社交推理的机器人社交导航框架,通过VLM模型优化路径选择,以减少对人类活动的干扰并遵守社会规范。

Comments Accepted to IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08808 2026-02-10 cs.LG 70%

How2Everything: Mining the Web for How-To Procedures to Evaluate and Improve LLMs

How2Everything: 从网络挖掘如何操作指南以评估和改进大语言模型

Yapei Chang, Kyle Lo, Mohit Iyyer, Luca Soldaini

机构 * Allen Institute for AI(艾伦人工智能研究所) University of Maryland(马里兰大学) University of Washington(华盛顿大学)

专题命中 推理与问题求解 :LLM(abstract);pretraining(abstract);分类 cs.LG

AI总结 How2Everything通过从网络挖掘操作指南,构建评估集并利用强化学习提升模型性能,实现大规模的能力评估与改进闭环。

Comments 53 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08281 2026-02-10 cs.CL 70%

New Skills or Sharper Primitives? A Probabilistic Perspective on the Emergence of Reasoning in RLVR

新技能还是更尖锐的原语?从概率角度探讨RLVR中推理能力的出现

Zhilin Wang, Yafu Li, Shunkai Zhang, Zhi Wang, Haoran Zhang, Xiaoye Qu, Yu Cheng

机构 * University of Science(科学技术大学) The Chinese University of Hong Kong(香港中文大学) Peking University(北京大学) Nanjing University(南京大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 RLVR通过提升原子步骤概率,使模型在多步骤推理中克服指数衰减,展现新能力而非单纯激发潜在痕迹。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08241 2026-02-10 cs.AI cs.CV 70%

Do MLLMs Really See It: Reinforcing Visual Attention in Multimodal LLMs

MLLMs真的能看见吗:在多模态大语言模型中强化视觉注意力

Siqu Ou, Tianrui Wan, Zhiyuan Zhao, Junyu Gao, Xuelong Li

机构 * Shanghai Jiao Tong University(上海交通大学) Northwestern Polytechnical University(西北工业大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SAYO通过强化学习框架引入区域级视觉注意力奖励,提升多模态大语言模型的视觉聚焦能力,从而在多种推理和感知任务中取得性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08741 2026-02-10 cs.CL 70%

From Rows to Reasoning: A Retrieval-Augmented Multimodal Framework for Spreadsheet Understanding

从行到推理:一种增强检索的多模态框架用于电子表格理解

Anmol Gulati, Sahil Sen, Waqar Sarguroh, Kevin Paul

机构 * Commercial Technology and Innovation Office, PricewaterhouseCoopers U.S.(普华永道美国商业技术与创新办公室)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 FRTR提出了一种多模态检索增强生成框架,通过分解电子表格为细粒度嵌入并整合多模态信息,提升了对复杂电子表格的推理能力,在基准测试中实现了显著的准确率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12281 2026-02-10 cs.CL 70%

Legal$Δ$: Enhancing Legal Reasoning in LLMs via Reinforcement Learning with Chain-of-Thought Guided Information Gain

Legal$Δ$: 通过强化学习与链式思维引导信息增益提升大语言模型的法律推理

Xin Dai, Buqiang Xu, Zhenghao Liu, Yukun Yan, Huiyuan Xie, Xiaoyuan Yi, Shuo Wang, Ge Yu

机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Institute for AI, Tsinghua University(清华大学人工智能研究院计算机科学与技术系) Microsoft Research Asia(微软亚洲研究院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 Legal$Δ$通过强化学习与链式思维引导信息增益提升法律推理的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07992 2026-02-10 cs.LG stat.ML 70%

When Is Compositional Reasoning Learnable from Verifiable Rewards?

何时可以通过可验证奖励进行组合推理学习?

Daniel Barzilai, Yotam Wolf, Ronen Basri

机构 * Weizmann Institute of Science(魏茨曼科学研究院) Hebrew University of Jerusalem(耶路撒冷希伯来大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文研究了通过可验证奖励强化学习学习组合推理的可学习性,提出了任务优势比率的概念,并分析了其在不同任务中的表现及影响因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07555 2026-02-10 cs.CV cs.AI 70%

VISOR: VIsual Spatial Object Reasoning for Language-driven Object Navigation

VISOR:基于语言驱动的对象导航的视觉空间对象推理

Francesco Taioli, Shiping Yang, Sonia Raychaudhuri, Marco Cristani, Unnat Jain, Angel X Chang

机构 * Polytechnic of Turin(都灵理工大学) Simon Fraser University(Simon Fraser大学) University of Verona(威尼斯大学) University of Reykjavik(雷克雅未克大学) University of California, Irvine(加州大学尔湾分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 VISOR提出了一种紧凑的3B参数VLA智能体,通过显式图像基础推理实现人类般的具身推理,提升对象识别和动作选择的可解释性、泛化能力和导航效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18845 2026-02-10 cs.AI 70%

UNeMo: Collaborative Visual-Language Reasoning and Navigation via a Multimodal World Model

UNeMo:通过多模态世界模型实现协作的视觉-语言推理与导航

Changxin Huang, Lv Tang, Zhaohuan Zhan, Lisha Yu, Runhao Zeng, Zun Liu, Zhengjie Wang, Jianqiang Li

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 UNeMo通过多模态世界模型实现视觉-语言推理与导航的协作优化,提升导航准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07820 2026-02-10 cs.AI 70%

Guideline Forest: Retrieval-Augmented Reasoning with Branching Experience-Induced Guidelines

指南森林:基于检索的增强推理与分支经验引导

Jiaxiang Chen, Zhuo Wang, Mingxi Zou, Qifan Wang, Zenglin Xu

机构 * Fudan University(复旦大学) Meta SAIS SII

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Guideline Forest通过利用经验引导多步骤推理,提升数学和编程任务的推理能力,支持多模型协作与灵活扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23126 2026-02-10 cs.CL 70%

PBEBench: A Multi-Step Programming by Examples Reasoning Benchmark inspired by Historical Linguistics

PBEBench: 一个受历史语言学启发的多步编程-by-例子推理基准

Atharva Naik, Prakam, Yash Mathur, Darsh Agrawal, Manav Kapadnis, Yuwei An, Clayton Marr, Carolyn Rose, David Mortensen

机构 * Carnegie Mellon University(卡内基梅隆大学) Ohio State University(俄亥俄州立大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 PBEBench是一个受历史语言学启发的多步编程-by-例子推理基准,用于评估LLMs的归纳推理能力,发现模型在复杂任务中的表现存在显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08588 2026-02-10 cs.DB 67%

MMTS-BENCH: A Comprehensive Benchmark for Time Series Understanding and Reasoning

MMTS-BENCH: 一个全面的时间序列理解和推理基准

Yao Yin, Zhenyu Xiao, Musheng Li, Yiwen Liu, Sutong Nan, Yiting He, Ruiqi Wang, Zhenwei Zhang, Qingmin Liao, Yuantao Gu

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 MMTS-BENCH通过多模态基准评估大语言模型在时间序列理解与推理中的表现,揭示了TS-LLMs在跨领域泛化和多模态整合方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07839 2026-02-10 cs.CL cs.AI cs.LG 67%

TodoEvolve: Learning to Architect Agent Planning Systems

TodoEvolve: 学习架构智能体规划系统

Jiaxi Liu, Yanzuo Jiang, Guibin Zhang, Zihan Zhang, Heng Chang, Zhenfei Yin, Qibing Ren, Junchi Yan

专题命中 推理与问题求解 :preference optimization(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 TodoEvolve通过元规划范式自主合成和修订任务特定的规划架构,在多个智能体基准测试中优于人工设计的规划模块,同时保持低开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19942 2026-02-10 cs.SE 67%

Prometheus: Towards Long-Horizon Codebase Navigation for Repository-Level Problem Solving

Prometheus:面向仓库级问题解决的长周期代码库导航

Yue Pan, Zimin Chen, Siyu Lu, Zhaoyang Chu, Xiang Li, Han Li, Yang Feng, Claire Le Goues, Federica Sarro, Martin Monperrus, He Ye

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 Prometheus通过统一知识图谱和增强内存引擎,实现长周期代码库导航,提升仓库级问题解决的效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08489 2026-02-10 cs.LG cs.CL 62%

Beyond Correctness: Learning Robust Reasoning via Transfer

超越正确性:通过迁移学习实现鲁棒推理

Hyunseok Lee, Soheil Abbasloo, Jihoon Tack, Jinwoo Shin

机构 * Microsoft Research(微软研究院)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.CL、cs.LG

AI总结 通过迁移奖励的强化学习方法,提升大语言模型推理的鲁棒性和效率,实现更稳定和可推广的推理过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08100 2026-02-10 cs.CL cs.AI 62%

Emergent Search and Backtracking in Latent Reasoning Models

潜在推理模型中的涌现搜索与回溯

Jasmine Cui, Charles Ye

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI

AI总结 研究发现潜在推理模型在无词推理中自发学习结构化搜索过程,通过回溯提升准确率并适应性地调整探索路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07125 2026-02-10 cs.IR cs.AI cs.CV cs.LG 62%

Reasoning-Augmented Representations for Multimodal Retrieval

增强推理的表示用于多模态检索

Jianrui Zhang, Anirudh Sundara Rajan, Brandon Han, Soochahn Lee, Sukanta Ganguly, Yong Jae Lee

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Kookmin University(韩国高丽大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出一种增强推理的多模态检索方法,通过外部化推理和语义密集表示提升检索性能,尤其在知识密集型查询和组合修改请求中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08339 2026-02-10 cs.AI cs.CV 57%

CoTZero: Annotation-Free Human-Like Vision Reasoning via Hierarchical Synthetic CoT

CoTZero:通过分层合成CoT实现无标注的人类级视觉推理

Chengyi Du, Yazhe Niu, Dazhong Shen, Luxin Xu

机构 * University of Electronic Science and Technology of China(电子科技大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Chinese University of Hong Kong MMLab(香港中文大学 MMLab) The College of Computer Science and Technology(计算机科学与技术学院) Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 CoTZero通过双阶段数据合成和认知对齐训练,实现无标注的人类级视觉推理,提升模型的层次推理和泛化能力。

Comments 16 pages 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏