arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-13 至 2026-01-13 共收录 363 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 62 篇

2601.06098 2026-01-13 cs.AI 77%

Automatic Question Generation for Intuitive Learning Utilizing Causal Graph Guided Chain of Thought Reasoning

利用因果图引导的推理链生成自动问题以促进直观学习

Nicholas X. Wang, Neel V. Parpia, Aaryan D. Parikh, Aggelos K. Katsaggelos

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出利用因果图引导的推理链和多智能体架构,生成准确且符合课程要求的问题,以提高直观学习的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23232 2026-01-13 cs.LG cs.AI cs.CL 75%

SPEC-RL: Accelerating On-Policy Reinforcement Learning with Speculative Rollouts

SPEC-RL: 通过推测性回放加速在线策略学习

Bingshuai Liu, Ante Wang, Zijun Min, Liang Yao, Haibo Zhang, Yang Liu, Xu Han, Peng Li, Anxiang Zeng, Jinsong Su

机构 * School of Informatics, Xiamen University(厦门大学信息学院) LLM Team, Shopee Pte. Ltd.(Shopee公司语言模型团队) Tsinghua University(清华大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SPEC-RL通过整合推测解码技术,有效减少强化学习回放阶段的计算开销,提升大模型推理能力。

Comments fixed typos

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06373 2026-01-13 cs.MA 75%

DemMA: Dementia Multi-Turn Dialogue Agent with Expert-Guided Reasoning and Action Simulation

DemMA:具有专家引导推理和行动模拟的痴呆多轮对话代理

Yutong Song, Jiang Wu, Kazi Sharif, Honghui Xu, Nikil Dutt, Amir Rahmani

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 DemMA通过专家引导的推理和行动模拟,实现了高保真的痴呆症患者多轮对话模拟,优于现有基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07794 2026-01-13 cs.CL cs.AI 73%

Kinship Data Benchmark for Multi-hop Reasoning

多跳推理的亲属数据基准

Tianda Sun, Dimitar Kazakov

机构 * University of York(约克大学) Department of Computer Science(计算机科学系)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 KinshipQA通过生成文化特定的家谱数据,评估多跳推理能力,揭示模型在不同文化背景下的推理差异。

Comments 11 pages, 2 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07226 2026-01-13 cs.AI cs.CL 73%

Lost in the Noise: How Reasoning Models Fail with Contextual Distractors

陷入噪声中:推理模型在上下文干扰中的失败

Seongyun Lee, Yongrae Jo, Minju Seo, Moontae Lee, Minjoon Seo

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 推理与问题求解 :SFT(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文提出RARE方法,通过激励识别噪声中的有用信息,提升模型在上下文干扰下的鲁棒性,揭示增加计算量反而导致噪声环境下性能下降的反比例趋势。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16787 2026-01-13 cs.CL cs.AI 73%

Credible Plan-Driven RAG Method for Multi-Hop Question Answering

可信计划驱动的RAG方法用于多跳问答

Ningning Zhang, Chi Zhang, Zhizhong Tan, Xingxing Yang, Weiping Deng, Wenyong Wang

机构 * Macau University of Science and Technology(澳门科学技术大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 PAR-RAG通过引入复杂性感知的计划生成和双验证机制,提升了多跳问答任务中的推理稳定性和事实一致性,实现了更可靠的问答性能。

Comments 24 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06801 2026-01-13 cs.AI cs.LG 73%

Thinking with Deltas: Incentivizing Reinforcement Learning via Differential Visual Reasoning Policy

通过delta思考:通过微分视觉推理策略激励强化学习

Shujian Gao, Yuan Wang, Jiangtao Yan, Zuxuan Wu, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Zhejiang University(浙江大学) Wuhan University(武汉大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 通过微分视觉推理策略增强强化学习的视觉理解能力,提升多模态任务性能。

Comments 24 pages, 10 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06677 2026-01-13 cs.LG cs.AI 73%

Plasticity vs. Rigidity: The Impact of Low-Rank Adapters on Reasoning on a Micro-Budget

可塑性与刚性:低秩适配器对微预算推理的影响

Zohaib Khan, Omer Tafveez, Zoha Hayat Bhatti

机构 * University of Michigan(密歇根大学)

专题命中 推理与问题求解 :language model(abstract);small language model(abstract);分类 cs.AI、cs.LG

AI总结 研究通过低秩适配器在微预算下提升小型模型推理能力,发现高秩适配器能显著增强模型可塑性,但数学对齐模型性能下降,揭示了预算限制对模型优化的复杂影响。

Comments 9 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06505 2026-01-13 cs.LG cs.AI 73%

Neural Nonmyopic Bayesian Optimization in Dynamic Cost Settings

动态成本环境下的神经非短视贝叶斯优化

Sang T. Truong, Duc Q. Nguyen, Willie Neiswanger, Ryan-Rhys Griffiths, Stefano Ermon, Nick Haber, Sanmi Koyejo

机构 * Stanford University(斯坦福大学) National University of Singapore(新加坡国立大学) University of Southern California(南加州大学) FutureHouse, Inc.(FutureHouse公司)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 LookaHES通过整合神经策略,实现动态成本环境下的非短视贝叶斯优化,提升复杂决策空间中的长视图优化能力。

Comments 32 pages, 20 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11618 2026-01-13 cs.AI cs.LG eess.SP 73%

Benchmarking Spatiotemporal Reasoning in LLMs and Reasoning Models: Capabilities and Challenges

在大语言模型和推理模型中评估时空推理:能力和挑战

Pengrui Quan, Brian Wang, Kang Yang, Liying Han, Mani Srivastava

机构 * Department of Electrical and Computer Engineering, UCLA(电气与计算机工程系,加州大学洛杉矶分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出STARK基准测试,评估大语言模型和推理模型在时空推理任务中的能力和挑战,发现推理模型在复杂任务中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07654 2026-01-13 cs.CR cs.AI 70%

Towards Automating Blockchain Consensus Verification with IsabeLLM

面向区块链共识验证的自动化工具IsabeLLM

Elliot Jones, William Knottenbelt

机构 * Department of Computing, Imperial College London, United Kingdom(计算机系,伦敦帝国理工学院,英国)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 IsabeLLM通过整合Isabelle证明助手和大语言模型,自动化区块链共识协议的验证过程,成功验证了比特币工作量证明协议的正确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07577 2026-01-13 cs.AI 70%

Beyond Entangled Planning: Task-Decoupled Planning for Long-Horizon Agents

超越纠缠规划:面向长时间 horizon 的任务解耦规划

Yunfan Li, Bingbing Xu, Xueyun Tian, Xiucheng Xu, Huawei Shen

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(人工智能安全国家重点实验室、计算技术研究所、中国科学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出任务解耦规划(TDP)方法,通过将任务分解为子目标图,减少长horizon智能体的规划误差传播,提升鲁棒性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07359 2026-01-13 cs.CV cs.AI 70%

Seeing Right but Saying Wrong: Inter- and Intra-Layer Refinement in MLLMs without Training

看到正确却说错:在MLLMs中无需训练的跨层和内层细化

Shezheng Song, Shasha Li, Jie Yu

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 DualPD通过双视角解码细化策略,无需额外训练提升多模态大语言模型的视觉理解准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07263 2026-01-13 cs.CR cs.AI 70%

When Bots Take the Bait: Exposing and Mitigating the Emerging Social Engineering Attack in Web Automation Agent

当机器人上当:揭露和缓解网络自动化代理中新兴的社会工程攻击

Xinyi Wu, Geng Hong, Yueyue Chen, MingXuan Liu, Feier Jin, Xudong Pan, Jiarun Dai, Baojun Liu

机构 * Fudan University(复旦大学) Zhongguancun Laboratory(中关村实验室) Shanghai Innovation Institute(上海创新研究院) Tsinghua University(清华大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究提出AgentBait攻击范式,揭示网络自动化代理的社会工程威胁,并设计SUPERVISOR模块有效缓解此类攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07041 2026-01-13 cs.CL 70%

When Abundance Conceals Weakness: Knowledge Conflict in Multilingual Models

当丰裕掩盖弱点:多语言模型中的知识冲突

Jiaqi Zhao, Qiang Huang, Haodong Chen, Xiaoxing You, Jun Yu

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Hangzhou Dianzi University(杭州电子科技大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究提出CLEAR框架,分析多语言模型在跨语言知识冲突中的解决机制,揭示任务类型对冲突解决的影响,显示语言资源丰富度与语言亲和力在不同任务中的决定性作用。

Comments 14 pages, 7 figures, and 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14319 2026-01-13 cs.AI 70%

Metacognitive Self-Correction for Multi-Agent System via Prototype-Guided Next-Execution Reconstruction

多智能体系统中的元认知自我校正:通过原型引导的下一步执行重建

Xu Shen, Qi Zhang, Song Wang, Zhen Tan, Xinyu Zhao, Laura Yao, Vaishnav Tadiparthi, Hossein Nourkhiz Mahjoub, Ehsan Moradi Pari, Kwonjoon Lee, Tianlong Chen

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出MASC框架,通过原型引导和下一步执行重建实现多智能体系统的元认知自我校正,有效提升错误检测精度并减少误差传播。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07038 2026-01-13 cs.AI 70%

Tool-Augmented Policy Optimization: Synergizing Reasoning and Adaptive Tool Use with Reinforcement Learning

工具增强的策略优化:通过强化学习协同推理与自适应工具使用

Wenxun Wu, Yuanyang Li, Guhan Chen, Linyue Wang, Hongyang Chen

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 TAPO通过强化学习整合多跳推理与自适应工具调用,提升模型在知识密集型和计算密集型任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08344 2026-01-13 cs.AI 70%

What Breaks Knowledge Graph based RAG? Benchmarking and Empirical Insights into Reasoning under Incomplete Knowledge

什么破坏了基于知识图谱的RAG?对在不完整知识下推理的基准测试和经验洞察

Dongzhuoran Zhou, Yuqicheng Zhu, Xiaxia Wang, Hongkuan Zhou, Yuan He, Jiaoyan Chen, Steffen Staab, Evgeny Kharlamov

机构 * University of Oslo(奥斯陆大学) Bosch Center for AI(博世人工智能中心) University of Stuttgart(斯图加特大学) Amazon(亚马逊公司) University of Oxford(牛津大学) The University of Manchester(曼彻斯特大学) University of Southampton(南安普顿大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出BRINK基准测试,揭示了当前KG-RAG方法在知识不完整时推理能力有限,依赖内部记忆且泛化能力各异。

Comments Accepted as a main conference paper at EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06786 2026-01-13 cs.CL 70%

EpiCaR: Knowing What You Don't Know Matters for Better Reasoning in LLMs

EpiCaR: 了解未知对提高大语言模型的推理能力至关重要

Jewon Yeom, Jaewon Sok, Seonghyeon Park, Jeongjae Park, Taesup Kim

机构 * Graduate School of Data Science, Seoul National University(数据科学研究生院,首尔国立大学) Department of Rural Systems Engineering, Seoul National University(农村系统工程系,首尔国立大学) Department of Aerospace Engineering, Seoul National University(航空航天工程系,首尔国立大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 EpiCaR通过知识校准推理提升大语言模型的推理准确性和校准性,减少推理计算量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06423 2026-01-13 cs.AI 70%

Does Inference Scaling Improve Reasoning Faithfulness? A Multi-Model Analysis of Self-Consistency Tradeoffs

推理扩展是否能提升推理的可靠性?对多模型自一致性权衡的分析

Deep Mehta

机构 * Adobe Inc(Adobe公司)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究探讨推理扩展对推理可靠性的影响,发现不同模型表现各异,自一致性并非普遍有效,需根据具体模型进行测试。

Comments 24 pages, 3 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25263 2026-01-13 cs.CV 67%

LangHOPS: Language Grounded Hierarchical Open-Vocabulary Part Segmentation

LangHOPS: 语言引导的层次开放词汇部件分割

Yang Miao, Jan-Nico Zaech, Xi Wang, Fabien Despinoy, Danda Pani Paudel, Luc Van Gool

机构 * INSAIT Sofia University "St. Kliment Ohridski"(索菲亚大学"圣克莱门特·欧里迪斯基") ETH Zurich(苏黎世联邦理工学院) TU Munich(慕尼黑技术大学) Toyota Motor Europe(丰田欧洲公司)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 LangHOPS通过多模态大语言模型实现开放词汇物体-部件实例分割,取得领域内和跨数据集的优异性能。

Comments 10 pages, 5 figures, 14 tables, Neurips 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06678 2026-01-13 cs.DB 67%

Reflective Reasoning for SQL Generation

面向SQL生成的反思推理

Isabelle Mohr, Joao Gandarela, John Dujany, Andre Freitas

专题命中 推理与问题求解 :LLM(abstract);prompting(abstract)

AI总结 本文提出了一种基于反思细化的文本到SQL框架,通过阶段化生成和反馈机制提升SQL生成的鲁棒性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06176 2026-01-13 cs.CV 67%

TIR-Flow: Active Video Search and Reasoning with Frozen VLMs

TIR-Flow:基于冻结视频语言模型的主动视频搜索与推理

Hongbo Jin, Siyi Xie, Jiayu Ding, Kuanwei Lin, Ge Li

机构 * School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学)

专题命中 推理与问题求解 :language model(abstract);SFT(abstract)

AI总结 TIR-Flow通过三个协同模块实现冻结视频语言模型的主动视频搜索与推理,显著提升性能并拓展长视界视频推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07782 2026-01-13 cs.CL cs.AI cs.IR 62%

Beyond Single-Shot: Multi-step Tool Retrieval via Query Planning

超越单次检索:通过查询规划实现多步工具检索

Wei Fang, James Glass

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出TOOLQP框架,通过迭代查询规划解决多步工具检索问题,实现更高效的检索和执行能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23027 2026-01-13 cs.LG cs.CL 62%

Towards Stable and Effective Reinforcement Learning for Mixture-of-Experts

面向混合专家架构的稳定且有效的强化学习

Di Zhang, Xun Wu, Shaohan Huang, Lingjie Jiang, Yaru Hao, Li Dong, Zewen Chi, Zhifang Sui, Furu Wei

机构 * Microsoft Research(微软研究院) Peking University(北京大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出一种路由感知方法,通过优化重要性采样权重提升混合专家架构的强化学习稳定性与性能。

Comments Added additional experiments, improved analysis, and fixed minor issues

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04472 2026-01-13 cs.LG cs.AI 62%

DAST: Difficulty-Adaptive Slow-Thinking for Large Reasoning Models

DAST: 为大推理模型引入难度自适应的慢思考

Yi Shen, Jian Zhang, Jieyun Huang, Shuming Shi, Wenjing Zhang, Jiangze Yan, Ning Wang, Kai Wang, Zhaoxiang Liu, Shiguo Lian

机构 * Unicom Data Intelligence(中国unicom数据智能) Data Science & Artificial Intelligence Research Institute(数据科学与人工智能研究院)

专题命中 推理与问题求解 :preference optimization(abstract);分类 cs.AI、cs.LG

AI总结 DAST通过自适应调整推理步骤长度,有效减少大模型的过度思考问题,同时保持复杂任务的推理准确性。

Comments EMNLP 2025 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07232 2026-01-13 cs.AI 57%

Yes FLoReNce, I Will Do Better Next Time! Agentic Feedback Reasoning for Humorous Meme Detection

是的,Florne,我下次会做得更好!用于幽默表情包检测的代理反馈推理

Olivia Shanhong Liu, Pai Chet Ng, De Wen Soh, Konstantinos N. Plataniotis

专题命中 推理与问题求解 :prompting(abstract);分类 cs.AI

AI总结 Florne通过闭环反馈机制提升表情包幽默检测的适应性和解释质量。

Comments LaMAS@AAAI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07022 2026-01-13 cs.CL 57%

Solar Open Technical Report

太阳能开放技术报告

Sungrae Park, Sanghoon Kim, Jungho Cho, Gyoungjin Gim, Dawoon Jung, Mikyoung Cha, Eunhae Choo, Taekgyu Hong, Minbyul Jeong, SeHwan Joo, Minsoo Khang, Eunwon Kim, Minjeong Kim, Sujeong Kim, Yunsu Kim, Hyeonju Lee, Seunghyun Lee, Sukyung Lee, Siyoung Park, Gyungin Shin, Inseo Song, Wonho Song, Seonghoon Yang, Seungyoun Yi, Sanghoon Yoon, Jeonghyun Ko, Seyoung Song, Keunwoo Choi, Hwalsuk Lee, Sunghun Kim, Du-Seong Chang, Kyunghyun Cho, Junsuk Choe, Hwaran Lee, Jae-Gil Lee, KyungTae Lim, Alice Oh

机构 * Upstage Solar Team(Upstage太阳能团队)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL

AI总结 Solar Open通过解决数据稀缺、课程协调和可扩展RL三个挑战,构建了一个具有竞争力的双语混合专家语言模型,展示了在服务不足语言AI开发中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06171 2026-01-13 cs.CY cs.AI 57%

From Individual Prompts to Collective Intelligence: Mainstreaming Generative AI in the Classroom

从个体提示到集体智慧:在课堂中主流化生成式AI

Junaid Qadir, Muhammad Salman Khan

机构 * College of Engineering, Qatar University, Doha, Qatar(卡塔尔大学工程学院,多哈)

专题命中 推理与问题求解 :prompting(abstract);分类 cs.AI

AI总结 本文提出通过集体智慧导向的教学法,结合生成式AI和同伴协作,提升课堂学习效果与学生参与度。

Comments accepted at IEEE EDUCON 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06164 2026-01-13 cs.SE cs.AI 57%

Contract2Plan: Verified Contract-Grounded Retrieval-Augmented Optimization for BOM-Aware Procurement and Multi-Echelon Inventory Planning

Contract2Plan: 一种基于合同的验证性检索增强优化方法用于BOM感知采购和多层级库存规划

Sahil Agarwal

机构 * Independent Researcher(独立研究者)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 Contract2Plan通过验证性检索增强优化方法,解决合同条款与BOM耦合导致的采购和库存规划问题,确保计划的可行性与合规性。

Comments 22 pages, 5 figures, 4 tables, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏