arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-17 至 2025-12-17 共收录 32 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 32 篇

2512.14427 2025-12-17 cs.CL cs.AI cs.LG 90%

Effect of Document Packing on the Latent Multi-Hop Reasoning Capabilities of Large Language Models

文档打包对大型语言模型潜在多跳推理能力的影响

Gabriele Prato, Shagun Sodhani, Alessandro Sordoni, Sarath Chandar

机构 * Chandar Research Lab(Chandar研究实验室) Mila – Quebec AI Institute(魁北克人工智能研究所) Université de Montréal(蒙特利尔大学) Microsoft Research(微软研究院) Polytechnique Montréal(蒙特利尔理工学院) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了文档打包对大型语言模型多跳推理能力的影响,发现打包可提升性能但增加计算成本,并通过消融研究揭示了其关键因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13930 2025-12-17 cond-mat.mtrl-sci cs.AI cs.CL cs.LG cs.MA 89%

Hierarchical Multi-agent Large Language Model Reasoning for Autonomous Functional Materials Discovery

分层多智能体大语言模型推理用于自主功能材料发现

Samuel Rothfarb, Megan C. Davis, Ivana Matanovic, Baikun Li, Edward F. Holby, Wilton J. M. Kort-Kamp

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MASTER通过多代理协作提升材料发现的自主性,利用大语言模型进行推理驱动的原子模拟优化,减少90%的计算需求。

Comments Keywords: Multi-agent reasoning; Large language models; Active learning; AI-driven simulation; Materials discovery; Density functional theory; Surface chemistry

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12875 2025-12-17 cs.AI 89%

LTA-thinker: Latent Thought-Augmented Training Framework for Large Language Models on Complex Reasoning

LTA-thinker: 用于复杂推理的大语言模型的潜在思维增强训练框架

Jiaqi Wang, Binquan Ji, Haibo Luo, Yiyang Qi, Ruiting Li, Huiyan Wang, Yuantao Han, Cangyi Yang, jiaxu Zhang, Feiliang Ren

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);SFT(abstract);分类 cs.AI

AI总结 LTA-Thinker通过提升潜在思维分布方差和信息效率,优化大语言模型的复杂推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10966 2025-12-17 physics.ed-ph 89%

Can Large Language Models Correctly Interpret Equations with Errors?

大型语言模型能否正确解释有误的方程?

Lachlan McGinness, Peter Baumgartner

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文研究了大型语言模型在解析学生输入中存在错误的方程时的准确性,发现开源模型无法达到预期效果,并提出未来改进方向。

Comments Published in Physics Review Physics Education Research here: https://journals.aps.org/prper/abstract/10.1103/v8f8-s11v

Journal ref Phys. Rev. Phys. Educ. Res. 21, 020155 Published 15 December, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14064 2025-12-17 cs.CL 88%

What Affects the Effective Depth of Large Language Models?

影响大语言模型有效深度的因素是什么?

Yi Hu, Cai Zhou, Muhan Zhang

机构 * Institute for Artificial Intelligence, Peking University(人工智能研究院,北京大学) Department of Computer Science, Massachusetts Institute of Technology(计算机科学系,麻省理工学院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 研究发现大语言模型的有效深度受模型规模、训练类型和任务难度影响,且有效深度比例稳定,提示需提升层利用率、模型剪枝和提前退出技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01977 2025-12-17 cs.CL cs.AI 88%

TIBSTC-CoT: A Multi-Domain Instruction Dataset for Chain-of-Thought Reasoning in Language Models

TIBSTC-CoT:一种用于语言模型链式推理的多领域指令数据集

Fan Gao, Cheng Huang, Nyima Tashi, Yutong Liu, Xiangxiang Wang, Thupten Tsering, Ban Ma-bao, Renzeg Duojie, Gadeng Luosang, Rinchen Dongrub, Dorje Tashi, Xiao Feng, Hao Wang, Yongbin Yu

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);large language model(abstract);prompting(abstract)

AI总结 TIBSTC-CoT通过链式推理提示法构建多领域藏语数据集,开发出具备推理能力的藏语LLM,提升低资源语言处理性能。

Comments We will merge this paper with arXiv:2503.18288

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20935 2025-12-17 cs.AI 87%

GALAX: Graph-Augmented Language Model for Explainable Reinforcement-Guided Subgraph Reasoning in Precision Medicine

GALAX:图增强语言模型用于可解释的强化引导子图推理在精准医学中

Heming Zhang, Di Huang, Wenyu Li, Michael Province, Yixin Chen, Philip Payne, Fuhai Li

机构 * I2DB, Washington University School of Medicine(I2DB,华盛顿大学医学学院) Department of Computer Science and Engineering, Washington University in St. Louis(计算机科学与工程系,华盛顿大学圣路易斯分校) Department of Genetics, Washington University School of Medicine(遗传学系,华盛顿大学医学学院)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);large language model(abstract);pretraining(abstract)

AI总结 GALAX通过整合图神经网络与大语言模型,利用强化学习实现子图推理,提升精准医学中目标发现的可解释性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17116 2025-12-17 cs.AI 87%

MCTS-EP: Empowering Embodied Planning with Online Preference Optimization

MCTS-EP:通过在线偏好优化增强具身规划

Hang Xu, Zang Yu, Yehui Tang, Pengbo Hu, Yuhao Tang, Hao Dong

机构 * School of Management, Fudan University, Shanghai, China(复旦大学管理学院) Independent Researcher(独立研究者) CFCS, School of Computer Science, Peking University, Beijing, China(计算机科学系,北京大学) PKU-AgiBot Lab, Peking University, Beijing, China(北京大学)

专题命中 推理与问题求解 :preference optimization(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 MCTS-EP通过结合大语言模型与蒙特卡洛树搜索,实现具身智能体的在线偏好优化,提升多模态任务的性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14474 2025-12-17 cs.AI 85%

Model-First Reasoning LLM Agents: Reducing Hallucinations through Explicit Problem Modeling

基于模型的推理语言模型代理:通过显式问题建模减少幻觉

Annu Rana, Gaurav Kumar

机构 * Stanford AI Professional Program(斯坦福AI专业项目) IESE EMBA Program(IESE EMBA项目)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出基于模型的推理方法,通过显式问题建模减少LLM在复杂规划任务中的幻觉和不一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14448 2025-12-17 cs.CR cs.AI 85%

Reasoning-Style Poisoning of LLM Agents via Stealthy Style Transfer: Process-Level Attacks and Runtime Monitoring in RSV Space

通过隐蔽的风格迁移进行LLM代理的推理风格污染:过程级攻击与运行时监控在RSV空间中

Xingfu Zhou, Pengfei Wang

机构 * college of computer science, National University of Defense Technology(计算机科学学院,国防科技大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出推理风格污染攻击,通过隐蔽方式改变LLM代理的推理风格,导致性能下降并绕过内容过滤,提出运行时监控方法应对该漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14138 2025-12-17 cs.HC cs.AI 85%

LAPPI: Interactive Optimization with LLM-Assisted Preference-Based Problem Instantiation

LAPPI:基于LLM的偏好驱动问题实例化交互优化

So Kuroki, Manami Nakagawa, Shigeo Yoshida, Yuki Koyama, Kozuno Tadashi

机构 * Sakana AI University of California, Davis(加州大学戴维斯分校) OMRON SINIC X Corporation(OMRON SINIC X公司) University of Tokyo(东京大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 LAPPI通过LLM辅助用户将模糊偏好转化为明确的优化问题,提升终端用户在旅行计划等任务中的问题实例化效率和解决方案质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14048 2025-12-17 cs.AI 85%

Intention Chain-of-Thought Prompting with Dynamic Routing for Code Generation

具有动态路由的意图链式思维提示法用于代码生成

Shen Li, Li Huang, Shaoxiong Zhan, Weifeng Sun, Tao Yin, Zhongxin Liu, Meng Yan

专题命中 推理与问题求解 :prompting(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 RoutingGen通过动态路由策略优化代码生成,结合少样本提示与结构化推理策略ICoT,提升生成效率与质量。

Comments Accepted at AAAI-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20768 2025-12-17 cs.CR cs.AI cs.IR 85%

RAGRank: Using PageRank to Counter Poisoning in CTI LLM Pipelines

RAGRank: 使用PageRank对抗CTI LLM流水线中的污染

Austin Jia, Avaneesh Ramesh, Zain Shamsi, Daniel Zhang, Alex Liu

机构 * Applied Research Laboratories, The University of Texas at Austin, Texas, USA(应用研究实验室,德克萨斯大学奥斯汀分校,德克萨斯州,美国)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 RAGRank通过PageRank算法提升CTI LLM流水线的抗污染能力,通过降低恶意文档权威分数并增强可信内容传播。

Comments Presented as a poster at the Annual Computer Security Applications Conference (ACSAC) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17985 2025-12-17 cs.HC cs.AI 85%

How K-12 Educators Use AI: LLM-Assisted Qualitative Analysis at Scale

K-12教育工作者如何使用AI:大规模LLM辅助定性分析

Alex Liu, Lief Esbenshade, Shawon Sarkar, Victor Tian, Zachary Zhang, Kevin He, Min Sun

机构 * University of Washington(华盛顿大学) Hensun Innovation(翰森创新)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究通过大规模LLM辅助分析,探讨K-12教育工作者在教学中使用AI工具的模式与方法,揭示其教学推理过程并为教育工具设计提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13974 2025-12-17 cs.RO 85%

Autonomous Construction-Site Safety Inspection Using Mobile Robots: A Multilayer VLM-LLM Pipeline

基于移动机器人的自主施工工地安全检查:一种多层VLM-LLM流水线

Hossein Naderi, Alireza Shojaei, Philip Agee, Kereshmeh Afsari, Abiola Akanmu

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出一种多层VLM-LLM流水线,通过机器人自主导航与人工智能结合,实现施工工地安全检查的自动化报告生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10400 2025-12-17 cs.MA cs.AI cs.CL 79%

Rethinking the Reliability of Multi-agent System: A Perspective from Byzantine Fault Tolerance

重新思考多智能体系统可靠性:从拜占庭容错的角度出发

Lifan Zheng, Jiawei Chen, Qinghong Yin, Jingyuan Zhang, Xinyi Zeng, Yu Tian

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文从拜占庭容错角度研究基于大语言模型的智能体可靠性,提出CP-WBFT机制提升多智能体系统稳定性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14288 2025-12-17 cs.AI 77%

Leveraging LLMs for Collaborative Ontology Engineering in Parkinson Disease Monitoring and Alerting

利用大语言模型进行帕金森病监测与预警的协同本体工程

Georgios Bouchouras, Dimitrios Doumanas, Andreas Soularidis, Konstantinos Kotis, George A. Vouros

机构 * Intelligent Systems Laboratory, Department of Cultural Technology and Communication, University of the Aegean(爱琴海大学智能系统实验室) Artificial Intelligence Laboratory, Department of Digital Systems, University of Piraeus(比雷埃克斯大学人工智能实验室)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了利用大语言模型进行帕金森病监测与预警本体工程,通过人机协作提升本体的全面性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13978 2025-12-17 cs.AI 77%

Evaluating Frontier LLMs on PhD-Level Mathematical Reasoning: A Benchmark on a Textbook in Theoretical Computer Science about Randomized Algorithms

评估前沿大语言模型在博士级数学推理中的表现:一个关于随机算法理论教材的基准测试

Yang Cao, Yubin Chen, Xuyang Guo, Zhao Song, Song Yue, Jiahao Zhang, Jiale Zhao

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文评估了前沿大语言模型在博士级数学推理中的表现,通过随机算法教材的基准测试,发现顶级模型在准确性上表现优异,但可靠性存在显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14257 2025-12-17 cs.CV 75%

Enhancing Visual Programming for Visual Reasoning via Probabilistic Graphs

通过概率图增强视觉编程用于视觉推理

Wentao Wan, Kaiyu Wu, Qingyang Ma, Nan Kang, Yunjie Chen, Liang Lin, Keze Wang

机构 * School of Computer Science and Engineering, Sun Yat-sen University(计算机科学与工程学院,中山大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 通过构建概率图解决视觉编程非可微问题,提升视觉推理任务的性能。

Comments 13 Pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13706 2025-12-17 cs.LG cs.CL 73%

Mitigating Catastrophic Forgetting in Mathematical Reasoning Finetuning through Mixed Training

通过混合训练缓解数学推理微调中的灾难性遗忘

John Graham Reynolds

机构 * Department of Computer Science(计算机科学系) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出混合训练策略,通过交错数学和NLI任务来缓解微调中的灾难性遗忘,同时保持数学性能和NLI准确性。

Comments 11 pages, 2 figures. Code available at https://github.com/johngrahamreynolds/mathematical_catastrophe_mitigation. Models available at https://huggingface.co/collections/MarioBarbeque/catastrophic-forgetting-in-mathematical-reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14040 2025-12-17 cs.CV cs.LG 70%

ChartAgent: A Chart Understanding Framework with Tool Integrated Reasoning

ChartAgent: 一种集成工具推理的图表理解框架

Boran Wang, Xinming Wang, Yi Chen, Xiang Li, Jian Xu, Jing Yuan, Chenglin Liu

机构 * College of Artificial Intelligence, Nankai University(人工智能学院,南开大学) University of Chinese Academy of Sciences(中国科学院大学) State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institution of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室(MAIS),自动化研究所,中国科学院) Zhongguancun Academy(中关村学院) State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 ChartAgent通过集成工具推理框架提升图表理解的鲁棒性与可追溯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13752 2025-12-17 cs.CV cs.AI 70%

STAR: STacked AutoRegressive Scheme for Unified Multimodal Learning

STAR:用于统一多模态学习的堆叠自回归方案

Jie Qin, Jiancheng Huang, Limeng Qiao, Lin Ma

机构 * Meituan Inc(美团公司)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 STAR通过堆叠自回归方案提升多模态生成性能,同时保持理解能力,实验验证其在统一多模态学习中的有效性。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11872 2025-12-17 cs.RO cs.AI cs.CV 70%

WAM-Diff: A Masked Diffusion VLA Framework with MoE and Online Reinforcement Learning for Autonomous Driving

WAM-Diff: 一种结合MoE和在线强化学习的掩码扩散VLA框架用于自动驾驶

Mingwang Xu, Jiahao Cui, Feipeng Cai, Hanlin Shang, Zhihao Zhu, Shan Luan, Yifang Xu, Neng Zhang, Yaoyi Li, Jia Cai, Siyu Zhu

机构 * Fudan University(复旦大学) Yinwang Intelligent Technology Co., Ltd(云网智能科技有限公司)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 WAM-Diff通过结合MoE和在线强化学习的掩码扩散框架,提升自动驾驶轨迹生成的性能与灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14442 2025-12-17 cs.CV cs.RO 67%

A4-Agent: An Agentic Framework for Zero-Shot Affordance Reasoning

A4-Agent: 一种用于零样本 affordance 推理的代理框架

Zixin Zhang, Kanghao Chen, Hanqing Wang, Hongfei Zhang, Harold Haodong Chen, Chenfei Liao, Litao Guo, Ying-Cong Chen

机构 * HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学) SJTU(上海交通大学) Knowin

专题命中 推理与问题求解 :language model(abstract);foundation model(abstract)

AI总结 A4-Agent 提出一种无需训练的代理框架,通过三个阶段的流水线实现零样本 affordance 推理,优于现有监督方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13573 2025-12-17 cs.CV 67%

MMhops-R1: Multimodal Multi-hop Reasoning

MMhops-R1: 多模态多跳推理

Tao Zhang, Ziqi Zhang, Zongyang Ma, Yuxin Chen, Bing Li, Chunfeng Yuan, Guangting Wang, Fengyun Rao, Ying Shan, Weiming Hu

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 MMhops-R1通过动态规划和多模态知识整合,提升多跳推理能力,提出新型mRAG框架并提供挑战性基准。

Comments Acceped by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13201 2025-12-17 cs.IR 67%

Cog-RAG: Cognitive-Inspired Dual-Hypergraph with Theme Alignment Retrieval-Augmented Generation

Cog-RAG: 基于认知的双超图主题对齐检索增强生成

Hao Hu, Yifan Feng, Ruoxue Li, Rundong Xue, Xingliang Hou, Zhiqiang Tian, Yue Gao, Shaoyi Du

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 Cog-RAG通过双超图结构和主题对齐策略,提升检索增强生成的语义对齐与生成一致性。

Comments Accepted by AAAI 2026 main conference

Journal ref AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07148 2025-12-17 cs.CV cs.AI cs.CL cs.LG 67%

MM-PoE: Multiple Choice Reasoning via. Process of Elimination using Multi-Modal Models

MM-PoE:通过多模态模型的排除过程进行多选推理

Sayak Chakrabarty, Souradip Pal

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MM-PoE通过多模态模型的排除过程提升视觉语言模型在多选推理任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14252 2025-12-17 cs.AI cs.LG 62%

Gödel's Poetry

哥德尔的诗歌

Kelly J. Davis

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种结合专用语言模型和递归分解技术的自动定理证明系统,显著提升了miniF2F的证明通过率。

Comments 24 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06112 2025-12-17 cs.RO cs.AI cs.CV 57%

WAM-Flow: Parallel Coarse-to-Fine Motion Planning via Discrete Flow Matching for Autonomous Driving

WAM-Flow:通过离散流匹配实现自动驾驶的并行粗到细路径规划

Yifang Xu, Jiahao Cui, Feipeng Cai, Zhihao Zhu, Hanlin Shang, Shan Luan, Mingwang Xu, Neng Zhang, Yaoyi Li, Jia Cai, Siyu Zhu

机构 * Fudan University(复旦大学) Yinwang Intelligent Technology Co., Ltd(英伟达智能科技有限公司)

专题命中 推理与问题求解 :pretraining(abstract);分类 cs.AI

AI总结 WAM-Flow通过离散流匹配实现自动驾驶的并行粗到细路径规划,结合几何感知目标和并行生成,提升闭环性能。

Comments 18 pages, 11 figures. Code & Model: https://github.com/fudan-generative-vision/WAM-Flow

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14312 2025-12-17 cs.CV cs.AI 57%

From YOLO to VLMs: Advancing Zero-Shot and Few-Shot Detection of Wastewater Treatment Plants Using Satellite Imagery in MENA Region

从YOLO到VLMs:利用卫星图像在中东和北非地区推进零样本和少样本废水处理厂检测

Akila Premarathna, Kanishka Hewageegana, Garcia Andarcia Mariangel

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 本研究利用VLMs替代YOLOv8,通过零样本和少样本方法高效识别中东和北非地区废水处理厂,提升遥感应用的可扩展性。

Comments 9 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏