arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-18 至 2025-12-18 共收录 21 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 21 篇

2512.14989 2025-12-18 cs.CL cs.AI cs.CV 90%

Evaluating Large Language Models on Multimodal Chemistry Olympiad Exams

评估大型语言模型在多模态化学奥林匹克考试中的表现

Yiming Cui, Xin Yao, Yuxuan Qin, Xin Li, Shijin Wang, Guoping Hu

机构 * State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) iFLYTEK AI Research(iFLYTEK人工智能研究院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文评估了多种多模态LLM在化学奥林匹克考试中的表现,发现其在多模态融合和科学推理方面存在显著局限,提出通过链式思维提示提升模型性能的方法。

Comments Published at Communications Chemistry

Journal ref Commun. Chem. 8 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.09245 2025-12-18 cs.CV 89%

DriveMLM: Aligning Multi-Modal Large Language Models with Behavioral Planning States for Autonomous Driving

DriveMLM: 通过行为规划状态对齐多模态大语言模型以实现自动驾驶

Erfei Cui, Wenhai Wang, Zhiqi Li, Jiangwei Xie, Haoming Zou, Hanming Deng, Gen Luo, Lewei Lu, Xizhou Zhu, Jifeng Dai

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 DriveMLM通过多模态大语言模型对齐行为规划状态,提升自动驾驶系统的决策能力与闭环性能。

Comments Accepted to Visual Intelligence

Journal ref Visual Intelligence, Volume 3, article number 22, (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15663 2025-12-18 cs.AI cs.CL 88%

Explaining the Reasoning of Large Language Models Using Attribution Graphs

通过归因图解释大语言模型的推理过程

Chase Walker, Rickard Ewetz

机构 * University of Florida(佛罗里达大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 CAGE框架通过归因图解释大语言模型的推理过程,提升上下文归因的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05195 2025-12-18 cs.CE 88%

Using Large Language Models for Solving Thermodynamic Problems

利用大语言模型解决热力学问题

Rebecca Loubet, Pascal Zittlau, Luisa Vollmer, Marco Hoffmann, Sophie Fellenz, Fabian Jirasek, Heike Leitte, Hans Hasse

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 本文研究了大语言模型在解决热力学问题中的能力,发现其在简单问题上表现良好,但在复杂问题上存在理解不足和推理能力有限的问题,需进一步整合领域知识。

Comments This document is the unedited Author's version of a Submitted Work to Computers and Chemical Engineering. 19 pages, 2 figures, SI available (15 pages)

Journal ref Comput. Chem. Eng. 204 (2026) 109333

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15274 2025-12-18 cs.CL cs.AI 86%

Well Begun, Half Done: Reinforcement Learning with Prefix Optimization for LLM Reasoning

开篇即胜,半途而废:基于前缀优化的强化学习用于大语言模型推理

Yiliu Sun, Zicheng Zhao, Yang Wei, Yanfang Zhang, Chen Gong

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 PPPO通过优化LLM推理的前缀部分,提升推理能力,实验显示其在推理任务中表现更优。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15687 2025-12-18 cs.LG cs.AI 84%

Can LLMs Guide Their Own Exploration? Gradient-Guided Reinforcement Learning for LLM Reasoning

大语言模型能否引导自身探索?基于梯度引导的强化学习用于大语言模型推理

Zhenwen Liang, Sidi Lu, Wenhao Yu, Kishan Panaganti, Yujun Zhou, Haitao Mi, Dong Yu

机构 * Tencent AI Lab(腾讯AI实验室) University of Notre Dame(诺丁汉大学)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 G2RL通过利用模型自身的梯度几何特性,改进大语言模型的推理能力,优于传统探索方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15442 2025-12-18 cs.LG 79%

Copyright Infringement Risk Reduction via Chain-of-Thought and Task Instruction Prompting

通过链式推理和任务指令提示降低版权侵权风险

Neeraj Sarna, Yuanyuan Li, Michael von Gablenz

机构 * Munich RE(慕尼黑RE)

专题命中 推理与问题求解 :prompting(title,abstract);分类 cs.LG

AI总结 本文通过链式推理和任务指令提示结合负提示和提示重写,降低生成图像的版权侵权风险,并评估不同模型复杂度下的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10422 2025-12-18 cs.CL cs.AI 79%

Cooperative Retrieval-Augmented Generation for Question Answering: Mutual Information Exchange and Ranking by Contrasting Layers

协作检索增强生成用于问答:通过对比层进行互信息交换和排序

Youmin Ko, Sungjong Seo, Hyunjoon Kim

机构 * Department of Artificial Intelligence, Hanyang University(人工智能学院,翰阳大学) Department of Data Science, Hanyang University(数据科学学院,翰阳大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 CoopRAG通过协作检索与生成机制,提升问答任务中检索与生成的准确性。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15388 2025-12-18 cs.AI 77%

Bilateral Spatial Reasoning about Street Networks: Graph-based RAG with Qualitative Spatial Representations

双重视觉推理关于街道网络:基于图的RAG与定性空间表示

Reinhard Moratz, Niklas Daute, James Ondieki, Markus Kattenbeck, Mario Krajina, Ioannis Giannopoulos

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种基于图的RAG方法,利用定性空间表示提升LLM在行人导航中的路线指引能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11495 2025-12-18 cs.LG stat.ML 77%

How Reinforcement Learning After Next-Token Prediction Facilitates Learning

如何在生成下一个标记后使用强化学习促进学习

Nikolaos Tsilivis, Eran Malach, Karen Ullrich, Julia Kempe

机构 * New York University(纽约大学) Harvard University(哈佛大学) FAIR, Meta

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.LG

AI总结 通过在生成下一个标记后使用强化学习,研究了如何在推理任务中提升模型的学习能力,证明其在预测比特奇偶性等任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14235 2025-12-18 cs.CL 77%

Towards Robust Knowledge Representations in Multilingual LLMs for Equivalence and Inheritance based Consistent Reasoning

多语言大语言模型中基于等价与继承的稳健知识表示研究

Gaurav Arora, Srujana Merugu, Shreya Jain, Vaibhav Saxena

机构 * Amazon(亚马逊公司) IIT Jammu(印度理工学院贾姆鲁)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究通过引入多语言任务和基准,评估LLMs在等价和继承推理中的稳健性,并提出组合表示以提升跨语言一致性。

Journal ref NAACL 2025 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10532 2025-12-18 cs.LG cs.AI cs.CL 75%

Reasoning or Memorization? Unreliable Results of Reinforcement Learning Due to Data Contamination

推理还是记忆?由于数据污染导致强化学习不可靠的结果

Mingqi Wu, Zhihao Zhang, Qiaole Dong, Zhiheng Xi, Jun Zhao, Senjie Jin, Xiaoran Fan, Yuhao Zhou, Huijie Lv, Ming Zhang, Yanwei Fu, Qin Liu, Songyang Zhang, Qi Zhang

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文发现Qwen2.5系列模型易受数据污染影响,通过生成清洁算术问题验证了准确奖励信号对数学推理性能的提升作用

Comments 28 pages, AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15219 2025-12-18 cs.CL cs.AI 73%

RFKG-CoT: Relation-Driven Adaptive Hop-count Selection and Few-Shot Path Guidance for Knowledge-Aware QA

RFKG-CoT: 基于关系的自适应步数选择与少样本路径引导用于知识感知问答

Chao Zhang, Minghan Li, Tianrui Lv, Guodong Zhou

机构 * Chao Zhang, Minghan Li, Tianrui Lv, Guodong Zhou(张超,李明翰,吕天睿,周国栋)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 RFKG-CoT通过关系驱动的自适应步数选择和少样本路径引导,提升知识感知问答的准确性与可靠性。

Comments 9pages, 5 figures, accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14766 2025-12-18 cs.AI cs.LG 73%

GR-Agent: Adaptive Graph Reasoning Agent under Incomplete Knowledge

GR-Agent: 在不完整知识图谱下适应性图推理代理

Dongzhuoran Zhou, Yuqicheng Zhu, Xiaxia Wang, Hongkuan Zhou, Jiaoyan Chen, Steffen Staab, Yuan He, Evgeny Kharlamov

机构 * University of Oslo(奥斯陆大学) Bosch Center for AI(博世人工智能中心) University of Stuttgart(斯图加特大学) University of Oxford(牛津大学) Amazon(亚马逊) The University of Manchester(曼彻斯特大学) University of Southampton(南安普顿大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 GR-Agent通过构建交互环境并利用图推理工具,在不完整知识图谱中实现更有效的推理,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14709 2025-12-18 cs.AI cs.LG 66%

Attention as Binding: A Vector-Symbolic Perspective on Transformer Reasoning

注意力作为绑定:一种向量符号视角下的Transformer推理

Sahil Rajesh Dhayalkar

机构 * Sahil Rajesh Dhayalkar(独立研究者)

专题命中 推理与问题求解 :language model(abstract,comments);分类 cs.AI、cs.LG

AI总结 本文提出将Transformer的注意力机制视为软向量符号计算,通过向量符号架构视角解释其推理行为,并提出改进架构和训练目标以提升逻辑可靠性和可解释性。

Comments 12 pages with references. Submitted to 'Logical and Symbolic Reasoning in Language Models @ AAAI 2026' conference and is under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14725 2025-12-18 cs.LG cs.AI 62%

Generative Urban Flow Modeling: From Geometry to Airflow with Graph Diffusion

生成性城市风场建模:从几何到气流的图扩散

Francisco Giral, Álvaro Manzano, Ignacio Gómez, Petros Koumoutsakos, Soledad Le Clainche

机构 * Applied Mathematics Department, ETSIAE-School of Aeronautics, Universidad Politécnica de Madrid(应用数学系、ETSIAE航空学院、马德里理工大学) Microflown Technologies(Microflown技术公司) Computational Science and Engineering Laboratory, Harvard University(计算科学与工程实验室、哈佛大学)

专题命中 推理与问题求解 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于图扩散的生成模型,用于在非结构化网格上合成城市风场,通过结合层次图神经网络和分数扩散建模,实现对复杂几何形状的高效风场模拟与预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14691 2025-12-18 cs.CL cs.CV 57%

MMGR: Multi-Modal Generative Reasoning

MMGR:多模态生成推理

Zefan Cai, Haoyi Qiu, Tianyi Ma, Haozhe Zhao, Gengze Zhou, Kung-Hsiang Huang, Parisa Kordjamshidi, Minjia Zhang, Wen Xiao, Jiuxiang Gu, Nanyun Peng, Junjie Hu

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of California, Los Angeles(加州大学洛杉矶分校) Michigan State University(密歇根州立大学) University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Adelaide(阿德莱德大学) Salesforce AI Research(Salesforce人工智能研究) Microsoft(微软) Adobe Research(Adobe研究)

专题命中 推理与问题求解 :foundation model(abstract);分类 cs.CL

AI总结 MMGR提出一个多模态生成推理评估框架,通过物理、逻辑、空间和时间五个能力评估视频和图像生成模型,揭示其在抽象推理和具身导航中的性能不足。

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15042 2025-12-18 cs.CL cs.IR 57%

DASH: Dialogue-Aware Similarity and Handshake Recognition for Topic Segmentation in Public-Channel Conversations

DASH:对话感知相似性与握手识别用于公共频道对话中的主题分割

Sijin Sun, Liangbin Zhao, Ming Deng, Xiuju Fu

专题命中 推理与问题求解 :LLM(abstract);分类 cs.CL

AI总结 DASH-DTS通过对话感知相似性与握手识别技术,提升公共频道对话中主题分割的准确性和鲁棒性,并发布首个海上VHF通信数据集推动相关研究。

Comments Accepted by AAAIW2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14744 2025-12-18 q-fin.CP cs.AI 57%

VERAFI: Verified Agentic Financial Intelligence through Neurosymbolic Policy Generation

VERAFI:通过神经符号策略生成实现验证的代理金融智能

Adewale Akinfaderin, Shreyas Subramanian

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 VERAFI通过神经符号策略生成实现验证的代理金融智能,显著提升金融领域事实正确性与合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09677 2025-12-18 cs.CV cs.AI 57%

Benchmarking Gaslighting Negation Attacks Against Reasoning Models

对抗性否定攻击下推理模型的基准测试

Bin Zhu, Hailong Yin, Jingjing Chen, Yu-Gang Jiang

机构 * Singapore Management University, Singapore College of Computer Science(新加坡国立管理学院计算机科学学院) Artificial Intelligence, Fudan University, China(人工智能,复旦大学)

专题命中 推理与问题求解 :prompting(abstract);分类 cs.AI

AI总结 本文评估了三种顶级推理模型在对抗性否定攻击下的表现,发现其准确率显著下降,并提出了GaslightingBench-R基准以进一步研究模型对这类攻击的防御能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14884 2025-12-18 cs.CV 50%

Vibe Spaces for Creatively Connecting and Expressing Visual Concepts

通过 vibe 空间创造性连接和表达视觉概念

Huzheng Yang, Katherine Xu, Andrew Lu, Michael D. Grossberg, Yutong Bai, Jianbo Shi

机构 * UPenn(宾夕法尼亚大学) CUNY(纽约大学) UC Berkeley(加州大学伯克利分校)

专题命中 推理与问题求解 :LLM(abstract)

AI总结 Vibe Space 通过学习低维测地线实现视觉概念的创造性连接与表达,生成更具创造性和连贯性的混合体。

Comments Project page: https://huzeyann.github.io/VibeSpace-webpage/

详情

展开后加载摘要…

URL PDF HTML 收藏