arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-18 至 2025-12-18 共收录 138 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 21 篇

2312.09245 2025-12-18 cs.CV 89%

DriveMLM: Aligning Multi-Modal Large Language Models with Behavioral Planning States for Autonomous Driving

DriveMLM: 通过行为规划状态对齐多模态大语言模型以实现自动驾驶

Erfei Cui, Wenhai Wang, Zhiqi Li, Jiangwei Xie, Haoming Zou, Hanming Deng, Gen Luo, Lewei Lu, Xizhou Zhu, Jifeng Dai

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 DriveMLM通过多模态大语言模型对齐行为规划状态,提升自动驾驶系统的决策能力与闭环性能。

Comments Accepted to Visual Intelligence

Journal ref Visual Intelligence, Volume 3, article number 22, (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15663 2025-12-18 cs.AI cs.CL 88%

Explaining the Reasoning of Large Language Models Using Attribution Graphs

通过归因图解释大语言模型的推理过程

Chase Walker, Rickard Ewetz

机构 * University of Florida(佛罗里达大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 CAGE框架通过归因图解释大语言模型的推理过程,提升上下文归因的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05195 2025-12-18 cs.CE 88%

Using Large Language Models for Solving Thermodynamic Problems

利用大语言模型解决热力学问题

Rebecca Loubet, Pascal Zittlau, Luisa Vollmer, Marco Hoffmann, Sophie Fellenz, Fabian Jirasek, Heike Leitte, Hans Hasse

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 本文研究了大语言模型在解决热力学问题中的能力,发现其在简单问题上表现良好,但在复杂问题上存在理解不足和推理能力有限的问题,需进一步整合领域知识。

Comments This document is the unedited Author's version of a Submitted Work to Computers and Chemical Engineering. 19 pages, 2 figures, SI available (15 pages)

Journal ref Comput. Chem. Eng. 204 (2026) 109333

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15274 2025-12-18 cs.CL cs.AI 86%

Well Begun, Half Done: Reinforcement Learning with Prefix Optimization for LLM Reasoning

开篇即胜,半途而废:基于前缀优化的强化学习用于大语言模型推理

Yiliu Sun, Zicheng Zhao, Yang Wei, Yanfang Zhang, Chen Gong

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 PPPO通过优化LLM推理的前缀部分,提升推理能力,实验显示其在推理任务中表现更优。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15687 2025-12-18 cs.LG cs.AI 84%

Can LLMs Guide Their Own Exploration? Gradient-Guided Reinforcement Learning for LLM Reasoning

大语言模型能否引导自身探索?基于梯度引导的强化学习用于大语言模型推理

Zhenwen Liang, Sidi Lu, Wenhao Yu, Kishan Panaganti, Yujun Zhou, Haitao Mi, Dong Yu

机构 * Tencent AI Lab(腾讯AI实验室) University of Notre Dame(诺丁汉大学)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 G2RL通过利用模型自身的梯度几何特性,改进大语言模型的推理能力,优于传统探索方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15442 2025-12-18 cs.LG 79%

Copyright Infringement Risk Reduction via Chain-of-Thought and Task Instruction Prompting

通过链式推理和任务指令提示降低版权侵权风险

Neeraj Sarna, Yuanyuan Li, Michael von Gablenz

机构 * Munich RE(慕尼黑RE)

专题命中 推理与问题求解 :prompting(title,abstract);分类 cs.LG

AI总结 本文通过链式推理和任务指令提示结合负提示和提示重写,降低生成图像的版权侵权风险,并评估不同模型复杂度下的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10422 2025-12-18 cs.CL cs.AI 79%

Cooperative Retrieval-Augmented Generation for Question Answering: Mutual Information Exchange and Ranking by Contrasting Layers

协作检索增强生成用于问答:通过对比层进行互信息交换和排序

Youmin Ko, Sungjong Seo, Hyunjoon Kim

机构 * Department of Artificial Intelligence, Hanyang University(人工智能学院,翰阳大学) Department of Data Science, Hanyang University(数据科学学院,翰阳大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 CoopRAG通过协作检索与生成机制,提升问答任务中检索与生成的准确性。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15388 2025-12-18 cs.AI 77%

Bilateral Spatial Reasoning about Street Networks: Graph-based RAG with Qualitative Spatial Representations

双重视觉推理关于街道网络:基于图的RAG与定性空间表示

Reinhard Moratz, Niklas Daute, James Ondieki, Markus Kattenbeck, Mario Krajina, Ioannis Giannopoulos

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种基于图的RAG方法,利用定性空间表示提升LLM在行人导航中的路线指引能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11495 2025-12-18 cs.LG stat.ML 77%

How Reinforcement Learning After Next-Token Prediction Facilitates Learning

如何在生成下一个标记后使用强化学习促进学习

Nikolaos Tsilivis, Eran Malach, Karen Ullrich, Julia Kempe

机构 * New York University(纽约大学) Harvard University(哈佛大学) FAIR, Meta

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.LG

AI总结 通过在生成下一个标记后使用强化学习,研究了如何在推理任务中提升模型的学习能力,证明其在预测比特奇偶性等任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14235 2025-12-18 cs.CL 77%

Towards Robust Knowledge Representations in Multilingual LLMs for Equivalence and Inheritance based Consistent Reasoning

多语言大语言模型中基于等价与继承的稳健知识表示研究

Gaurav Arora, Srujana Merugu, Shreya Jain, Vaibhav Saxena

机构 * Amazon(亚马逊公司) IIT Jammu(印度理工学院贾姆鲁)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究通过引入多语言任务和基准,评估LLMs在等价和继承推理中的稳健性,并提出组合表示以提升跨语言一致性。

Journal ref NAACL 2025 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10532 2025-12-18 cs.LG cs.AI cs.CL 75%

Reasoning or Memorization? Unreliable Results of Reinforcement Learning Due to Data Contamination

推理还是记忆?由于数据污染导致强化学习不可靠的结果

Mingqi Wu, Zhihao Zhang, Qiaole Dong, Zhiheng Xi, Jun Zhao, Senjie Jin, Xiaoran Fan, Yuhao Zhou, Huijie Lv, Ming Zhang, Yanwei Fu, Qin Liu, Songyang Zhang, Qi Zhang

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文发现Qwen2.5系列模型易受数据污染影响,通过生成清洁算术问题验证了准确奖励信号对数学推理性能的提升作用

Comments 28 pages, AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15219 2025-12-18 cs.CL cs.AI 73%

RFKG-CoT: Relation-Driven Adaptive Hop-count Selection and Few-Shot Path Guidance for Knowledge-Aware QA

RFKG-CoT: 基于关系的自适应步数选择与少样本路径引导用于知识感知问答

Chao Zhang, Minghan Li, Tianrui Lv, Guodong Zhou

机构 * Chao Zhang, Minghan Li, Tianrui Lv, Guodong Zhou(张超,李明翰,吕天睿,周国栋)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 RFKG-CoT通过关系驱动的自适应步数选择和少样本路径引导,提升知识感知问答的准确性与可靠性。

Comments 9pages, 5 figures, accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14766 2025-12-18 cs.AI cs.LG 73%

GR-Agent: Adaptive Graph Reasoning Agent under Incomplete Knowledge

GR-Agent: 在不完整知识图谱下适应性图推理代理

Dongzhuoran Zhou, Yuqicheng Zhu, Xiaxia Wang, Hongkuan Zhou, Jiaoyan Chen, Steffen Staab, Yuan He, Evgeny Kharlamov

机构 * University of Oslo(奥斯陆大学) Bosch Center for AI(博世人工智能中心) University of Stuttgart(斯图加特大学) University of Oxford(牛津大学) Amazon(亚马逊) The University of Manchester(曼彻斯特大学) University of Southampton(南安普顿大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 GR-Agent通过构建交互环境并利用图推理工具,在不完整知识图谱中实现更有效的推理,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14709 2025-12-18 cs.AI cs.LG 66%

Attention as Binding: A Vector-Symbolic Perspective on Transformer Reasoning

注意力作为绑定:一种向量符号视角下的Transformer推理

Sahil Rajesh Dhayalkar

机构 * Sahil Rajesh Dhayalkar(独立研究者)

专题命中 推理与问题求解 :language model(abstract,comments);分类 cs.AI、cs.LG

AI总结 本文提出将Transformer的注意力机制视为软向量符号计算,通过向量符号架构视角解释其推理行为,并提出改进架构和训练目标以提升逻辑可靠性和可解释性。

Comments 12 pages with references. Submitted to 'Logical and Symbolic Reasoning in Language Models @ AAAI 2026' conference and is under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14725 2025-12-18 cs.LG cs.AI 62%

Generative Urban Flow Modeling: From Geometry to Airflow with Graph Diffusion

生成性城市风场建模:从几何到气流的图扩散

Francisco Giral, Álvaro Manzano, Ignacio Gómez, Petros Koumoutsakos, Soledad Le Clainche

机构 * Applied Mathematics Department, ETSIAE-School of Aeronautics, Universidad Politécnica de Madrid(应用数学系、ETSIAE航空学院、马德里理工大学) Microflown Technologies(Microflown技术公司) Computational Science and Engineering Laboratory, Harvard University(计算科学与工程实验室、哈佛大学)

专题命中 推理与问题求解 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于图扩散的生成模型,用于在非结构化网格上合成城市风场,通过结合层次图神经网络和分数扩散建模,实现对复杂几何形状的高效风场模拟与预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14691 2025-12-18 cs.CL cs.CV 57%

MMGR: Multi-Modal Generative Reasoning

MMGR:多模态生成推理

Zefan Cai, Haoyi Qiu, Tianyi Ma, Haozhe Zhao, Gengze Zhou, Kung-Hsiang Huang, Parisa Kordjamshidi, Minjia Zhang, Wen Xiao, Jiuxiang Gu, Nanyun Peng, Junjie Hu

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of California, Los Angeles(加州大学洛杉矶分校) Michigan State University(密歇根州立大学) University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Adelaide(阿德莱德大学) Salesforce AI Research(Salesforce人工智能研究) Microsoft(微软) Adobe Research(Adobe研究)

专题命中 推理与问题求解 :foundation model(abstract);分类 cs.CL

AI总结 MMGR提出一个多模态生成推理评估框架,通过物理、逻辑、空间和时间五个能力评估视频和图像生成模型,揭示其在抽象推理和具身导航中的性能不足。

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15042 2025-12-18 cs.CL cs.IR 57%

DASH: Dialogue-Aware Similarity and Handshake Recognition for Topic Segmentation in Public-Channel Conversations

DASH:对话感知相似性与握手识别用于公共频道对话中的主题分割

Sijin Sun, Liangbin Zhao, Ming Deng, Xiuju Fu

专题命中 推理与问题求解 :LLM(abstract);分类 cs.CL

AI总结 DASH-DTS通过对话感知相似性与握手识别技术,提升公共频道对话中主题分割的准确性和鲁棒性,并发布首个海上VHF通信数据集推动相关研究。

Comments Accepted by AAAIW2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14744 2025-12-18 q-fin.CP cs.AI 57%

VERAFI: Verified Agentic Financial Intelligence through Neurosymbolic Policy Generation

VERAFI:通过神经符号策略生成实现验证的代理金融智能

Adewale Akinfaderin, Shreyas Subramanian

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 VERAFI通过神经符号策略生成实现验证的代理金融智能,显著提升金融领域事实正确性与合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09677 2025-12-18 cs.CV cs.AI 57%

Benchmarking Gaslighting Negation Attacks Against Reasoning Models

对抗性否定攻击下推理模型的基准测试

Bin Zhu, Hailong Yin, Jingjing Chen, Yu-Gang Jiang

机构 * Singapore Management University, Singapore College of Computer Science(新加坡国立管理学院计算机科学学院) Artificial Intelligence, Fudan University, China(人工智能,复旦大学)

专题命中 推理与问题求解 :prompting(abstract);分类 cs.AI

AI总结 本文评估了三种顶级推理模型在对抗性否定攻击下的表现,发现其准确率显著下降,并提出了GaslightingBench-R基准以进一步研究模型对这类攻击的防御能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14884 2025-12-18 cs.CV 50%

Vibe Spaces for Creatively Connecting and Expressing Visual Concepts

通过 vibe 空间创造性连接和表达视觉概念

Huzheng Yang, Katherine Xu, Andrew Lu, Michael D. Grossberg, Yutong Bai, Jianbo Shi

机构 * UPenn(宾夕法尼亚大学) CUNY(纽约大学) UC Berkeley(加州大学伯克利分校)

专题命中 推理与问题求解 :LLM(abstract)

AI总结 Vibe Space 通过学习低维测地线实现视觉概念的创造性连接与表达,生成更具创造性和连贯性的混合体。

Comments Project page: https://huzeyann.github.io/VibeSpace-webpage/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 28 篇

2512.15033 2025-12-18 cs.AI 88%

Beyond Accuracy: A Geometric Stability Analysis of Large Language Models in Chess Evaluation

超越准确性:大型语言模型在国际象棋评估中的几何稳定性分析

Xidan Song, Weiqi Wang, Ruifeng Cao, Qingya Hu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出几何稳定性框架,用于评估大型语言模型在国际象棋评估中的几何推理能力,揭示了模型在几何变换下的稳定性差异及性能悖论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13857 2025-12-18 cs.AI cs.CL cs.LG cs.MA cs.NE 87%

EvoLattice: Persistent Internal-Population Evolution through Multi-Alternative Quality-Diversity Graph Representations for LLM-Guided Program Discovery

EvoLattice: 通过多替代质量-多样性图表示实现持久内部种群进化以指导LLM引导的程序发现

Kamer Ali Yuksel

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 EvoLattice通过多替代质量-多样性图表示实现持久内部种群进化,提升LLM引导程序发现的稳定性、表达力和改进轨迹

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15617 2025-12-18 cs.CL cs.AI 86%

Evaluating Metrics for Safety with LLM-as-Judges

用LLM作为裁判评估安全度的指标

Kester Clegg, Richard Hawkins, Ibrahim Habli, Tom Lawton

机构 * Centre for Assuring Autonomy, University of York(自主性保障中心、约克大学) Bradford Royal Infirmary(布拉德福德皇家医院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过加权指标和置信度阈值来提升LLM作为裁判在关键信息流中的安全性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14720 2025-12-18 cs.SI cs.AI cs.CL 86%

SoMe: A Realistic Benchmark for LLM-based Social Media Agents

SoMe:一种用于基于大语言模型的社会媒体代理的现实基准

Dizhan Xue, Jing Cui, Shengsheng Qian, Chuanrui Hu, Changsheng Xu

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 SoMe是一个用于评估基于大语言模型的社会媒体代理能力的现实基准,通过多样化任务和大量数据揭示了现有LLM在处理社交媒体任务中的局限性。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14285 2025-12-18 cs.CR cs.LG 85%

A Multi-Agent LLM Defense Pipeline Against Prompt Injection Attacks

针对提示注入攻击的多智能体LLM防御管道

S M Asif Hossain, Ruksat Khan Shayoni, Mohd Ruhul Ameen, Akif Islam, M. F. Mridha, Jungpil Shin

机构 * School of Computing, Wichita State University, Kansas, USA(威斯康星州立大学计算机学院) College of Engineering and Computer Sciences, Marshall University, Huntington, WV, USA(马歇尔大学工程与计算机科学学院) Department of Computer Science and Engineering, University of Rajshahi, Bangladesh(拉贾沙希大学计算机科学与工程系) Department of Computer Science and Engineering, American International University-Bangladesh, Dhaka, Bangladesh(美国国际大学-孟加拉国计算机科学与工程系) School of Computer Science and Engineering, The University of Aizu, Aizuwakamatsu, Japan(立命馆大学计算机科学与工程学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出了一种多智能体防御框架,通过协调的LLM代理实时检测并中和提示注入攻击,显著提升了安全性和系统功能。

Comments Accepted at the 11th IEEE WIECON-ECE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20764 2025-12-18 cs.CL 85%

Feel the Difference? A Comparative Analysis of Emotional Arcs in Real and LLM-Generated CBT Sessions

感知差异?真实与LLM生成CBT对话中情感弧的比较分析

Xiaoyi Wang, Jiwei Zhang, Guangtao Zhang, Honglei Guo

机构 * Department of Computer Science, Shantou University(汕头大学计算机科学系) Department of Automation, Tsinghua University(清华大学自动化系) BNRIST, Tsinghua University(清华大学脑科学与类脑智能研究院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究通过比较真实与LLM生成的CBT对话,揭示了合成对话在情感动态上的不足,强调了情感真实性的关键作用。

Comments Accepted at 2025 EMNLP findings,19 page,2 figures

Journal ref In Findings of the Association for Computational Linguistics: EMNLP 2025, pages 19999-20017

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14846 2025-12-18 cs.CR cs.AI 85%

MALCDF: A Distributed Multi-Agent LLM Framework for Real-Time Cyber

MALCDF: 一种用于实时网络防御的分布式多智能体大语言模型框架

Arth Bhardwaj, Sia Godika, Yuvam Loonker

机构 * Saint Francis High School(圣弗朗西斯高中) Massachusetts Institute of Technology(麻省理工学院) JBCN International School(JBCN国际学校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 MALCDF通过协调多个LLM智能体实现高准确率的实时网络防御,优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15363 2025-12-18 cs.DB 83%

Revisiting Task-Oriented Dataset Search in the Era of Large Language Models: Challenges, Benchmark, and Solution

重新审视大语言模型时代任务导向型数据集搜索:挑战、基准测试与解决方案

Zixin Wei, Yucan Guo, Jinyang Li, Xiaolin Han, Xiaolong Jin, Chenhao Ma

专题命中 评测与基准 :large language model(title);language model(title)

AI总结 KATS通过构建任务-数据集知识图和混合查询引擎,解决任务导向型数据集搜索中的挑战,并通过CS-TDS基准测试展示其优越性。

Comments Accepted to Proc. VLDB Endow. (PVLDB), Vol. 19. 14 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14706 2025-12-18 cs.LG cs.AI cs.CL cs.CV 82%

LLM as a Neural Architect: Controlled Generation of Image Captioning Models Under Strict API Contracts

将LLM作为神经架构:在严格API合同下控制生成图像描述模型

Krunal Jesani, Dmitry Ignatov, Radu Timofte

机构 * Computer Vision Lab, CAIDAS & IFI, University of Würzburg, Germany(计算机视觉实验室、CAIDAS与IFI、乌尔姆大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种基于LLM的神经架构搜索方法,通过生成可运行的图像描述模型,展示了LLM在架构设计和超参数优化中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01899 2025-12-18 cs.LG cs.AI cs.HC 81%

Multimodal Foundation Models for Early Disease Detection

多模态基础模型用于早期疾病检测

Md Talha Mohsin, Ismail Abdulrashid

机构 * The University of Tulsa(塔尔萨大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种多模态基础模型,通过整合电子病历、医学影像、基因组学和可穿戴传感器数据,提升早期疾病检测的准确性和鲁棒性。

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏