arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-11-27 至 2025-11-27 共收录 29 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 29 篇

2511.20656 2025-11-27 cs.HC cs.AI 92%

Context-Aware Visual Prompting: Automating Geospatial Web Dashboards with Large Language Models and Agent Self-Validation for Decision Support

基于上下文的视觉提示:利用大语言模型和代理自我验证自动化地理空间网络看板

Haowen Xu, Jose Tupayachi, Xiao-Ying Yu

机构 * Computational Urban Sciences Group, Oak Ridge National Laboratory(计算城市科学组,橡树岭国家实验室) Materials Science and Technology Division, Oak Ridge National Laboratory(材料科学与技术 division,橡树岭国家实验室) Industrial and Systems Engineering, The University of Tennessee, Knoxville(工业与系统工程,田纳西大学, Knoxville)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);LLM(abstract)

AI总结 本文提出基于大语言模型和代理自我验证的地理空间看板自动化框架,通过上下文感知视觉提示提升风险分析和决策支持的可视化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07858 2025-11-27 cs.AI cs.LG 90%

Augur: Modeling Covariate Causal Associations in Time Series via Large Language Models

Augur:通过大型语言模型建模时间序列中的协变量因果关联

Zhiqing Cui, Binwu Wang, Qingxiang Liu, Yeqiang Wang, Zhengyang Zhou, Yuxuan Liang, Yang Wang

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 Augur通过大型语言模型建模时间序列中的协变量因果关联,提升预测准确性并实现透明的因果推理。

Comments 24 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21591 2025-11-27 cs.AI 89%

On the Limits of Innate Planning in Large Language Models

大语言模型中内生规划的极限

Charles Schepanowski, Charles Ling

机构 * Western University(温斯洛大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.AI

AI总结 研究发现大语言模型在无外部工具的情况下,规划和状态推理能力有限,主要问题在于内部状态表示脆弱和启发式规划能力不足。

Comments 33 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20471 2025-11-27 cs.AI 89%

Universe of Thoughts: Enabling Creative Reasoning with Large Language Models

思想宇宙:通过大语言模型实现创造性推理

Yuto Suzuki, Farnoush Banaei-Kashani

机构 * Department of Computer Science and Engineering University of Colorado Denver(计算机科学与工程系科罗拉多大学丹佛分校)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.AI

AI总结 通过引入思想宇宙框架,UoT提出了三种创造性推理范式,以提升大语言模型在复杂问题中的创造性解决能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12398 2025-11-27 cs.CR cs.AI cs.CL 88%

Where to Start Alignment? Diffusion Large Language Model May Demand a Distinct Position

对齐何处开始?扩散大语言模型可能需要不同的位置

Zhixin Xie, Xurui Song, Jun Luo

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出MOSA方法,通过强化学习对齐dLLM中间生成与安全拒绝,提升安全性。

Comments Accepted for oral presentation at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20726 2025-11-27 cs.LG cs.AI 86%

Learning from Risk: LLM-Guided Generation of Safety-Critical Scenarios with Prior Knowledge

从风险学习:利用先验知识的LLM引导的安全关键场景生成

Yuhang Wang, Heye Huang, Zhenhua Xu, Kailai Sun, Baoshen Guo, Jinhua Zhao

机构 * Chinese Academy of Sciences, China(中国科学院) Department of Urban Studies and Planning, Massachusetts Institute of Technology, USA(麻省理工学院城市研究与规划系) School of Vehicle and Mobility, Tsinghua University, China(清华大学车辆与移动系统学院)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出利用LLM和CVAE生成安全关键场景的方法,通过知识驱动优化提升自动驾驶系统在罕见高风险事件下的鲁棒性与可控性。

Comments 24 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19933 2025-11-27 cs.AI 85%

Failure Modes in LLM Systems: A System-Level Taxonomy for Reliable AI Applications

LLM系统中的故障模式:可靠AI应用的系统级分类

Vaishali Vinay

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出LLM系统中十五种隐含故障模式的分类,分析评估与监控的差距,并提出构建可靠、可维护且成本敏感的LLM系统的设计原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08532 2025-11-27 cs.AI 85%

Safe and Economical UAV Trajectory Planning in Low-Altitude Airspace: A Hybrid DRL-LLM Approach with Compliance Awareness

低空经济环境下安全且经济的无人机轨迹规划:一种融合DRL与LLM的混合方法与合规意识

Yanwei Gong, Junchao Fan, Ruichen Zhang, Dusit Niyato, Yingying Yao, Xiaolin Chang

机构 * Beijing Key Laboratory of Security and Privacy in Intelligent Transportation, Beijing Jiaotong University, P.R. China(北京智能交通安全与隐私北京市重点实验室,北京交通大学,中国) School of Computer Science and Engineering, Nanyang Technological University, Singapore(计算机科学与工程学院,南洋理工大学,新加坡)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种融合深度强化学习与大型语言模型的无人机轨迹规划方法,以实现安全、合规且经济的路径规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20680 2025-11-27 cs.CL cs.AI 84%

Cognitive bias in LLM reasoning compromises interpretation of clinical oncology notes

大语言模型的认知偏差影响临床肿瘤学笔记的解读

Matthew W. Kenaston, Umair Ayub, Mihir Parmar, Muhammad Umair Anjum, Syed Arsalan Ahmed Naqvi, Priya Kumar, Samarth Rawal, Aadel A. Chaudhuri, Yousef Zakharia, Elizabeth I. Heath, Tanios S. Bekaii-Saab, Cui Tao, Eliezer M. Van Allen, Ben Zhou, YooJung Choi, Chitta Baral, Irbaz Bin Riaz

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究揭示了大语言模型在肿瘤学笔记解读中因推理缺陷导致的临床安全隐患,并提出了一种可推广的推理错误分类框架。

Comments 24 pages, 6 figures, 1 supplementary figure, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20399 2025-11-27 cs.CL cs.AI 82%

BengaliFig: A Low-Resource Challenge for Figurative and Culturally Grounded Reasoning in Bengali

BengaliFig:一种低资源挑战,用于孟加拉语中的隐喻和文化相关推理

Abdullah Al Sefat

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 BengaliFig通过孟加拉语隐喻和文化相关推理的低资源挑战,评估LLM在文化特定推理中的表现,并推动包容性NLP评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20693 2025-11-27 cs.AI cs.MA 81%

$A^2Flow:$ Automating Agentic Workflow Generation via Self-Adaptive Abstraction Operators

$A^2Flow$:通过自适应抽象运算符自动化代理工作流生成

Mingming Zhao, Xiaokang Wei, Yuanqi Shao, Kaiwen Zhou, Lin Yang, Siwei Rao, Junhui Zhan, Zhitang Chen

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 $A^2Flow$通过自适应抽象运算符实现代理工作流的自动化生成,提升性能并降低资源消耗。

Comments Accepted by AAAI-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13380 2025-11-27 cs.CL cs.IR cs.LG 79%

The Structure-Content Trade-off in Knowledge Graph Retrieval

知识图谱检索中的结构与内容权衡

Valentin Six, Evan Dufraisse, Gaël de Chalendar

机构 * Université Paris-Saclay - CEA Palaiseau - France(巴黎-萨克雷大学-CEA帕莱索-法国)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了知识图谱检索中结构与内容的权衡,通过混合检索函数发现平衡两者可提升LLM的推理效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02890 2025-11-27 cs.CL cs.AI 79%

Reasoning Transfer for an Extremely Low-Resource and Endangered Language: Bridging Languages Through Sample-Efficient Language Understanding

为极低资源和濒危语言进行推理迁移:通过高效样本的语言理解连接语言

Khanh-Tung Tran, Barry O'Sullivan, Hoang D. Nguyen

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文提出英语引导的Co T训练方法,通过监督微调提升极低资源语言的推理能力,并发布首个爱尔兰语数学任务基准测试,展示多语言推理的可行路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21402 2025-11-27 cs.CL 77%

Text-to-SQL as Dual-State Reasoning: Integrating Adaptive Context and Progressive Generation

文本到SQL作为双状态推理:整合自适应上下文和渐进生成

Zhifeng Hao, Qibin Song, Ruichu Cai, Boyan Xu

机构 * School of Computer Science, Guangdong University of Technology(广东工业大学计算机科学学院) College of Science, Shantou University(汕头大学科学学院) Peng Cheng Laboratory(鹏城实验室)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL

AI总结 DSR-SQL通过双状态推理框架整合自适应上下文和渐进生成,提升文本到SQL的执行准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19516 2025-11-27 cs.CV 75%

Connecting the Dots: Training-Free Visual Grounding via Agentic Reasoning

连接点:通过代理推理实现无需训练的视觉接地

Liqin Luo, Guangyao Chen, Xiawu Zheng, Yongxing Dai, Yixiong Zou, Yonghong Tian

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 GroundingAgent通过代理推理实现无需微调的视觉接地,达到65.1%的零样本准确率,并在选择阶段实现90%的准确率,展示了LLM推理能力的重要性。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20795 2025-11-27 cs.CV cs.AI 74%

Revisiting KRISP: A Lightweight Reproduction and Analysis of Knowledge-Enhanced Vision-Language Models

重新审视 KRISP:一种轻量级的知识增强视觉-语言模型的再现与分析

Souradeep Dutta, Keshav Bulia, Neena S Nair

机构 * Centre For Digital Health(数字健康中心) Indian Institute of Technology Bombay(孟买印度理工学院) Department of Metallurgical engineering & Material science(冶金工程与材料科学系) Department of Bioscience & Bioengineering(生物科学与生物工程系)

专题命中 推理与问题求解 :language model(title);分类 cs.AI

AI总结 本研究重新审视 KRISP,通过轻量级模型揭示知识增强 VQA 的设计缺陷与资源受限下的有效性。

Comments 7 pages , 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21610 2025-11-27 cs.CL 70%

Auxiliary Metrics Help Decoding Skill Neurons in the Wild

辅助度量帮助解码野生中的技能神经元

Yixiu Zhao, Xiaozhi Wang, Zijun Yao, Lei Hou, Juanzi Li

机构 * Tsinghua University(清华大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出一种方法,通过辅助度量解码技能神经元,验证了其在多种任务中的有效性。

Comments 7 pages, 7 figures. Includes additional appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21581 2025-11-27 cs.LG 70%

Learning When to Stop: Adaptive Latent Reasoning via Reinforcement Learning

学习何时停止:通过强化学习实现自适应潜在推理

Alex Ning, Yen-Ling Kuo, Gabe Gomes

机构 * University of Virginia(弗吉尼亚大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理与问题求解 :language model(abstract);SFT(abstract);分类 cs.LG

AI总结 本文提出通过强化学习优化潜在推理长度,实现更高效的推理压缩,实验显示推理长度减少52%且准确性无损失。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21185 2025-11-27 cs.CV cs.AI 70%

Progress by Pieces: Test-Time Scaling for Autoregressive Image Generation

分块进展:用于自回归图像生成的测试时扩展

Joonhyung Park, Hyeongwon Jang, Joowon Kim, Eunho Yang

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 GridAR通过网格分区逐步生成和布局指定提示重述策略,在有限测试时扩展下提升视觉自回归模型的生成质量与编辑效果。

Comments Project page: https://grid-ar.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20677 2025-11-27 cs.CL cs.DB 70%

Prompt Engineering Techniques for Context-dependent Text-to-SQL in Arabic

针对阿拉伯语上下文依赖文本到SQL的提示工程技术

Saleh Almohaimeed, May Alsofyani, Saad Almohaimeed, Mansour Al Ghanim, Liqiang Wang

机构 * Department of Computer Science University of Central Florida Orlando, Florida, USA(计算机科学系 佛罗里达中央大学 奥兰多分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出Ar-SParC数据集及GAT corrector方法,通过提示工程技术提升阿拉伯语文本到SQL任务的性能。

Comments Accepted at IJCNN 2025 (to appear in IEEE/IJCNN proceedings). This arXiv submission corresponds to the camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18955 2025-11-27 cs.AI cs.CR cs.SE 70%

Co-PatcheR: Collaborative Software Patching with Component(s)-specific Small Reasoning Models

Co-PatcheR: 基于组件特定小推理模型的协作软件修补

Yuheng Tang, Hongwei Li, Kaijie Zhu, Michael Yang, Yangruibo Ding, Wenbo Guo

机构 * University of California, Santa Barbara(加州大学圣芭芭拉分校) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Co-PatcheR通过组件特定的小推理模型实现协作软件修补,提升修补效率并减少训练资源消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00396 2025-11-27 cs.CV 67%

Saliency-R1: Incentivizing Unified Saliency Reasoning Capability in MLLM with Confidence-Guided Reinforcement Learning

Saliency-R1: 通过置信度引导的强化学习激励多模态大语言模型统一的显著性推理能力

Long Li, Shuichen Ji, Ziyang Luo, Zhihui Li, Dingwen Zhang, Junwei Han, Nian Liu

机构 * Northwestern Polytechnical University(西北工业大学) University of Science and Technology of China(中国科学技术大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 Saliency-R1通过置信度引导的强化学习,提升多模态大语言模型在显著性推理任务中的统一能力,实现显著物体检测、显著实例分割和共显著物体检测的高效处理。

Comments Main text (excluding references): 8 pages, 4 figures; Supplementary Materials (excluding references): 9 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20701 2025-11-27 cs.AI cs.LG 62%

Cross Domain Evaluation of Multimodal Chain-of-Thought Reasoning of different datasets into the Amazon CoT Framework

跨领域评估不同数据集的多模态链式推理在Amazon CoT框架中的表现

Nitya Tiwari, Parv Maheshwari, Vidisha Agarwal

机构 * Indian Institute of Technology Bombay(印度理工学院孟买学院)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文评估了多模态链式推理在不同数据集上的表现,发现视觉整合减少幻觉但不同问题类型对推理有效性影响显著,为多模态推理系统改进提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15848 2025-11-27 cs.AI cs.CL cs.SD 62%

Step-Audio-R1 Technical Report

Step-Audio-R1 技术报告

Fei Tian, Xiangyu Tony Zhang, Yuxin Zhang, Haoyang Zhang, Yuxin Li, Daijiao Liu, Yayue Deng, Donghang Wu, Jun Chen, Liang Zhao, Chengyuan Yao, Hexin Liu, Eng Siong Chng, Xuerui Yang, Xiangyu Zhang, Daxin Jiang, Gang Yu

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI

AI总结 Step-Audio-R1 是首个实现音频领域推理能力的模型,通过MGRD框架生成基于声音特征的推理链,超越Gemini 2.5 Pro并达到Gemini 3 Pro水平。

Comments 22 pages, 5 figures. Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21460 2025-11-27 cs.AI 57%

MADRA: Multi-Agent Debate for Risk-Aware Embodied Planning

MADRA:多智能体辩论用于风险感知的具身规划

Junjian Wang, Lidan Zhao, Xi Sheryl Zhang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) University of Chinese Academy of Sciences, Nanjing(中国科学院大学南京校区)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 MADRA通过多智能体辩论和分层认知框架,在安全性和效率上超越现有方法,实现高安全任务拒绝率和低误拒率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20994 2025-11-27 cs.CV cs.AI cs.CR 57%

GuardTrace-VL: Detecting Unsafe Multimodel Reasoning via Iterative Safety Supervision

GuardTrace-VL: 通过迭代安全监督检测不安全的多模型推理

Yuxiao Xiang, Junchi Chen, Zhenchao Jin, Changtao Miao, Haojie Yuan, Qi Chu, Tao Gong, Nenghai Yu

机构 * School of Cyber Science and Technology, University of Science and Technology of China(中国科学技术大学网络安全学院) Anhui Province Key Laboratory of Digital Security(安徽省数字安全重点实验室) The University of Hong Kong(香港大学)

专题命中 推理与问题求解 :prompting(abstract);分类 cs.AI

AI总结 GuardTrace-VL通过联合图像-文本分析监控多模态推理全过程,有效检测不安全推理内容,实现93.1%的F1分数提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19900 2025-11-27 cs.CV cs.AI 57%

Agent0-VL: Exploring Self-Evolving Agent for Tool-Integrated Vision-Language Reasoning

Agent0-VL: 探索自我进化代理用于工具集成的视觉-语言推理

Jiaqi Liu, Kaiwen Xiong, Peng Xia, Yiyang Zhou, Haonian Ji, Lu Feng, Siwei Han, Mingyu Ding, Huaxiu Yao

机构 * UNC-Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 推理与问题求解 :language agent(abstract);分类 cs.AI

AI总结 Agent0-VL通过工具集成推理实现自我进化,无需人类标注或外部奖励,提升视觉-语言推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17490 2025-11-27 cs.CV 50%

Video-R4: Reinforcing Text-Rich Video Reasoning with Visual Rumination

Video-R4:通过视觉沉思强化文本丰富的视频推理

Yolo Y. Tang, Daiki Shimada, Hang Hua, Chao Huang, Jing Bi, Rogerio Feris, Chenliang Xu

机构 * University of Rochester(罗切斯特大学) Sony Group Corporation(索尼集团) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室)

专题命中 推理与问题求解 :SFT(abstract)

AI总结 Video-R4通过视觉沉思机制提升文本丰富视频的推理能力,采用多阶段学习框架实现像素基础的多模态推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18509 2025-11-27 cs.PL 50%

Higher-Order Behavioural Conformances via Fibrations

通过纤维化实现更高阶的行为一致性

Henning Urbat

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文提出了一种统一的范畴方法,通过纤维化实现高阶语言的行为一致性,证明了最大行为一致性在一般条件下的合同性质。

详情

展开后加载摘要…

URL PDF HTML 收藏