arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 19038 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 19038 篇

2412.02930 2026-04-21 cs.CV 80%

TemporalVLM: Video LLMs for Temporal Reasoning in Long Videos

TemporalVLM:长视频中的时间推理视频大语言模型

Fawad Javed Fateh, Umer Ahmed, Hamza Khan, M. Zeeshan Zia, Quoc-Huy Tran

机构 * Retrocausal, Inc.(Retrocausal公司)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出TemporalVLM,一种用于长视频时间推理和细粒度理解的视频大语言模型,通过时间感知编码和BiLSTM模块实现全局特征聚合,并引入IndustryASM数据集进行评估。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16263 2026-04-20 cs.RO 80%

Semantic Area Graph Reasoning for Multi-Robot Language-Guided Search

语义区域图推理用于多机器人语言引导搜索

Ruiyang Wang, Hao-Lun Hsu, Jiwoo Kim, Miroslav Pajic

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出语义区域图推理框架,通过结构化语义拓扑抽象实现多机器人语义搜索,提升复杂室内环境中的目标搜索效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15369 2026-04-20 cs.CR 80%

An Agentic Workflow for Detecting Personally Identifiable Information in Crash Narratives

一种用于检测事故叙述中个人可识别信息的代理工作流

Junyi Ma, Pei Li, Rui Gan, Kai Cheng, Steven T. Parker, Bin Ran

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出一种本地部署的代理工作流,利用大语言模型检测事故叙述中的个人可识别信息,通过混合提取器和验证器提升检测精度与召回率,实现隐私保护的可扩展数据处理。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15163 2026-04-20 cs.DB 80%

DPC: Training-Free Text-to-SQL Candidate Selection via Dual-Paradigm Consistency

DPC:基于双范式一致性的无训练文本到SQL候选选择

Boyan Li, Ou Ocean Kun Hei, Yue Yu, Yuyu Luo

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出DPC方法,通过双范式一致性框架解决文本到SQL的生成与选择差距问题,利用SLICER和TESTER代理构建最小区分数据库,通过执行一致性验证提升候选选择准确性。

Comments ACL 2026 (Main Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14872 2026-04-17 cs.HC 80%

SkillDroid: Compile Once, Reuse Forever

SkillDroid: 一次编译,永久复用

Qijia Chen, Andrea Bellucci, Zhida Sun, Giulio Jacucci

专题命中 推理与问题求解 :LLM(summary_cn,abstract)

AI总结 SkillDroid通过编译成功的人工智能引导GUI轨迹为参数化技能模板,实现无需LLM调用的复用,显著提升任务成功率和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13458 2026-04-16 q-fin.GN q-fin.PM q-fin.RM 80%

Interpretable Systematic Risk around the Clock

全天候系统性风险解析

Songrun He

专题命中 推理与问题求解 :LLM(summary_cn,abstract)

AI总结 本文通过结合高频市场数据与实时新闻叙事,揭示系统性跳跃风险的异质性,构建出具有高夏普比率的因子模仿组合,展示了全天候分析和LLM叙事理解在实时风险管理中的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14232 2026-04-16 cs.LG cs.AI cs.CL 80%

Scaling Test-Time Compute to Achieve IOI Gold Medal with Open-Weight Models

通过扩展测试时间计算实现IOI金牌奖章的开放权重模型

Mehrzad Samadi, Aleksander Ficek, Sean Narenthiran, Siddhartha Jain, Wasi Uddin Ahmad, Somshubra Majumdar, Vahid Noroozi, Boris Ginsburg

机构 * NVIDIA

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出GenCluster框架,利用开放权重模型在有限预算下高效探索解决方案空间,实现IOI金牌级性能,缩小开放与闭合系统差距。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12228 2026-04-15 cs.CR 80%

From IOCs to Regex: Automating CTI Operationalization for SOC with LLMs

从IOCs到正则表达式:利用LLMs自动化SOC中的CTI操作化

Pei-Yu Tseng, Lan Zhang, ZihDwo Yeh, Xiaoyan Sun, Xushu Dai, Peng Liu

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出IOCRegex-gen系统,利用LLMs自动生成正则表达式,解决CTI操作化中的手动转换问题,通过分组机制和多阶段验证流程提升准确率和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12172 2026-04-15 cs.CR cs.LO 80%

COBALT-TLA: A Neuro-Symbolic Verification Loop for Cross-Chain Bridge Vulnerability Discovery

COBALT-TLA:一种用于跨链桥漏洞发现的神经符号验证循环

Dominik Blain

专题命中 推理与问题求解 :LLM(summary_cn,abstract)

AI总结 COBALT-TLA结合LLM与TLA+模型检查器,通过自动REPL循环发现跨链桥漏洞,首次自主识别Optimistic Relay Attack漏洞类。

Comments 4 pages, 1 table. Submitted to FMBC 2026 (Formal Methods for Blockchains)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14512 2026-04-15 cs.CV 80%

SIRI-Bench: Challenging VLMs' Spatial Intelligence through Complex Reasoning Tasks

SIRI-Bench: 通过复杂推理任务挑战VLMs的空间智能

Zijian Song, Xiaoxin Lin, Qiuming Huang, Sihan Qin, Guangrun Wang, Liang Lin

机构 * Sun Yat-sen University(中山大学) Guangdong Key Laboratory of Big Data Analysis and Processing(广东大数据分析与处理重点实验室) X-Era AI Lab(X-Era人工智能实验室)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 SIRI-Bench通过空间接地推理任务评估VLMs的空间结构智能,包含9000个视频问题答案三元组,实验表明先进VLMs在结构空间推理上面临挑战。

Comments 20 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10667 2026-04-14 cs.CL cs.AI cs.LG 80%

Learning and Enforcing Context-Sensitive Control for LLMs

学习与强制上下文敏感控制用于大语言模型

Mohammad Albinhassan, Pranava Madhyastha, Mark Law, Alessandra Russo

机构 * Imperial College London(伦敦帝国学院) City University of London(伦敦城市大学) ILASP Limited, UK(英国ILASP有限公司) The Alan Turing Institute(艾伦·图灵研究所)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种自动学习上下文敏感约束的框架,通过两阶段过程提升LLM生成的有效性,使小型模型也能完美遵守约束,优于其他方法。

Comments ACL 2025 Student Research Workshop

Journal ref Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 4: Student Research Workshop), pages 834-842, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00748 2026-04-14 cs.CV 80%

Improving the Reasoning of Multi-Image Grounding in MLLMs via Reinforcement Learning

通过强化学习提升多图像接地在MLLMs中的推理能力

Bob Zhang, Haoran Li, Tao Zhang, Jianan Li, Cilin Yan, Xikai Liu, Jiayin Cai, Yanbin Hao

机构 * Xiaohongshu Inc.(小红书公司) University of Science and Technology of China(中国科学技术大学) Wuhan University(武汉大学) Technical University of Munich(慕尼黑工业大学) Hefei University of Technology(合肥工业大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);post-training(abstract);SFT(abstract)

AI总结 本文通过强化学习策略提升多图像接地任务中MLLMs的推理能力,采用合成CoT数据、LoRA微调和规则引导的RL方法,实验表明在MIG-Bench和多个领域外基准上效果显著。

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26641 2026-04-13 cs.CV 80%

All You Need for Object Detection: From Pixels, Points, and Prompts to Next-Gen Fusion and Multimodal LLMs/VLMs in Autonomous Vehicles

自动驾驶所需的所有内容:从像素、点和提示到下一代融合和多模态LLM/VLMs

Sayed Pedram Haeri Boroujeni, Niloufar Mehrabi, Hazim Alzorgan, Mahlagha Fazeli, Abolfazl Razi

机构 * Department One(第一部门) Department Two(第二部门)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 本文探讨自动驾驶中物体检测的最新进展,重点介绍多模态感知、视觉语言模型和大语言模型等新兴方法,分析传感器融合策略及未来发展方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01804 2026-04-10 cs.CL cs.AI cs.LG 80%

$\texttt{SEM-CTRL}$: Semantically Controlled Decoding

SEM-CTRL:语义控制解码

Mohammad Albinhassan, Pranava Madhyastha, Alessandra Russo

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出SEM-CTRL,通过集成基于答案集语法的约束,使LLM在不微调的情况下保证输出的语法和语义正确性,实验显示其在多种任务中优于现有模型。

Comments Published in Transactions on Machine Learning Research (TMLR), 03/2026

Journal ref Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24499 2026-04-10 cs.CV 80%

Reason-SVG: Enhancing Structured Reasoning for Vector Graphics Generation with Reinforcement Learning

Reason-SVG:通过强化学习增强向量图形生成的结构化推理

Ximing Xing, Ziteng Xue, Yandong Guan, Jing Zhang, Dong Xu, Qian Yu

机构 * Beihang University(北京航空航天大学) The University of Hong Kong(香港大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 Reason-SVG通过引入Drawing-with-Thought范式和混合奖励机制,提升大语言模型生成高质量SVG的能力,实现结构化推理与视觉一致性。

Comments Accepted by CVPR 2026. 16 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13607 2026-03-30 cs.CL cs.AI cs.LG 80%

Nemotron-Cascade: Scaling Cascaded Reinforcement Learning for General-Purpose Reasoning Models

Nemotron-Cascade:基于级联强化学习的通用推理模型规模化

Boxin Wang, Chankyu Lee, Nayeon Lee, Sheng-Chieh Lin, Wenliang Dai, Yang Chen, Yangyi Chen, Zhuolin Yang, Zihan Liu, Mohammad Shoeybi, Bryan Catanzaro, Wei Ping

机构 * NVIDIA(英伟达)

专题命中 推理与问题求解 :SFT(abstract);RLHF(abstract);preference optimization(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出级联域强化学习(Cascade RL)方法,开发出Nemotron-Cascade模型,可在指令和深度思考模式间切换,性能不逊于纯思考模型,同时提升推理能力并保持跨领域基准性能。

Comments We publicly release the Nemotron-Cascade models and the full collection of training data at: https://huggingface.co/collections/nvidia/nemotron-cascade

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12853 2026-03-30 cs.CL cs.AI cs.LG 80%

Diversity of Thought Elicits Stronger Reasoning Capabilities in Multi-Agent Debate Frameworks

思想多样性在多智能体辩论框架中增强了推理能力

Mahmood Hegazy

机构 * University of Montreal(蒙特利尔大学) Mila - Quebec AI Institute(米拉-魁北克人工智能研究所)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过多智能体辩论框架发现,思想多样性显著提升LLM推理能力,中等规模模型在GSM-8K基准测试中超越GPT-4,达到91%准确率,同时在ASDiv基准测试中创下新纪录。

Comments 11 pages, 9 figures

Journal ref Journal of Robotics and Automation Research(JRAR), Vol. 5 Issue 3, October -2024, pg. 1-10

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19779 2026-03-23 cs.CV 80%

One Model, Two Minds: Task-Conditioned Reasoning for Unified Image Quality and Aesthetic Assessment

一个模型,两种思维:任务条件推理用于统一的图像质量与审美评估

Wen Yin, Cencen Liu, Dingrui Liu, Bing Su, Yuan-Fang Li, Tao He

机构 * University of Electronic Science and Technology of China(电子科技大学) Faculty of Information Technology, Monash University(莫纳什大学信息科技学院) The Laboratory of Intelligent Collaborative Computing of UESTC(UESTC智能协同计算实验室)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);post-training(abstract);SFT(abstract)

AI总结 本文提出TATAR框架,通过任务感知的异步奖励机制,解决图像质量评估与审美评估的推理与优化不匹配问题,实验证明其在多个基准上的优越性能。

Comments 10 pages,7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17199 2026-03-19 cs.LG cs.AI cs.CL 80%

Catching rationalization in the act: detecting motivated reasoning before and after CoT via activation probing

在行动中捕捉理性化:通过激活探测检测推理前后的动机推理

Parsa Mirtaheri, Mikhail Belkin

机构 * UC San Diego(加州大学圣迭戈分校)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过激活探测检测LLM在Cot中的动机推理现象,证明内部表示比CoT监控更可靠,且预生成探测能早期发现动机行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15417 2026-03-17 cs.LG cs.AI cs.CL cs.CR 80%

Amplification Effects in Test-Time Reinforcement Learning: Safety and Reasoning Vulnerabilities

测试时强化学习中的放大效应:安全性和推理漏洞

Vanshaj Khattar, Md Rafi ur Rashid, Moumita Choudhury, Jing Liu, Toshiaki Koike-Akino, Ming Jin, Ye Wang

机构 * Penn State University(宾夕法尼亚州立大学) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Mitsubishi Electric Research Laboratories(三菱电机研究实验室)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了测试时训练方法的安全性漏洞,发现测试时强化学习中有害提示注入会放大模型行为,导致推理能力下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15051 2026-03-17 cs.CL cs.AI cs.LG 80%

Thinking in Latents: Adaptive Anchor Refinement for Implicit Reasoning in LLMs

在潜空间中思考:用于大语言模型隐式推理的自适应锚点细化

Disha Sheshanarayana, Rajat Subhra Pal, Manjira Sinha, Tirthankar Dasgupta

机构 * Manipal University Jaipur(马普尔大学斋普尔) TCS Research(塔塔咨询研究)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出AdaAnchor框架,通过自适应终止机制优化潜空间推理,提升准确率并减少计算步骤,实验表明在数学问题基准上准确率提升5%且减少48-60%的潜空间步骤。

Comments Accepted at ICLR 2026, LIT Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09957 2026-03-17 cs.AI cs.CL cs.LG 80%

Think Before You Lie: How Reasoning Leads to Honesty

在谎言之前思考:推理如何导致诚实

Ann Yuan, Asma Ghandeharioun, Carter Blum, Alicia Machado, Jessica Hoffmann, Daphne Ippolito, Martin Wattenberg, Lucas Dixon, Katja Filippova

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过道德权衡数据集探讨推理对诚实的影响,发现推理能提升诚实度,而非单纯依赖推理内容,且代表空间的几何特性是关键因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05065 2026-03-17 cs.CR 80%

Personalizing Agent Privacy Decisions via Logical Entailment

通过逻辑蕴含个性化代理隐私决策

James Flemings, Ren Yi, Octavian Suciu, Kassem Fawaz, Murali Annavaram, Marco Gruteser

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出ARIEL框架,结合LLM与规则逻辑,实现结构化个性化隐私决策,实验显示其在适当判断的F1误差率上降低40.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10101 2026-03-12 cs.LG cs.AI cs.CL 80%

CLIPO: Contrastive Learning in Policy Optimization Generalizes RLVR

CLIPO: 在策略优化中通过对比学习推广RLVR

Sijia Cui, Pengyu Cheng, Jiajun Song, Yongbo Gai, Guojun Zhang, Zhechao Yu, Jianhe Lin, Xiaoxi Jiang, Guanjun Jiang

机构 * Qwen Large Model Application Team, Alibaba Institute of Automation, Chinese Academy of Sciences(文勤大模型应用团队,阿里巴巴自动化研究所,中国科学院) Qwen Large Model Application Team, Alibaba(文勤大模型应用团队,阿里巴巴)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 CLIPO通过对比学习机制改进RLVR,提升大语言模型的策略优化泛化与鲁棒性

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09987 2026-03-12 cs.CL cs.AI cs.LG 80%

Evolving Demonstration Optimization for Chain-of-Thought Feature Transformation

链式推理特征转换的进化演示优化

Xinyuan Wang, Kunpeng Liu, Arun Vignesh Malarkkan, Yanjie Fu

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种通过进化轨迹经验优化LLM驱动的特征转换方法,提升转换多样性与下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08477 2026-03-10 eess.SY cs.SY 80%

Behavioral Generative Agents for Power Dispatch and Auction

行为生成代理在电力调度和拍卖中的应用

Shaoze Li, Justin S. Kim, Cong Chen

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出利用生成代理在电力调度和拍卖中模拟人类决策,通过上下文学习模块提升LLM的决策灵活性和经济理性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07494 2026-03-10 cs.CV 80%

DocCogito: Aligning Layout Cognition and Step-Level Grounded Reasoning for Document Understanding

DocCogito: 对齐布局认知与分步 grounded 推理以实现文档理解

Yuchuan Wu, Minghan Zhuo, Teng Fu, Mengyang Zhao, Bin Li, Xiangyang Xue

机构 * Fudan University(复旦大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);pretraining(abstract);prompting(abstract)

AI总结 DocCogito通过整合布局感知与结构化推理,提升文档理解的准确性和推理过程的系统性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14996 2026-03-10 cs.CL cs.AI cs.LG 80%

MAS-ZERO: Designing Multi-Agent Systems with Zero Supervision

MAS-ZERO:无需监督设计多智能体系统

Zixuan Ke, Austin Xu, Yifei Ming, Xuan-Phi Nguyen, Ryan Chin, Caiming Xiong, Shafiq Joty

机构 * Salesforce AI Research(Salesforce AI研究院) Massachusetts Institute of Technology(麻省理工学院)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MAS-ZERO通过元层面设计实现无需监督的多智能体系统自动设计,提升推理、编程和代理任务的性能。

Comments SEA@NeurIPS (Oral) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06620 2026-03-10 cs.SE cs.AI cs.CL cs.LG 80%

GraphSkill: Documentation-Guided Hierarchical Retrieval-Augmented Coding for Complex Graph Reasoning

GraphSkill: 基于文档的分层检索增强编码用于复杂图推理

Fali Wang, Chenglin Weng, Xianren Zhang, Siyuan Hong, Hui Liu, Suhang Wang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Michigan State University(密歇根州立大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 GraphSkill通过分层检索增强编码框架和自我调试代理,提升复杂图推理任务的准确性和效率。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10131 2026-03-05 cs.LO 80%

Proof Strategy Extraction from LLMs for Enhancing Symbolic Provers

从LLMs中提取证明策略以增强符号证明器

Jian Fang, Yican Sun, Yingfei Xiong

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出Strat2Rocq方法,通过提取LLM的证明策略来增强符号证明器的能力,提升自动化证明效果。

详情

展开后加载摘要…

URL PDF HTML 收藏