arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 18875 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 18875 篇

2502.01344 2025-02-04 cs.AI cs.CL cs.IR 85%

PSSD: Making Large Language Models Self-denial via Human Psyche Structure

Jinzhi Liao, Zenghua Liao, Xiang Zhao

专题命中 推理与问题求解 :large language model(title);language model(title);分类 cs.CL、cs.AI

Comments WWW '25

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.00451 2024-06-19 cs.AI cs.LG 85%

Monte Carlo Tree Search Boosts Reasoning via Iterative Preference Learning

Yuxi Xie, Anirudh Goyal, Wenyue Zheng, Min-Yen Kan, Timothy P. Lillicrap, Kenji Kawaguchi, Michael Shieh

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

Comments 10 pages, 4 figures, 4 tables (24 pages, 9 figures, 9 tables including references and appendices)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.18312 2024-05-07 cs.CL cs.LG 85%

How to think step-by-step: A mechanistic understanding of chain-of-thought reasoning

Subhabrata Dutta, Joykirat Singh, Soumen Chakrabarti, Tanmoy Chakraborty

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.04870 2024-04-26 cs.FL cs.AI cs.LG cs.LO 85%

Lemur: Integrating Large Language Models in Automated Program Verification

Haoze Wu, Clark Barrett, Nina Narodytska

专题命中 推理与问题求解 :large language model(title);language model(title);分类 cs.AI、cs.LG

Comments Accepted at ICLR'24

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14785 2024-04-12 cs.CL cs.AI 85%

Simple Linguistic Inferences of Large Language Models (LLMs): Blind Spots and Blinds

Victoria Basmov, Yoav Goldberg, Reut Tsarfaty

专题命中 推理与问题求解 :large language model(title);language model(title);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.11521 2023-12-20 cs.CL cs.AI 85%

Large Language Models are Complex Table Parsers

Bowen Zhao, Changkai Ji, Yuejie Zhang, Wen He, Yingwen Wang, Qing Wang, Rui Feng, Xiaobo Zhang

专题命中 推理与问题求解 :large language model(title);language model(title);分类 cs.CL、cs.AI

Comments EMNLP 2023 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.00353 2023-12-04 cs.CL cs.AI 85%

On Exploring the Reasoning Capability of Large Language Models with Knowledge Graphs

Pei-Chi Lo, Yi-Hang Tsai, Ee-Peng Lim, San-Yih Hwang

专题命中 推理与问题求解 :large language model(title);language model(title);分类 cs.CL、cs.AI

Comments Presented at the Generative-IR Workshop during SIGIR 2023. https://coda.io/@sigir/gen-ir

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.12923 2023-08-25 cs.HC cs.CL cs.LG math.OC 85%

Diagnosing Infeasible Optimization Problems Using Large Language Models

Hao Chen, Gonzalo E. Constante-Flores, Can Li

专题命中 推理与问题求解 :large language model(title);language model(title);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.08033 2023-03-15 cs.CL cs.AI 85%

Large Language Models (GPT) Struggle to Answer Multiple-Choice Questions about Code

Jaromir Savelka, Arav Agarwal, Christopher Bogart, Majd Sakr

专题命中 推理与问题求解 :large language model(title);language model(title);分类 cs.CL、cs.AI

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.08399 2023-03-15 cs.AI cs.CL 85%

Large Language Models Fail on Trivial Alterations to Theory-of-Mind Tasks

Tomer Ullman

专题命中 推理与问题求解 :large language model(title);language model(title);分类 cs.CL、cs.AI

Comments 11 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19218 2026-08-21 cs.CL cs.AI cs.LG 新提交 85%

Time-Series Retrieval for Grounding Multimodal Language Models in Remaining Useful Life

用于将多模态语言模型与剩余使用寿命关联的时间序列检索

Valeriu Dimidov, Raphaël Frank

机构 * University of Luxembourg(卢森堡大学)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出时间序列检索关联的多模态大语言模型框架,在C-MAPSS基准FD001分区实验显示,该方法可提升RUL预测的误差与稳定性,且效果随模型容量变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16032 2026-08-18 cs.CR 新提交 85%

Proof-of-Execution Memory: Defending LLM Agents Against Forged-Reasoning Attacks by Verifying What Actually Happened

执行证明内存:通过验证实际发生的内容防御大语言模型智能体的伪造推理攻击

Md Habibur Rahman, Jaeho Kim

专题命中 推理与问题求解 :LLM(title,abstract);language model(abstract)

AI总结 该研究针对大语言模型智能体的伪造推理攻击,提出执行证明内存(PoEM)防御方案,通过维护防篡改的HMAC链式分类账验证实际执行步骤,使攻击成功率降至0%,且误报率极低、开销微小。

Comments 8 pages, 6 figures, 5 tables. Code: https://github.com/bithabib/ai_security

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06829 2026-08-10 cs.SE 新提交 85%

How Reasoning Shapes Social Bias in LLM-Generated Code?

推理如何塑造大语言模型生成代码中的社会偏见?

Weifeng Sun, Jieke Shi, Zhou Yang, Yuchen Chen, Hongyan Li, Meng Yan, David Lo

专题命中 推理与问题求解 :LLM(title,abstract_cn);large language model(abstract);language model(abstract)

AI总结 该研究首次系统探究基于推理的代码生成中的社会偏见,发现推理可降低偏见但会影响代码质量,进而提出ProbeDebias框架,有效检测并缓解代码偏见,同时保持较高质量。

Comments ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01170 2026-08-07 cs.LG cs.AI cs.CL stat.AP stat.ML 版本更新 85%

Online Reasoning Calibration: Test-Time Training Enables Generalizable Conformal LLM Reasoning

在线推理校准:测试时训练使可泛化的符合性大语言模型推理

Cai Zhou, Zekai Wang, Menghua Wu, Qianyu Julie Zhu, Flora C. Shi, Chenyu Wang, Ashia Wilson, Tommi Jaakkola, Stephen Bates

机构 * Department of Electrical Engineering and Computer Science (MIT EECS)(麻省理工学院电气工程与计算机科学系) Computer Science and Artificial Intelligence Laboratory (MIT CSAIL)(麻省理工学院计算机科学与人工智能实验室) Laboratory for Information and Decision Systems (MIT LIDS)(麻省理工学院信息与决策系统实验室) Computational Science and Engineering (MIT CSE)(麻省理工学院计算科学与工程) Massachusetts Institute of Technology(麻省理工学院)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出ORCA框架,通过测试时训练和符合性预测校准推理过程,提升大语言模型在分布变化下的效率和泛化能力,实验证明其在不同任务中具有更高的性能。

Comments Published as a conference paper at COLM 2026; 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28674 2026-08-03 cs.AI cs.CL cs.LG 新提交 85%

How Hard Does It Think? Analyzing Step-Aware Reasoning Energy in LLM Chain-of-Thought Trajectories

它认为有多难?分析大型语言模型思维链轨迹中感知步骤的推理能量

Hui Wei, Junda Wu, Sheldon Yu, Sizhe Zhou, Yizhu Jiao, Ming Zhong, Bowen Jin, Tong Yu, Shijia Pan, Jiawei Han, Julian McAuley

机构 * UC Merced(加州大学默塞德分校) UC San Diego(加州大学圣迭戈分校) UIUC(伊利诺伊大学厄巴纳-香槟分校) Adobe Research(奥多比研究院)

专题命中 推理与问题求解 :LLM(title,summary_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究提出SARE框架量化LLM思维链各步骤的推理能量,发现推理能量不均匀、错误轨迹关键节点能量更低,SARE特征性能优于或匹配输出置信度基线,揭示内部几何动态含预测信息。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24964 2026-07-29 cs.CR 新提交 85%

ALIBI: Adaptive Agentic Attacks on LLM-Based Vulnerability Detectors via Adversarial Code Comments

ALIBI:通过对抗性代码注释对基于大语言模型的漏洞检测器进行自适应智能体攻击

Zixuan Wu, Cristina Nita-Rotaru

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究如何通过对抗性代码注释对基于大语言模型的漏洞检测器进行自适应智能体攻击,提出ALIBI框架,将现实世界漏洞修复提交转换为编码任务评估多个检测器,发现其高度易受攻击,揭示攻击面并推动安全意识设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19847 2026-07-23 cs.LG cs.AI cs.CL cs.DB 新提交 85%

Auto-Fill: Learning to Predict Missing Values Accurately with Specialist Language Models

自动填充:使用专业语言模型准确预测缺失值

Yurong Liu, Yeye He, Haoyu Dong, Junjie Xing, Shi Han, Dongmei Zhang, Surajit Chaudhuri

专题命中 推理与问题求解 :language model(title,abstract);small language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究表格数据缺失值预测问题,提出自动填充方法,通过后训练三个针对不同能力的专业小语言模型并结合校准集成机制,相比现有推理模型在保证高精度的同时大幅降低成本。

Comments VLDB 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10481 2026-07-22 cs.LG cs.AI cs.CL 版本更新 85%

ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples

ARMOR:使用离策略锚样本稳定在线大语言模型强化学习

Kexin Huang, Junkang Wu, Jinda Lu, Shuo Yang, Chiyu Ma, Jiancan Wu, Xiang Wang, Xiangnan He, Guoyin Wang, Jingren Zhou

机构 * University of Science and Technology of China(中国科学技术大学) Peking University(北京大学) Dartmouth College(达特茅斯学院)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究大语言模型强化学习训练不稳定问题,提出ARMOR框架,通过锚展开利用离策略数据保留解决方案模式,混合优化重新制定策略目标实现可控探索,经实验验证可有效减轻验证崩溃,提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05298 2026-07-21 cs.RO 版本更新 85%

GhostShell: Streaming LLM Function Calls for Concurrent Embodied Programming

GhostShell:用于并发实体编程的流式大语言模型函数调用

Jian Gong, Youwei Huang, Bo Yuan, Ming Zhu, Zhou Liao, Jianhang Liang, Juncheng Zhan, Jinke Wang, Hang Shu, Zihao Xu, Mingyue Xiong, Yanjun Ye, Yufan Zu, Yang Zhou, Yihan Ding, Xuannian Chen, Xingyu Lu, Runjie Ban, Bingchao Huang

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究提出GhostShell方法,利用大语言模型进行实体系统的流式和并发行为编程。通过定义函数令牌及多通道调度算法协调调用,在机器人原型上评估,该方法在任务完成率等方面表现出色,尤其在协调并发动作上优势明显。

Comments 22 pages, 7 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20161 2026-07-21 cs.LG cs.AI cs.CL 版本更新 85%

Prismatic Synthesis: Gradient-based Data Diversification Boosts Generalization in LLM Reasoning

棱柱形合成:基于梯度的数据多样化提升语言模型推理中的泛化能力

Jaehun Jung, Seungju Han, Ximing Lu, Skyler Hallinan, David Acuna, Shrimai Prabhumoye, Mostafa Patwary, Mohammad Shoeybi, Bryan Catanzaro, Yejin Choi

机构 * NVIDIA Research(NVIDIA研究部) University of Washington(华盛顿大学) University of Southern California(南加州大学)

专题命中 推理与问题求解 :LLM(title,abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究语言模型训练数据多样性对泛化的作用,提出基于梯度熵的G - Vendi指标,进而构建棱柱形合成框架生成多样合成数据,有效提升模型性能,在多个基准测试中表现优于依赖更大数据生成器的模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12483 2026-07-20 cs.SE 版本更新 85%

MoT: Modularization-of-Thought Prompting for Effective Code Generation

MoT:用于有效代码生成的思维模块化提示

Ruwei Pan, Hongyu Zhang

专题命中 推理与问题求解 :prompting(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究针对大语言模型代码生成中现有提示技术不足,提出MoT技术,利用模块化原则分解问题,用MLR图构建推理过程,经实验对比六种基线技术,在八个基准上显著提升代码生成性能,Pass@1分数达58.1%至95.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15200 2026-07-17 cs.CL cs.AI cs.LG 新提交 85%

Mask-Aware Policy Gradients for Diffusion Language Models

用于扩散语言模型的掩码感知策略梯度

Haran Raajesh, Kulin Shah, Adam Klivans, Philipp Krähenbühl

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对强化学习扩展到MDLMs的难题,将MDLM生成形式化为两阶段动作MDP,使策略梯度分解为令牌项和掩码项,结合优化这两项在数学推理和编码基准测试中取得了最优成绩。

Comments Accepted at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18146 2026-07-17 cs.IR 版本更新 85%

Think When Needed: Model-Aware Reasoning Routing for LLM-based Ranking

按需思考:基于大语言模型排序的模型感知推理路由

Huizhong Guo, Tianjun Wei, Dongxia Wang, Yingpeng Du, Ziyan Wang, Jie Zhang, Zhu Sun

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究基于大语言模型排序时推理时机与效果问题,提出推理路由框架,利用生成前信号决定推理与否,能自适应选策略,经实验验证该框架可提高排序效用并减少令牌消耗,解决准确性与效率权衡问题。

Comments Accepted by SIGIR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11948 2026-07-15 cs.AI cs.CL cs.LG cs.MA 新提交 85%

Ontology-Amplified Distillation and Contextuality Auditing for Sovereign Enterprise Language Models: A Combined Proof-of-Mechanism and Negative-Results Method Study

主权企业语言模型的本体增强蒸馏与上下文审查:机制验证与负面结果的组合方法研究

Thanh Luong Tuan

机构 * AgenticOS(智能操作系统)

专题命中 推理与问题求解 :language model(title,abstract);preference optimization(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对受数据驻留规则约束的金融机构需求,结合本体增强蒸馏机制验证与上下文审查方法,对Qwen3.6 - 27B学生模型进行训练及测试,结果不支持模型在多方面的优势,为企业语言模型应用提供参考。

Comments 15 pages, 2 figures. Combined proof-of-mechanism and negative-results method article consolidating ontology-amplified distillation with contextuality-audit routing for enterprise agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09962 2026-07-14 cs.RO 新提交 85%

Task Planning for Mobile Manipulation in Retail Stores using Foundation Models with Iterative Re-planning

使用具有迭代重新规划的基础模型进行零售商店中的移动操作任务规划

Vismay Vakharia, Sanjana Garai, Rolif Lima, Nijil George, Vighnesh Vatsal, Kaushik Das

机构 * TCS Research, Tata Consultancy Services Ltd.(塔塔咨询服务公司TCS研究院)

专题命中 推理与问题求解 :foundation model(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究零售场景补货问题,利用大语言模型和视觉语言模型,结合定制移动操作平台、用户驱动提示及反馈迭代重新规划方法纠错,在模拟环境验证端到端系统,为零售自动化提供了新的任务规划方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09756 2026-07-14 cs.RO 新提交 85%

LLM-Centric Agentic AI for UAV Swarms: Architecture, Enabling Technologies, and Open Problems

用于无人机群的以大语言模型为中心的智能体人工智能:架构、使能技术及开放问题

Yousef Emami, Rahim Taheri, Mohammadhossein Homaei, Muhammad Atif Ur Rehman, Mohammad Shojafar

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究针对无人机群实际部署受限问题,提出以大语言模型为中心的智能体人工智能LAUS,回顾相关使能技术,分析威胁,确定包括抗幻觉推理等在内的开放研究挑战。

Comments 8 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05440 2026-07-08 econ.EM cs.SY eess.SY 新提交 85%

Retrieval over Reasoning: A Cost-Controlled Benchmark of Language Models for Energy-Retrofit Recommendation

基于推理的检索:用于能源改造推荐的语言模型成本控制基准

Eliseo Curcio

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract_cn);large language model(abstract)

AI总结 研究为建筑推荐节能措施问题,通过树集成解决EUI预测,发现推荐任务框架影响模型选择,对八个大语言模型基准测试,表明其过度推荐,检索可缩小差距,还给出成本控制下模型的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02089 2026-07-03 cs.CV cs.AI cs.CL cs.LG cs.MM 新提交 85%

ESC: Emotional Self-Correction for Reliable Vision-Language Models

ESC:面向可靠视觉语言模型的情感自我纠正

Tien-Huy Nguyen, Minh-Nhat Nguyen, Nguyen Nhat Huy, Hung Viet Nguyen, Huy Nguyen Minh Nhat, Thanh-Huy Nguyen, Cuong Tuan Nguyen, Hoang M. Le, Dat Nguyen, Phat Kim Huynh, Min Xu, Ulas Bagci

机构 * 1 GenAI4E Lab 2 University of Information Technology, Ho Chi Minh City, Vietnam 3 Universit\"at Trier, Germany 4 Ho Chi Minh University of Technology, Ho Chi Minh City, Vietnam 5 PAMI Lab, Vietnamese German University, Vietnam 6 Vietnam National University, Ho Chi Minh City, Vietnam 7 Carnegie Mellon University, USA 8 Omoshiroi AI, USA 9 Harvard University, USA 10 Basis Research Institute 11 PASSIO Laboratory, North Carolina A\&T State University, USA 12 Mohamed bin Zayed University of Artificial Intelligence, UAE 13 Northwestern University, USA [4pt] Equal contribution. Corresponding author

专题命中 推理与问题求解 :language model(title,abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出训练无关的ESC框架,通过外部验证器检测错误初始响应并注入情感反馈,促使VLM自我纠正,提升安全、幻觉、感知和多模态推理等任务的可靠性。

Comments ECCV Main Track 2026 (113 pages, 15 tables, 65 figures). Project Page: https://genai4e.github.io/ESC/?

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31725 2026-07-01 cs.SE 新提交 85%

Do Machines Struggle Where Humans Do? LLM and Human Comprehension of Obfuscated Code

机器会在人类感到困难的地方也遇到困难吗?大语言模型与人类对混淆代码的理解

Jack Le, Anh H. N. Nguyen, Tien N. Nguyen

专题命中 推理与问题求解 :LLM(title,abstract_cn);large language model(abstract);language model(abstract)

AI总结 基于人类对混淆代码理解的研究,评估大语言模型是否共享人类在混淆代码下的失败模式,发现推理调优模型与人类困难模式显著对齐,而指令调优模型相关性接近零。

Comments 13 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17389 2026-06-17 cs.CV cs.AI cs.CL cs.LG 新提交 85%

Visuals Lie, Consistency Speaks: Disentangling Spatial Attention from Reliability in Vision-Language Models

视觉会撒谎,一致性说话:在视觉-语言模型中解耦空间注意力与可靠性

Logan Mann, Yi Xia, Ajit Saravanan, Ishan Dave, Saadullah Ismail, Shikhar Shiromani, Emily Huang, Ruizhe Li, Kevin Zhu

机构 * University of California, Santa Barbara(加州大学圣塔芭芭拉分校) Algoverse AI Research(Algoverse AI研究) University of California, Berkeley(加州大学伯克利分校)

专题命中 推理与问题求解 :language model(title,abstract);foundation model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出VLM可靠性探针(VRP),通过结构注意力指标和生成动态分析,发现空间注意力与准确性几乎无关(R≈0.001),而自一致性是可靠性的主要预测因子(R=0.429),揭示了视觉特征与最终生成之间的符号脱离现象。

Comments 16 pages. Accepted to the ICLR 2026 Workshop on Multimodal Intelligence. Code: https://github.com/itsloganmann/VLM-Reliability-Probe

详情

展开后加载摘要…

URL PDF HTML 收藏