arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 19038 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 19038 篇

2405.14365 2024-05-24 cs.CL cs.AI 80%

JiuZhang3.0: Efficiently Improving Mathematical Reasoning by Training Small Data Synthesis Models

Kun Zhou, Beichen Zhang, Jiapeng Wang, Zhipeng Chen, Wayne Xin Zhao, Jing Sha, Zhichao Sheng, Shijin Wang, Ji-Rong Wen

专题命中 推理与问题求解 :LLM(abstract,comments);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 28 pages, SOTA math LLM using Well-trained Data Synthesis LLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08357 2026-08-28 cs.CL 版本更新 79%

Forward-Free Diffusion Language Models with BPTT-Free Looped Refinement

无前向过程的扩散语言模型

Haotian Sun, Rushi Qiang, Yuqian Zheng, Bo Dai

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL

AI总结 提出FReDA,一种无需人工设计前向过程的扩散语言模型,通过递归分布细化利用模型生成草稿作为隐式中间状态,在推理和编码任务上超越更大模型,并实现1.5-1.8倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25311 2026-08-27 cs.LG 新提交 79%

Prefix-Denoising Consistency: Test-Time Verification for Diffusion Language Models

前缀去噪一致性:扩散语言模型的测试时验证方法

Yuki Ichihara, Naoto Iwase, Mohammad Atif Quamar, Junpei Komiyama

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) Nagoya University(名古屋大学) RIKEN AIP(理化学研究所人工智能项目)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.LG

AI总结 该研究针对扩散语言模型提出测试时自验证方法PDC,通过前缀条件再生的轨迹稳定性差异修正初始生成样本,在两类推理基准中提升性能且具鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21147 2026-08-27 cs.SD cs.AI 版本更新 79%

AOR-Bench: Do Large Audio Language Models Over-Refuse Pseudo-Harmful Queries?

AOR-Bench: 大型音频语言模型是否会过度拒绝伪有害查询?

Jiaxi Yang, Chaewan Chun, Jason Lucas, Yuchen Yang, Dongwon Lee

机构 * Penn State University(宾夕法尼亚州立大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 提出首个针对大型音频语言模型过度拒绝问题的基准AOR-Bench,包含3000个伪有害音频样本,评估12个模型发现过度拒绝普遍存在,并探索了两种轻量缓解策略。

Comments To appear in EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21170 2026-08-26 cs.CV cs.AI 版本更新 79%

Is Visual Prompting All You Need? Studying VLM Spatial Reasoning under Progressive Visual Scaffolds

视觉提示就足够了?研究渐进式视觉支架下视觉语言模型的空间推理能力

Lars Benedikt Kaesberg, Tianyu Yang, Florian Valentin Wunderlich, Terry Ruas, Daniel Kurzawe, Jan Philip Wahle, Bela Gipp

专题命中 推理与问题求解 :prompting(title);language model(abstract);分类 cs.AI

AI总结 该研究针对 VLMs 的空间推理问题,在 SPaRC 基准中引入轻量视觉支架,可提升 VLMs 任务准确率并补充 GRPO 训练,揭示视觉呈现对 VLM 基准测量属性的关键作用。

Comments Accepted at EMNLP 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19261 2026-08-26 cs.CV cs.AI 版本更新 79%

EviPathBench: Benchmarking Evidence Acquisition and Reasoning in Vision-Language Models for Whole-Slide Pathology

PathAgentBench:在全切片病理图像上对寻求证据的视觉语言模型进行基准测试

Dankai Liao, Tianyi Zhang, Yufeng Wu, Xinyue Zhang, Qiaochu Xue, Zeyu Liu, Dachun Zhao, Linghan Cai, Yueming Jin

机构 * National University of Singapore(新加坡国立大学) PuzzleLogic Pte Ltd(拼图逻辑私人有限公司) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳校区) Peking Union Medical College Hospital(北京协和医院)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 研究针对全切片病理图像诊断中证据获取与整合问题,引入PathAgentBench基准,评估视觉语言模型的四项互补能力,包含多模型评估结果,揭示了证据推理与获取间的差距,为改进病理模型提供统一框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02408 2026-08-25 cs.CV cs.AI 版本更新 79%

ReasonEdit: Editing Vision-Language Models using Human Reasoning

ReasonEdit:通过人类推理编辑视觉语言模型

Jiaxing Qiu, Kaihua Hou, Roxana Daneshjou, Ahmed Alaa, Thomas Hartvigsen

机构 * University of Virginia(弗吉尼亚大学) University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 ReasonEdit通过引入人类推理机制,改进视觉语言模型的编辑能力,提升编辑泛化性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14659 2026-08-25 cs.CV cs.AI 版本更新 79%

VisionCoach: Reinforcing Grounded Video Reasoning via Visual-Perception Prompting

VisionCoach: 通过视觉感知提示强化视频推理

Daeun Lee, Shoubin Yu, Yue Zhang, Mohit Bansal

专题命中 推理与问题求解 :prompting(title,abstract);分类 cs.AI

AI总结 VisionCoach通过视觉提示指导强化学习,提升视频推理的时空定位能力,实现无需外部工具的高效推理。

Comments Accepted to ECCV 2026; Project website: https://visioncoach.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09555 2026-08-25 cs.CL 版本更新 79%

Adaptive Test-Time Compute Allocation for Block Diffusion Language Models in Complex Reasoning

推进块扩散语言模型用于测试时间扩展

Yi Lu, Deyang Kong, Jianing Wang, Linsen Guo, Xue Wang, Qi Guo, Tao Gui, Xuanjing Huang, Wei Ye, Shikun Zhang, Wei Wang

机构 * Fudan University(复旦大学) Peking University(北京大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL

AI总结 本文提出BACD和TCCF方法,提升块扩散语言模型在测试时间扩展中的推理效率和效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18628 2026-08-20 cs.CV cs.CL 新提交 79%

When Safety Overrides Vision: Exploring Dynamics between Vision Influence and Safety Alignment in Vision-Language Models

当安全覆盖视觉时:探索视觉语言模型中视觉影响与安全对齐之间的动态关系

Mehak Gupta, Tanmoy Chakraborty

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL

AI总结 该研究探究对齐视觉语言模型中安全诱导弃权的内部解码动态,发现安全对齐未抑制感知接地,抑制拒绝相关表征可恢复接地回答,揭示了其一种新的失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18230 2026-08-20 cs.LG 新提交 79%

Allocating Recurrent Compute in Looped Language Models

在循环语言模型中分配循环计算

Ruhai Lin, Yiyang Guo, Rui-Jie Zhu, Hao Ye, Jason K. Eshraghian

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.LG

AI总结 该研究针对循环语言模型,提出仅重复混合器、单次执行密集FFN的MixerLoop,在不同参数规模下验证其性能,可保留循环深度优势并降低计算量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12700 2026-08-19 cs.LG cs.AR cs.DC 版本更新 79%

A Contract-Grade Verifier for LLM-Generated GPU Kernels, and a Native Blackwell Backward for the Gated-Linear-Recurrence Family

面向大语言模型生成的GPU内核的契约级验证器,以及门控线性循环(GDN)族的原生Blackward反向传播算法

Rishi Shah, Rishav Shrestha

机构 * E3A Healthcare(E3A医疗公司)

专题命中 推理与问题求解 :LLM(title);language model(abstract);分类 cs.LG

AI总结 本文提出契约级GPU内核验证器,发现公开系统接受的2638个机器生成内核中39.5%存在无法修复的错误,还构建了GDN族的原生Blackwell反向传播算法,指出现有内核生成正确性信号被高估。

Comments 20 pages, 3 figures. Also archived at doi:10.5281/zenodo.21563213

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08748 2026-08-19 cs.RO cs.AI 版本更新 79%

Visual Prompting for Robotic Manipulation with Annotation-Guided Pick-and-Place Using ACT

面向机器人操作的视觉提示:采用带标注引导的拾取与放置方法,基于ACT算法

Muhammad A. Muttaqien, Tomohiro Motoda, Ryo Hanai, Yukiyasu Domae

机构 * Embodied AI Research Team(具身人工智能研究团队) National Institute of AIST(国家信息与系统技术研究所)

专题命中 推理与问题求解 :prompting(title,abstract);分类 cs.AI

AI总结 针对便利店机器人拾取放置任务的挑战,提出带标注引导视觉提示的感知-行动流水线,采用ACT算法实现自适应操作,提升了零售环境下的抓取精度与适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03988 2026-08-18 cs.AI 版本更新 79%

Imaginative Perception Tokens Enhance Spatial Reasoning in Multimodal Language Models

想象感知标记增强多模态语言模型的空间推理能力

Mahtab Bigverdi, Linjie Li, Weikai Huang, Yiming Liu, Jaemin Cho, Tuhin Kundu, Chris Dongjoo Kim, Zelun Luo, Jieyu Zhang, Linda Shapiro, Ranjay Krishna

机构 * University of Washington(华盛顿大学) Allen Institute for AI(Allen人工智能研究所) Microsoft(微软) OpenAI(开放人工智能研究院)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 提出想象感知标记(IPT)作为中间感知表征,通过监督学习提升多模态语言模型在不可见视角推理、遮挡路径追踪等空间推理任务上的性能,在三个新构建的数据集上优于文本思维链训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21576 2026-08-18 cs.CL 版本更新 79%

Vision Language Models Cannot Plan, but Can They Formalize?

视觉语言模型(VLMs)无法规划,但它们能进行形式化吗?

Muyu He, Yuxi Zheng, Yuchen Liu, Zijian An, Bill Cai, Jiani Huang, Lifeng Zhou, Feng Liu, Ziyang Li, Li Zhang

机构 * Drexel University(德雷塞尔大学) University of Pennsylvania(宾夕法尼亚大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL

AI总结 本研究提出5种VLM作为形式化器的流水线,评估后发现其表现优于端到端规划生成,较弱VLMs的瓶颈为物体关系视觉grounding,较强模型已克服该限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13344 2026-08-14 cs.AI 新提交 79%

LongEarth-R1: Benchmarking and Aligning Vision-Language Models for Long-Horizon Earth Observation Reasoning

LongEarth-R1:用于长时序地球观测推理的视觉语言模型基准测试与对齐

Yupan Ding, Jing Xiao, Zhenyuan Zhang, Chaofeng Chen, Liang Liao, Gui-Song Xia, Mi Wang

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 该研究推出长时序地球观测推理基准LongEarth-Bench,开发LongEarth-R1模型,在全部12项长序列遥感推理任务中表现最优,同时在标准遥感基准上保持竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10198 2026-08-12 cs.AI 新提交 79%

Post-Hoc Sparse Coding of Latent Communication Between Vision-Language Model Agents

视觉-语言模型智能体间潜在通信的事后稀疏编码

Di Wu, Xiaohui Zhu

机构 * Xi’an Jiaotong-Liverpool University(西交利物浦大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 该研究针对视觉-语言模型智能体间的潜在通信,通过事后稀疏自编码器压缩Vision Wormhole的传输数据,在保持性能的同时大幅减少了传输字节,为通信机制优化提供了方向。

Comments 9 pages, no figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09772 2026-08-11 cs.CL 新提交 79%

PragMatch: Separating Pragmatic Incongruity from Cross-Modal Mismatch in Large Vision-Language Models

PragMatch:分离大视觉语言模型中的语用不一致与跨模态不匹配

Zhanna Mukhametsharip, Vera Demberg, Varsha Suresh

机构 * Saarland University(萨尔大学) Max Planck Institute for Informatics(马克斯·普朗克信息学研究所)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL

AI总结 本研究提出PragMatch基准,揭示大视觉语言模型易受表面线索影响,为评估多模态语用推理提供测试平台。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09435 2026-08-11 cs.AI 新提交 79%

Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models

听、看与跟踪:面向全模态大模型的时空视听声音事件推理

Zhi Zeng, Cheng Zhang, Zesheng Yang, Rendong Pi, Jiaying Wu, Di Zhang, Zihan Ma, Guodong Li, Zhou Yang, Yu Xiang, Yifei Zheng, Minnan Luo

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 针对现有模型缺失的时空视听推理能力,构建ST-OmniQA基准,提出ST-Omni-R1模型,在该基准上平均语义准确率达77.83%,且空间运动表示可跨基准迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09121 2026-08-11 cs.AI 新提交 79%

MELLON - Multimodal Enhanced LLM for Online Navigation

MELLON——面向在线导航的多模态增强型大语言模型

Ruiyu Li, Haoyang Cai, Zhitong Guo, Tong Hu

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI

AI总结 针对网页导航智能体现有模型的不足,本文以WebShop为基准,提出MELLON等三项多模态增强方案,训练1个epoch后MELLON任务完成准确率提升9.26%,验证了多模态方法的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24396 2026-08-11 cs.AI 版本更新 79%

Understanding and Mitigating Premature Confidence for Better LLM Reasoning

理解并缓解过早自信以提升大语言模型推理能力

Jingchu Gai, Guanning Zeng, Christina Baek, Chen Wu, J. Zico Kolter, Andrej Risteski, Aditi Raghunathan

机构 * Carnegie Mellon University(卡内基梅隆大学) Tsinghua University(清华大学)

专题命中 推理与问题求解 :LLM(title);language model(abstract);分类 cs.AI

AI总结 针对大语言模型长思维链中逻辑跳跃和过早自信问题,提出渐进式自信塑造强化学习目标,无需外部标签或奖励模型,通过奖励逐步自信增长并惩罚过早承诺,显著提升推理准确性和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10119 2026-08-11 cs.AI 版本更新 79%

Intelligence Foundation Model: A New Perspective to Approach Artificial General Intelligence

智能基础模型:一种新视角来实现通用人工智能

Borui Cai, Yao Zhao

机构 * Hangzhou International Innovation Institute, Beihang University, China(北京航空航天大学杭州国际创新研究院) Victoria University, Melbourne, Australia(墨尔本维多利亚大学)

专题命中 推理与问题求解 :foundation model(title,abstract);分类 cs.AI

AI总结 本文提出智能基础模型,通过模拟生物神经系统的动态过程和神经元输出预测,为实现通用人工智能提供新的视角和方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04066 2026-08-06 cs.AI 新提交 79%

The LLM Proposes, the Executive Disposes: A Self-Verifying Agent Instrument that Dissociates Commitment Drift from Binding Drift in Long-Horizon Agents

大模型提出方案,执行体处理:一种自验证智能体工具,可将长程智能体中的承诺漂移与绑定漂移分离

Mohsen Arjmandi

专题命中 推理与问题求解 :LLM(title);language model(abstract);分类 cs.AI

AI总结 本研究提出一种自验证智能体工具,可分离长程智能体的承诺漂移与绑定漂移,通过实验揭示消融承诺机制会提升目标放弃率,且贡献了可量化漂移分解的智能体验证方法论。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13502 2026-08-05 cs.CL 版本更新 79%

BOW: Training Language Models to Reason Over Plausible Next Words

BOW:训练语言模型对合理的下一个单词进行推理

Ming Shen, Zhikun Xu, Jacob Dineen, Xiao Ye, Ben Zhou

机构 * Arizona State University(亚利桑那州立大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL

AI总结 BOW是一种RL框架,通过训练语言模型生成合理下一个单词空间的全面描述,在10个推理基准上表现优于部分基线,BOW-Reg还能提升SharedRef正确率并降低单义崩溃。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01753 2026-08-04 cs.CV cs.AI 新提交 79%

Can Urban Blight Be Accessed with Vision-language Models: A Case Study in Detroit

能否用视觉-语言模型评估城市衰败:以底特律为例

Xiaohao Yang, Aohua Tian, Derek Van Berkel, Xu Qiang, Mark Lindquist

机构 * School for Environment and Sustainability(环境与可持续发展学院) School of Information(信息学院) University of Michigan(密歇根大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 本研究以底特律为案例,提出基于开源大视觉-语言模型的多视角住宅衰败评估框架,经实验验证该框架可低成本跟踪住房状况,为传统调查提供补充。

Comments 19 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01000 2026-08-04 cs.AI 新提交 79%

Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets

判断并非枚举:大语言模型生成的可接受集合中的隐性遗漏

Wenhui Chen, Jianlin Chen, Ziyao Lin, Peiji Long, Chi Man Vong

机构 * University of Macau(澳门大学) South China University of Technology(华南理工大学)

专题命中 推理与问题求解 :LLM(title);language model(abstract);分类 cs.AI

AI总结 该研究发现大语言模型作为评估者时,生成可接受集合的表现远差于判断表现,核心问题是隐性遗漏,通过重写错误预期值可大幅提升修复后的套件产量。

Comments 53 pages, 14 figures, 26 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00969 2026-08-04 cs.AI 新提交 79%

PROGRESS: Coverage-guided RL to Train Search-augmented LLM Agent

PROGRESS:基于覆盖引导的强化学习训练搜索增强型大语言模型智能体

Sudipta Paul, Vijay Srinivasan, Vivek Kulkarni, Aounon Kumar, Yashas Malur Saidutta, Wenbo Li, Srinivas Chappidi

机构 * AI Center-Mountain View, Samsung Electronics(三星电子山景城人工智能中心)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI

AI总结 针对搜索增强型大语言模型智能体结果级奖励监督不足的问题,提出PROGRESS方法,通过教师引导的覆盖奖励结合R1框架训练,提升了智能体任务性能,凸显了搜索策略监督的重要性。

Comments Accepted in Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14686 2026-08-04 cs.CV cs.AI 版本更新 79%

MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model

MVHOI: 通过3D基础模型桥接多视角条件与复杂人-物体交互视频重现

Jinguang Tong, Jinbo Wu, Kaisiyuan Wang, Zhelun Shen, Xuan Huang, Mochu Xiang, Xuesong Li, Yingying Li, Haocheng Feng, Chen Zhao, Hang Zhou, Wei He, Chuong Nguyen, Jingdong Wang, Hongdong Li

专题命中 推理与问题求解 :foundation model(title,abstract);分类 cs.AI

AI总结 本文提出MVHOI框架,通过3D基础模型结合多视角参考条件,生成复杂人-物体交互视频,提升了长时视频生成的性能。

Comments Project page: https://mvhoi.hirotong.fun

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06828 2026-08-03 cs.CV cs.AI 版本更新 79%

Step-Level Visual Grounding Faithfulness Predicts Out-of-Distribution Generalization in Long-Horizon Vision-Language Models

步级视觉 grounding 信念预测长视界视觉语言模型的分布外泛化

Md Ashikur Rahman, Md Arifur Rahman, Niamul Hassan Samin, Abdullah Ibne Hanif Arean, Juena Ahmed Noshin

机构 * The KOW Company(KOW公司) University of Dhaka(达卡大学) American International University - Bangladesh (AIUB)(孟加拉国美国国际大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 研究发现长视界视觉语言模型中,步级视觉接地信念预测分布外泛化能力,揭示了模型中间推理与视觉状态的一致性对鲁棒性的影响。

Comments Following the initial submission, we conducted additional experiments that materially changed our understanding of the problem. These new results do not support the central claim of the current manuscript. To avoid disseminating conclusions that we no longer consider adequately supported, we are withdrawing this version while we reassess the findings and prepare a substantially revised manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19435 2026-07-31 cs.CL 79%

Route to Reason: Adaptive Routing for LLM and Reasoning Strategy Selection

Zhihong Pan, Kai Zhang, Yuze Zhao, Yupeng Han

机构 * State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) University of Science and Technology of China(中国科学技术大学)

专题命中 推理与问题求解 :LLM(title);language model(abstract);分类 cs.CL

Journal ref Proceedings of the ACM Web Conference 2026, pp. 5568-5578

详情

展开后加载摘要…

URL PDF HTML 收藏