arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1722 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 1722 篇

2606.12783 2026-06-12 cs.AI 新提交 57%

A Tutorial on World Models and Physical AI

世界模型与物理AI教程

Il-Seok Oh

机构 * Department of Computer Science and Artificial Intelligence/CAIIT, Jeonju, Jeonbuk, South Korea(韩国全北全州计算机科学与人工智能系/CAIIT)

专题命中 推理与问题求解 :foundation model(abstract);分类 cs.AI

AI总结 本文提出统一框架,区分显式与隐式世界模型,并探讨其在机器人、自动驾驶等物理AI领域的应用,以及迈向通用人工智能的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12550 2026-06-12 cs.RO cs.AI 新提交 57%

Foresight: Iterative Reasoning About Clues that Matter for Navigation

Foresight: 关于导航关键线索的迭代推理

Arthur Zhang, Carl Qi, Donne Su, Xiangyun Meng, Amy Zhang, Joydeep Biswas

机构 * UT Austin(德克萨斯大学奥斯汀分校) FieldAI

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 提出Foresight框架,利用微调VLM交替提出和批评图像空间运动计划,通过人类反馈学习奖励模型进行强化学习后训练,实现无地图导航中稀疏语言指令下的迭代运动优化,任务成功率提升37%。

Comments 22 pages, 10 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10403 2026-06-12 cs.CL 新提交 57%

KCSAT-ML: Probing Reasoning Models with Nationwide-Cohort Human Difficulty

KCSAT-ML: 用全国队列人类难度探测推理模型

Sanghee Park, Geewook Kim, Kee-Eung Kim

机构 * NAVER Cloud AI(NAVER云AI) KAIST AI(韩国科学技术院人工智能系)

专题命中 推理与问题求解 :LLM(abstract_cn);分类 cs.CL

AI总结 提出KCSAT-ML基准(含664道韩国高考数学题及339道带官方错误率的核心题)和难度对齐推理增益(DRG)指标,揭示视觉语言模型在人类高错误率题目上准确率崩溃、测试时缩放非单调以及同一模型族内反缩放与过度思考并存的现象。

Comments 18 pages, 14 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12402 2026-06-11 cs.RO cs.AI cs.CV 新提交 57%

DIRECT: When and Where Should You Allocate Test-Time Compute in Embodied Planners?

DIRECT: 在具身规划器中何时何地分配测试时计算?

Jadelynn Dao, Milan Ganai, Yasmina Abukhadra, Ajay Sridhar, Mozhgan Nasr Azadani, Katie Luo, Clark Barrett, Jiajun Wu, Chelsea Finn, Marco Pavone

机构 * Stanford University(斯坦福大学) University of Waterloo(滑铁卢大学) NVIDIA(英伟达)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 提出DIRECT路由框架,根据多模态场景上下文按提示分配计算资源,优化成功-成本帕累托前沿,实验表明不同缩放轴带来不同能力增益,在物理机器人上以更低延迟匹配或超越更强模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12003 2026-06-11 cs.CL 新提交 57%

Agreement in Representation Space for Open-Ended Self-Consistency

表示空间中的一致性:面向开放式自洽性

Paula Ontalvilla, Gorka Azkune, Aitor Ormazabal

机构 * HiTZ Center - Ixa, University of the Basque Country (UPV/EHU)(HiTZ中心 - Ixa,巴斯克大学(UPV/EHU))

专题命中 推理与问题求解 :LLM(abstract);分类 cs.CL

AI总结 针对开放式生成任务,提出基于嵌入的协议(EBA),通过聚类采样生成的嵌入表示来估计自洽性,无需训练即可鲁棒地选择更可靠的输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11953 2026-06-11 cs.CL 新提交 57%

Decoding Multimodal Cues: Unveiling the Implicit Meaning Behind Hateful Videos

解码多模态线索:揭示仇恨视频背后的隐含意义

Junyu Lu, Deyi Ji, Liqun Liu, Xiaokun Zhang, Youlin Wu, Roy Ka-Wei Lee, Peng Shu, Huan Yu, Jie Jiang, Bo Xu, Liang Yang, Hongfei Lin

机构 * Dalian University of Technology(大连理工大学) Tencent(腾讯) City University of Hong Kong(香港城市大学) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 推理与问题求解 :preference optimization(abstract);分类 cs.CL

AI总结 提出IARE框架,通过信息增强和推理优化实现可解释的仇恨视频检测,在Ex-HateMM和Ex-ImpliHateVid数据集上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10918 2026-06-10 cs.RO cs.LG 新提交 57%

Task Robustness via Re-Labelling Vision-Action Robot Data

通过重新标注视觉-动作机器人数据的任务鲁棒性

Artur Kuramshin, Özgür Aslan, Cyrus Neary, Glen Berseth

机构 * Mila — Quebec AI Institute(Mila — 魁北克人工智能研究所) Université de Montréal(蒙特利尔大学) The University of British Columbia(不列颠哥伦比亚大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.LG

AI总结 提出TREAD框架,利用大型视觉语言模型对机器人数据集进行语义子任务分解和多样化指令生成,无需额外数据收集,提升策略在未见任务上的泛化能力。

Comments Project website: https://akuramshin.github.io/tread

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10658 2026-06-10 cs.CR cs.AI cs.CE q-fin.CP 新提交 57%

Post-Quantum Secure Federated DeFi for Inclusive Banking

面向普惠银行的后量子安全联邦DeFi

Swati Sachan, Dale Fickett, Richard Buchinger, Theo Miller

机构 * AI FinTech Group, University of Liverpool(人工智能金融科技组,利物浦大学) RVA Works and University of Richmond(RVA Works和里士满大学) Chain Crunch Labs(Chain Crunch实验室)

专题命中 推理与问题求解 :foundation model(abstract);分类 cs.AI

AI总结 提出后量子安全联邦DeFi框架,利用格基全同态加密和NASA-IBM地理空间基础模型,实现银行间加密协作以提升信用不足个体的金融普惠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09399 2026-06-09 cs.AI 新提交 57%

RunAgent SuperBrowser: A Theory of Autonomous Web Navigation Grounded in Human Browsing Behaviour

RunAgent SuperBrowser: 基于人类浏览行为的自主网页导航理论

Radeen Mostafa, Sawradip Saha

机构 * RunAgent AI

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 提出SuperBrowser自主网页导航代理,通过模仿人类浏览的感知-认知-行动三元机制,在Mind2Web Hard基准上以89.47%成功率超越现有开源研究代理。

Comments 31 pages, 8 figures, preprint/work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09091 2026-06-09 cs.LG cs.CV 新提交 57%

Stabilizing On-Policy Distillation for MLLM Reasoning with Global Normalization

稳定基于策略的蒸馏用于多模态大语言模型推理的全局归一化

Dongze Hao, Zhiwei Jin, Chen Chen, Haonan Lu

机构 * OPPO AI Center(OPPO AI中心)

专题命中 推理与问题求解 :post-training(abstract);分类 cs.LG

AI总结 针对策略蒸馏中异常状态导致梯度不稳定的问题,提出全局归一化蒸馏策略优化(GNDPO),通过将KL分数转化为批次级相对优势来稳定优化,提升多模态推理任务的训练鲁棒性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08992 2026-06-09 cs.RO cs.AI cs.CV 新提交 57%

SpaceVLN: A Zero-Shot Vision-and-Language Navigation Agent with Online Spatial Cognitive Memory and Reasoning

SpaceVLN:具有在线空间认知记忆与推理的零样本视觉与语言导航智能体

Yucheng Deng, Pingrui Lai, Xinhai Li, Chenjia Bai, Xiaoheng Deng, Chengnuo Sun, Xuelong Li, Hua Yang

机构 * Shanghai Jiao Tong University(上海交通大学) China Telecom(中国电信) Central South University(中南大学) Jiangsu University(江苏大学)

专题命中 推理与问题求解 :foundation model(abstract);分类 cs.AI

AI总结 提出SpaceVLN,通过空间认知记忆和任务引导的空间推理,在零样本设置下实现连续环境中的视觉与语言导航,在多个基准上达到最优性能。

Comments 23 pages, 9 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08014 2026-06-09 cs.CV cs.AI 新提交 57%

GVC-Seg: Training-Free 3D Instance Segmentation via Geometric Visual Correspondence

GVC-Seg: 基于几何视觉对应的免训练3D实例分割

Liang Xu, Fangjing Wang, Jinyu Yang, Feng Zheng

机构 * Victoria University of Wellington(惠灵顿维多利亚大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Southern University of Science and Technology(南方科技大学)

专题命中 推理与问题求解 :foundation model(abstract);分类 cs.AI

AI总结 提出GVC-Seg,一种免训练的3D实例分割方法,通过几何与视觉特征对应消除多模型集成中的置信度偏差,在多个基准上达到最优性能。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07856 2026-06-09 cs.LG 新提交 57%

Teacher-Free Self-Training Amplifies but Does Not Compound: A Pass@$K$ Crossover on a Free-Verifier Domain

无教师自训练放大但不复合:自由验证器域上的 Pass@$K$ 交叉

Igor Lima Strozzi

机构 * Federal University of Rio de Janeiro(里约热内卢联邦大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.LG

AI总结 在自由验证器域上,使用无教师自训练(STaR)和批评者指导的选择,发现自训练放大模型能力但不复合,通过 Pass@$K$ 交叉诊断证实。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07361 2026-08-10 cs.RO cs.CV 新提交 56%

Depth-Wise Probing and Pruning of the Planning Token in a Driving Vision-Language-Action Model

驾驶视觉-语言-动作模型中规划 token 的深度探测与剪枝

Harisankar Babu, Benjamin Coors, Christopher Lang, Hendrik Berkemeyer, Tamim Asfour, Simon Foell

机构 * Robert Bosch GmbH(罗伯特·博世有限公司) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)

专题命中 推理与问题求解 :language model(abstract);foundation model(comments)

AI总结 本文针对驾驶 VLA 模型的规划 token,通过探测其 32 个解码器层的信号并剪枝部分层,在误差小幅增加下实现 1.33 倍解码器加速,验证了规划信息早期存在但格式适配问题。

Comments Accepted at the 6th DriveX Workshop (Foundation Models for Autonomous Driving), ECCV 2026. 14 pages, 8 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23518 2026-08-25 cs.CV 新提交 50%

Investigating Relational Reasoning in VLMs

研究视觉语言模型(VLMs)中的关系推理

Adhithya Laxman Ravi Shankar Geetha, Aulia Kharis Rakhmasari, Haleema Ramzan, Xander Yap

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 推理与问题求解 :language model(abstract)

AI总结 本研究以Qwen3-VL-4B为对象,构建含几何形状的合成数据集,探究VLMs的关系推理能力,发现其结合了真正视觉推理与基于语言线索的捷径策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23354 2026-08-25 cs.RO cs.CV 新提交 50%

OptiSight: Bridging Semantic Reasoning and Geometric Control for Embodied Navigation

OptiSight:弥合具身导航中的语义推理与几何控制

Alperen Avan, Jordi Sanchez-Riera

机构 * Institut de Robòtica i Informàtica Industrial (CSIC-UPC)(机器人学与工业信息研究所(西班牙国家研究委员会-加泰罗尼亚理工大学))

专题命中 推理与问题求解 :language model(abstract)

AI总结 本研究提出OptiSight混合框架,结合VLM推理与确定性视觉伺服,在8GB VRAM预算下,于AI Habitat中实现了多种室内场景下的可靠零样本具身导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23074 2026-08-25 cs.CV 新提交 50%

Grounding Isn't Knowing: Do VLMs Need Object Localization for Spatial Reasoning?

grounding 不等于知晓:视觉语言模型是否需要对象定位来进行空间推理?

Xiwei Liu, Yulong Li, Xinlin Zhuang, Xuhui Li, Zhixiang Lu, Haolin Yang, Imran Razzak, Yutong Xie

专题命中 推理与问题求解 :language model(abstract)

AI总结 本研究以 LLaVA-1.5 和 Qwen2.5-VL 为对象,通过多种可解释性工具揭示 VLMs 空间推理的机制,发现其空间关系预测无需精确对象定位,定位与空间推理共享早期通路但依赖部分不同通路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22228 2026-08-25 cs.IR 新提交 50%

Prompt-Based Abstention Fails Under Misleading Context: A Controlled Study of Small Frozen RAG Models

基于提示的弃权(不执行)在误导性语境下失效:对小型冻结RAG模型的对照研究

Yohanes Andre Setiawan

专题命中 推理与问题求解 :prompting(abstract)

AI总结 该研究针对小型冻结RAG模型发现,基于提示的弃权(不执行)无法区分缺失与误导性证据,提出GRAB-RAG基准并测试多种策略,发现其在误导性问题上表现不佳且验证器无法兼顾覆盖率与安全性。

Comments 20 pages. Committed to AACL-IJCNLP 2026. Code/data to be released

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21884 2026-08-25 cs.SE 新提交 50%

Loop Engineering: Building Blocks, Adoption, and Impact

循环工程:构建模块、采用情况及影响

Jai Lal Lulla, Vahram Nersesyan, Seyedmoein Mohsenimofidi, Christoph Treude, Sebastian Baltes

专题命中 推理与问题求解 :prompting(abstract)

AI总结 本文对新兴循环工程领域开展探索性研究,分析其构建模块、开源项目采用情况,挖掘36710个仓库发现217个存在自主智能体循环,并规划了智能体自主层级的对照研究。

Comments 10 pages, 2 tables, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21602 2026-08-25 cs.HC 新提交 50%

Exploring Agentic Approaches for Data Issue Detection and Repair in AI-Assisted Visualization

探索用于AI辅助可视化中数据问题检测与修复的智能体方法

Parimal Kashireddy, Anna Fariha, Mahmood Jasim

专题命中 推理与问题求解 :prompting(abstract)

AI总结 本研究通过评估GPT-5等LLMs在单/多智能体模式下的表现,探究其在AI辅助可视化中检测修复数据问题的能力,发现其在单字段问题上表现良好但在时间等问题上存在不足,并提出智能体可视化系统的设计启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21422 2026-08-25 cs.CV math.AT 新提交 50%

Topology of a Smile: Persistent Homology in Dental Imaging

微笑的拓扑:牙科成像中的持续同调

Leon Dahlmeier, Sara Kališnik, Albert Mehl, Bastian Rieck

机构 * ETH Zürich(苏黎世联邦理工学院) PSU(宾夕法尼亚州立大学) University of Zürich(苏黎世大学) University of Fribourg(弗里堡大学)

专题命中 推理与问题求解 :prompting(abstract)

AI总结 该研究将拓扑数据分析中的持续同调与支持向量机结合,实现CBCT扫描中牙齿分类与诊断,准确率优于CNN,为牙科成像的自动化分析提供了新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21032 2026-08-24 cs.RO 新提交 50%

Roadside-Cooperative Autonomous Driving: From Data Platform to Vision-Language End-to-End Reasoning

路侧协同自动驾驶:从数据平台到视觉-语言端到端推理

Yitao Xu, Tong Wu, Yiyan Wu, Guoji Xu, Yanbo Jiang, Jiahao Wang, Zehong Ke, Junkai Jiang, Fang Zhang, Jianqiang Wang

专题命中 推理与问题求解 :language model(abstract)

AI总结 针对现有V2X基准的局限,推出V2XBench平台与Chat-V2XBench数据集,提出AURORA端到端协同驾驶框架,其在严重遮挡场景下路径完成率达98.21%、驾驶得分76.02,开创了可扩展的V2X-VLM范式。

Comments 15 pages, 5 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20720 2026-08-24 cs.CV 新提交 50%

AffordAny: Open-World 3D Affordance Grounding from Monocular RGB Images via Vision-Language-Guided Geometric Reasoning

AffordAny:基于单目RGB图像的开放世界3D affordance grounding,通过视觉-语言引导的几何推理实现

Junqi Wu, Kaihua Tang, Xuanwen Chen, Hongzhi Li, Jianqiang Huang, Xian-Sheng Hua

专题命中 推理与问题求解 :language model(abstract)

AI总结 AffordAny是端到端框架,通过单目RGB图像结合VLM引导解码器与伪标签自训练,实现开放世界3D affordance grounding,在未见对象、类别等评估中表现出有效性与鲁棒性。

Comments The code and dataset are publicly available. Code: https://github.com/lzlfwow/AffordAny. Dataset: https://modelscope.cn/datasets/lzlfwow/AffordAny

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20699 2026-08-24 cs.CV 新提交 50%

ArtiMo: Agent-Driven Articulated Mesh Animation

ArtiMo:智能体驱动的关节网格动画

Chunyu Zou, Peng Dai, Yi-Hua Huang, Ze Yuan, Jingwei Huang, Yeming Yao, Xiaojuan Qi

专题命中 推理与问题求解 :language model(abstract)

AI总结 ArtiMo是一种智能体驱动的零样本框架,结合URDF运动学约束与LLMs/VLMs,生成文本引导的关节网格动画,通过视觉自改进机制修正错误,在新基准数据集上优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19164 2026-08-20 cs.CY cs.HC 新提交 50%

LearnAI: Just-in-Time AI Co-Creation Across Disciplines at a University

LearnAI:大学跨学科即时AI协同创作

Weihao Qu, Ling Zheng, Chris Buzaid, Daniel Crawford

专题命中 推理与问题求解 :prompting(abstract)

AI总结 该研究提出LearnAI两层AI协同创作框架,试点后发现其能帮助不同能力学习者转变对AI的认知,贡献了可实用的AI教育框架及初步证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18833 2026-08-20 cs.CV 新提交 50%

EVADE: Evidence-Verified Agentic Diagnosis with Escape

EVADE:带弃权机制的证据验证智能诊断方法

Mohaimenul Azam Khan Raiaan, Nur Mohammad Fahad

机构 * Monash University(莫纳什大学) Murdoch University(默多克大学)

专题命中 推理与问题求解 :language model(abstract)

AI总结 该研究针对医学VLMs不可靠问题,提出无需训练的EVADE方法,通过跨图像视图验证一致性并引入弃权机制,在多医学VQA数据集上提升了校准度与选择性风险,同时维持了准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19008 2026-08-20 physics.ao-ph 新提交 50%

Extremes on Rewind: Generating 1,000-Member Ensembles Initialized at a Final Condition

回溯极端事件:在最终状态条件下初始化生成1000成员集合

Jerry Lin, Mu-Ting Chien, Mansi Sakarvadia, Elizabeth A. Barnes

专题命中 推理与问题求解 :foundation model(abstract)

AI总结 本研究使用非自回归基础模型cBottle-video生成1000成员集合,针对三个极端事件验证了终点约束集合的多样性与有效性,为罕见高影响事件的情景规划提供了高效方案。

Comments 38 pages, 21 figures; includes 17 pages of Supporting Information with 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17535 2026-08-19 cs.CV 新提交 50%

GroupForward: Building Referable 3D Scenes via Instance-Grouped Feed-Forward Gaussian Splatting

GroupForward:通过实例分组前馈高斯溅射构建可参考的3D场景

Qijian Tian, Zimeng Wu, Xuhong Wang, Lizhuang Ma, Xin Tan

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院)

专题命中 推理与问题求解 :language model(abstract)

AI总结 GroupForward是一种实例分组前馈高斯溅射模型,可从稀疏多视图图像重建3D场景,结合RSRF实现复杂3D参考推理,提升了语义重建与参考推理的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15788 2026-08-18 cs.CV 新提交 50%

ChainSpace: A Chained-Reasoning Paradigm for Spatial Intelligence

ChainSpace:面向空间智能的链式推理范式

Xiaohan Zhang, Feng Gu, Xudong Rao, Xuhao Pan, Tao Wei, Zhou Pan, Kun Zhan

机构 * College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院) Li Auto Inc.(理想汽车有限公司)

专题命中 推理与问题求解 :foundation model(abstract)

AI总结 针对现有空间推理方法的缺陷,提出ChainSpace链式推理范式,构建对应基准与训练框架,相关模型在基准上表现最优且可迁移至多类外部基准,为空间智能评估与学习提供有效方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10838 2026-08-12 cs.CV 新提交 50%

PolyLayout: Hierarchical VLM-Guided Layout Generation Beyond Rectangular Rooms

PolyLayout:超越矩形房间的分层VLM引导布局生成

Yutong Jiang, Zahra Atashgahi, Carlos Soto Garcia Delgado, Ruben Brokkelkamp, Davide Zanutto, Efşan Sökmen, Shahin Shahkarami

机构 * IKEA Retail (Ingka Group)(宜家零售(英卡集团))

专题命中 推理与问题求解 :language model(abstract)

AI总结 PolyLayout提出混合分层VLM引导框架,分三阶段生成非矩形房间布局,在生产数据和不规则拓扑上表现出高感知合理性、低延迟,填补了学术与实际应用的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏