arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 908 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 908 篇

2505.11579 2026-06-23 cs.CY cs.AI cs.HC cs.LG cs.MA 版本更新 62%

Towards Adaptive Categories: Dimensional Governance for Agentic AI

迈向自适应分类:面向智能体AI的维度治理

Zeynep Engin, David Hand

机构 * The Digital Statecraft Academy(数字国家学府) Department of Computer Science, University College London (UCL)(伦敦大学学院计算机系) Department of Mathematics, Imperial College London(伦敦帝国学院数学系)

专题命中 推理与问题求解 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 提出维度治理框架,通过追踪决策权、过程自主性和问责制(3A)的动态分布,实现自适应分类,以应对传统分类框架在动态AI系统中的不足。

Comments 12 pages core text, 15 pages including references, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08392 2026-06-23 cs.CL cs.AI 版本更新 62%

Adaptive GoGI-Skip: Coupling Goal-Gradient Importance with Dynamic Uncertainty for Efficient Reasoning

自适应GoGI-Skip:耦合目标梯度重要性与动态不确定性以实现高效推理

Ren Zhuang

机构 * School of Information Science and Technology, Hangzhou Normal University(信息科学与技术学院,杭州师范大学)

专题命中 推理与问题求解 :prompting(abstract);分类 cs.CL、cs.AI

AI总结 提出Adaptive GoGI-Skip框架,通过非线性耦合目标梯度重要性和自适应动态跳过,在保持推理准确性的同时减少45%以上令牌量,加速高达2倍。

Comments 19 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04917 2026-06-19 cs.CV cs.AI cs.CL 版本更新 62%

Vero: An Open RL Recipe for General Visual Reasoning

Vero: 通用视觉推理的开放RL配方

Gabriel Sarch, Linrong Cai, Qunzhong Wang, Haoyang Wu, Danqi Chen, Zhuang Liu

机构 * Princeton University(普林斯顿大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI

AI总结 提出Vero系列开放视觉语言模型,通过构建600K样本数据集Vero-600K和任务路由奖励,在30个基准测试中平均提升2.9-5.4点,Vero-Qwen3I-8B超越Qwen3-VL-8B-Thinking 3.8点。

Comments Project page: https://vero-reasoning.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12279 2026-06-16 cs.CV cs.AI cs.LG 版本更新 62%

UniT: Unified Multimodal Chain-of-Thought Test-time Scaling

UniT:统一多模态思维链测试时扩展

Leon Liangyu Chen, Haoyu Ma, Zhipeng Fan, Ziqi Huang, Animesh Sinha, Xiaoliang Dai, Jialiang Wang, Zecheng He, Jianwei Yang, Chunyuan Li, Junzhe Sun, Chu Wang, Serena Yeung-Levy, Felix Juefei-Xu

机构 * Stanford University(斯坦福大学) Meta Superintelligence Labs(Meta超级智能实验室) Nanyang Technological University(南洋理工大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出UniT框架,通过多轮推理、验证和细化实现统一多模态模型的测试时扩展,实验表明短推理轨迹可泛化到长链,顺序思维链比并行采样更高效。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14860 2026-06-11 cs.CV cs.AI cs.CL cs.MA 版本更新 62%

MARIC: Multi-Agent Reasoning for Image Classification

MARIC:用于图像分类的多智能体推理

Wonduk Seo, Minhyeong Yu, Hyunjin An, Seunghyun Lee

机构 * Enhans, Seoul, South Korea(韩国首尔Enhans) Peking University, Beijing, China(中国北京北京大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI

AI总结 提出多智能体框架MARIC,通过分解图像分类为协作推理过程,利用大纲智能体、方面智能体和推理智能体进行多视角分析与综合,在四个基准数据集上显著优于基线方法。

Comments 11 pages, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04514 2026-06-10 cs.AI cs.CE cs.CL cs.CV stat.ME 版本更新 62%

ChartAgent: A Multimodal Agent for Visually Grounded Reasoning in Complex Chart Question Answering

ChartAgent: 一种用于复杂图表问答中视觉基础推理的多模态智能体

Rachneet Kaur, Nishan Srishankar, Zhen Zeng, Sumitra Ganesh, Manuela Veloso

机构 * J.P. Morgan AI Research(摩根大通人工智能研究)

专题命中 推理与问题求解 :LLM(abstract_cn);分类 cs.CL、cs.AI

AI总结 提出ChartAgent框架,通过迭代分解查询为视觉子任务并利用图表专用视觉工具(如绘制注释、裁剪区域)进行空间域推理,在ChartBench和ChartX上取得最先进性能,尤其对无标注图表提升显著。

Comments Accepted at ACL 2026 (Main Conference). Also presented as an oral paper at the NeurIPS 2025 Multimodal Algorithmic Reasoning Workshop (https://marworkshop.github.io/neurips25/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11995 2026-06-10 cs.CV cs.AI cs.LG 版本更新 62%

V-REX: Benchmarking Exploratory Visual Reasoning via Chain-of-Questions

V-REX: 通过问题链进行探索性视觉推理的基准测试

Chenrui Fan, Yijun Liang, Shweta Bhardwaj, Kwesi Cobbina, Ming Li, Tianyi Zhou

机构 * University of Maryland, College Park(马里兰大学学院市分校) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出V-REX基准,通过问题链将多步探索推理分解为规划和遵循能力,评估视觉语言模型在复杂开放任务中的表现。

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00229 2026-06-09 cs.RO cs.AI cs.LG 版本更新 62%

Continuous Reasoning for Vision-Language-Action

视觉-语言-动作的连续推理

Yueh-Hua Wu, Tatsuya Matsushima, Kei Ota

机构 * Airoa

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 针对视觉-语言-动作策略中语言与连续控制粒度不匹配的问题,提出一种可共享、可验证的连续推理方法,通过高斯潜变量接口和自验证目标提升机器人任务成功率。

Comments Project page: https://continuous-reasoning.airoa.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20256 2026-08-24 cs.AI 版本更新 57%

Learning When to Think: Adaptive Reasoning for Test-Time Compute Allocation

学习何时思考:面向测试时计算分配的自适应推理

Gijs Kassenaar, Zhao Yang, Vincent François-Lavet

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 该研究提出基于GRPO的自适应推理模型,通过三种模式选择分配测试时计算,在MATH数据集上减少41%响应长度且保留高准确率,还可迁移至其他基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11907 2026-08-21 cs.CV cs.AI 版本更新 57%

A Model-Internal Protocol for Assessing Multimodal Models as Integrated Systems

你能看到你所绘制的内容吗?面向统一多模态模型整体评估的语义闭环框架

Hao Zhang, Jiaxin Qi, Zhijiang Tang, Jianqiang Huang

机构 * Hangzhou Institute for Advanced Study(杭州高等研究院) University of Chinese Academy of Sciences(中国科学院大学) Computer Network Information Center(计算机网络信息中心) Chinese Academy of Sciences(中国科学院)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 本研究针对统一多模态模型的系统级评估缺口,提出无标注的SGU语义闭环框架,通过感知-生成-推理流程评估模型综合能力,发现高性能模型存在自生成上下文推理局限,为下一代模型开发提供基准基础。

Comments 21 pages, 8 figures, 12 tables. Title updated; author contribution and corresponding-author notes added. Hao Zhang and Jiaxin Qi contributed equally; Jianqiang Huang is the corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17417 2026-08-21 cs.LG physics.chem-ph physics.comp-ph quant-ph 版本更新 57%

Grounded verification of chemical and materials reasoning: detection is the bottleneck

化学与材料推理的有根据验证:检测是瓶颈

Can Polat, Mustafa Kurban, Erchin Serpedin, Hasan Kurban

专题命中 推理与问题求解 :language model(abstract);分类 cs.LG

AI总结 研究针对大语言模型在化学推理中虚构对象的问题,提出分层验证器,通过与数据库核对及门控校正减少公式错误,检索次数大幅减少,修复成功率高,但检测召回率是瓶颈,基于事实验证可提高答案质量,长尾错误处提升明显。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03115 2026-08-20 cs.CL cs.SD 版本更新 57%

Listening or Reading? Evaluating Speech Awareness in Chain-of-Thought Speech-to-Text Translation

聆听还是阅读?评估思维链语音到文本翻译中的语音感知能力

Jacobo Romero-Díaz, Gerard I. Gállego, Oriol Pareras, Federico Costa, Javier Hernando, Cristina España-Bonet

机构 * Barcelona Supercomputing Center, Spain(巴塞罗那超级计算中心) Universitat Politècnica de Catalunya, Spain(加泰罗尼亚理工大学) DFKI GmbH, Saarland Informatics Campus, Saarbrücken, Germany(DFKI GmbH萨尔兰信息技术校区)

专题命中 推理与问题求解 :prompting(abstract);分类 cs.CL

AI总结 该研究评估CoT式S2TT系统的语音感知能力,发现其仍依赖转录文本,未充分利用语音,需构建明确整合声学信息的翻译架构。

Comments Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12898 2026-08-19 cs.CV cs.AI 版本更新 57%

NaviDC-OCR: Navigating Document Parsing Across Digital and Camera-Captured Documents

NaviDC-OCR:面向数字文档与相机拍摄文档的解析导航

Peng Cai, Zhaofan Zou, Shifa Liu, Yikun Wang, Jiawei Tang, Kaicheng Yang, Meng Tong, MingKun Jiang, Zhongjiang He, Hao Sun

机构 * China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd.(中国电信人工智能技术(北京)有限公司)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 针对现有文档解析方法的两大挑战,本文提出NaviDC-OCR框架,通过形变感知学习、自适应采样及内容-结构解耦学习策略,在多基准测试中取得最优性能并获ICDAR 2026相关挑战第一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18046 2026-08-19 cs.LG 版本更新 57%

SEE: Structure-aware Exploring & Exploiting for Long-horizon GUI Agent Trajectory Synthesis

SEE:用于长视野GUI代理轨迹合成的结构感知探索与利用

Zhuohang Fan, Beichen Zhang, Yuanfa Li, Changqiao Wu, Wei Liu, Jian Luan, Weigang Zhang

机构 * Harbin Institute of Technology, Weihai(哈尔滨工业大学(威海)) Harbin Institute of Technology (Weihai) Qingdao Research Institute(哈尔滨工业大学(威海)青岛研究院)

专题命中 推理与问题求解 :language model(abstract);分类 cs.LG

AI总结 针对GUI代理轨迹合成中缺乏高覆盖率长视野轨迹的问题,提出SEE两阶段数据合成框架,通过高效探索和基于图的合成,产生可重复可解释数据,避免虚假循环,提升代理任务成功率和泛化能力,还将发布代码和数据集。

Comments Accepted (Oral) by ACM International Conference on Multimedia 2026 (ACM MM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09508 2026-08-19 cs.CV cs.AI 版本更新 57%

VISOR: Agentic Visual Retrieval-Augmented Generation via Iterative Search and Over-horizon Reasoning

VISOR: 通过迭代搜索和超视距推理实现基于视觉检索的增强生成

Yucheng Shen, Jiulong Wu, Jizhou Huang, Dawei Yin, Lingyong Yan, Min Cao

机构 * Soochow University(苏州大学) Baidu Inc.(百度公司)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 VISOR通过结构化证据空间和动态轨迹机制解决多步推理中的视觉证据稀疏和搜索漂移问题,实现高效长视距视觉推理。

Comments Accepted by ACM Multimedia 2026 (MM '26). 8 pages, 3 figures. Code: https://github.com/syc1336/VISOR

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04120 2026-08-18 cs.CL 版本更新 57%

Shorter, but Still Trustworthy? An Empirical Study of Chain-of-Thought Compression

更短,但依然可信?链式推理压缩的实证研究

Lingjie Zeng, Xiaofan Chen, Yanbo Wang, Xiuying Chen

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 推理与问题求解 :post-training(abstract);分类 cs.CL

AI总结 本文实证研究了链式推理压缩对模型可信度的影响,评估了不同模型在安全、抗幻觉和多语言鲁棒性上的表现,提出标准化效率评分以揭示信任度权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17006 2026-08-18 cs.AI 版本更新 57%

Budget-Aware Tool Use Enables Effective Agent Scaling

预算感知的工具使用实现有效的代理扩展

Tengxiao Liu, Zifeng Wang, Jin Miao, I-Hung Hsu, Jun Yan, Jiefeng Chen, Rujun Han, Fangyuan Xu, Yanfei Chen, Ke Jiang, Samira Daruki, Yi Liang, William Yang Wang, Tomas Pfister, Chen-Yu Lee

机构 * Google Cloud AI Research(谷歌云人工智能研究) Google DeepMind(谷歌DeepMind) New York University(纽约大学) UC Santa Barbara(加州大学圣塔芭芭拉分校)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 本研究提出BATS框架,通过预算感知机制提升工具增强代理的扩展效率,实现更优的成本-性能平衡。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12399 2026-08-18 cs.LG stat.ML 版本更新 57%

ROC-n-reroll: How verifier imperfection affects test-time scaling

ROC-n-reroll:验证器缺陷对测试时缩放的影响

Florian E. Dorner, Yatong Chen, André F. Cruz, Fanny Yang

机构 * ETH Zürich(苏黎世联邦理工学院) Max Planck ETH Center for Learning Systems(马克斯·普朗克ETH学习系统中心) Max Planck Institute for Intelligent Systems, Tübingen(图宾根马克斯·普朗克智能系统研究所) Tübingen AI Center(图宾根人工智能中心)

专题命中 推理与问题求解 :language model(abstract);分类 cs.LG

AI总结 本工作针对测试时缩放中验证器缺陷的理论空白,证明相关方法的实例级精度由验证器ROC曲线几何刻画,经Qwen、LLaMA模型在指定数据集上验证,得出RS与BoN在不同计算条件下的性能规律。

Comments 47 pages, 10 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08567 2026-08-14 cs.LG 版本更新 57%

Neural Message Passing on Structural Interaction Graphs for Fully-Inductive Graph Neural Networks

面向全归纳图神经网络的结构交互图上的神经消息传递

Omer Yom-Tov, Avigdor Gal

专题命中 推理与问题求解 :foundation model(abstract);分类 cs.LG

AI总结 该研究提出SIGIL框架,通过结构交互图和关系消息传递网络实现图特征的统一表示,可用于全归纳链接预测,还能统一多种图基础模型设计范式。

Comments 7 pages, 1 figure in the main body. 12 pages, 5 figures in appendix. Submitted to AAAI 2027 (main track) and currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20017 2026-08-14 cs.CL 版本更新 57%

QUIETT: Query-Independent Table Transformation for Robust Reasoning

QUIETT:查询无关的表格转换以实现稳健的推理

Gaurav Najpande, Tampu Ravi Kumar, Manan Roy Choudhury, Neha Valeti, Yanjie Fu, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学)

专题命中 推理与问题求解 :prompting(abstract);分类 cs.CL

AI总结 QuIeTT通过查询无关的表格转换框架,提升表格推理的可靠性和效率,实验显示在多个基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17905 2026-08-14 cs.CL 版本更新 57%

Pandora: Leveraging Code-driven Knowledge Transfer for Unified Structured Knowledge Reasoning

Pandora:利用代码驱动的知识迁移实现统一结构化知识推理

Yongrui Chen, Junhao He, Linbo Fu, Shenyu Zhang, Rihui Jin, Xinbang Dai, Jiaqi Li, Dehai Min, Nan Hu, Yuxin Zhang, Guilin Qi, Yi Huang, Tongtong Wu

机构 * Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education(新一代人工智能技术及交叉应用重点实验室(东南大学)) China Mobile Research(中国移动研究院) Monash University(莫纳什大学)

专题命中 推理与问题求解 :LLM(abstract_cn);分类 cs.CL

AI总结 本文提出Pandora框架,采用Python的Pandas API构建统一知识表示,结合代码驱动的知识迁移,在六个基准测试中优于现有统一推理框架。

Comments Accepted in IEEE TKDE (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00945 2026-08-12 cs.LG cs.CY 版本更新 57%

TS-Mob: Social and Geographical-Aware Time Series Foundation-Model Framework for Human Mobility Prediction

TS-Mob:面向人类移动性预测的社交与地理感知时间序列基础模型框架

Massimiliano Luca, Ciro Beneduce, Bruno Lepri

机构 * MobS Lab, Bruno Kessler Foundation(布鲁诺·凯瑟林基金会移动实验室) Department of Computer Science, University of Trento(特伦托大学计算机科学系)

专题命中 推理与问题求解 :foundation model(abstract);分类 cs.LG

AI总结 TS-Mob框架通过结合地理社交信号与天气协变量微调TimesFM模型,在多类移动性预测基准上显著优于各类基线,且在不同时间区间表现稳健。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11741 2026-08-11 cs.AI 版本更新 57%

Collaborative Multi-Agent Scripts Generation for Enhancing Imperfect-Information Reasoning in Murder Mystery Games

协作多智能体脚本生成以增强谋杀谜游戏中的不完全信息推理

Keyang Zhong, Junlin Xie, Hefeng Wu, Haofeng Li, Guanbin Li

机构 * Sun Yat-sen University(中山大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 本文提出协作多智能体框架,通过生成丰富多模态上下文提升VLMs在叙事推理和欺骗鲁棒性中的表现,解决多玩家游戏中不完全信息下的复杂推理问题。

Comments 9 pages, 5 figures, Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08910 2026-08-11 cs.CL 版本更新 57%

SciTaRC: A Plan-Annotated Scientific Tabular QA Benchmark for Language Reasoning and Complex Computation

SciTaRC:基于科学表格数据的问答基准测试,需语言推理与复杂计算

Hexuan Wang, Yaxuan Ren, Srikar Bommireddypalli, Shuxian Chen, Adarsh Prabhudesai, Rongkun Zhou, Elina Baral, Philipp Koehn

机构 * Center for Language and Speech Processing(语言与语音处理中心) Johns Hopkins University(约翰霍普金斯大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL

AI总结 SciTaRC是一个针对科学表格数据的问答基准测试,揭示了现有AI模型在语言推理和复杂计算任务上的不足。

Comments COLM 2026 (Conference on Language Modeling). Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06076 2026-08-10 cs.AI cs.CV 版本更新 57%

Learning Visual Spatial Planning from Symbolic State via Modality-Gap-Aware Self-Distillation

通过模态差距感知自蒸馏从符号状态学习视觉空间规划

Haocheng Luo, Jiahui Liu, Ruicheng Zhang, Zhizhou Zhong, Jiaqi Huang, Zunnan Xu, Quan Shi, Jun Zhou, Shuiyang Mao, Wei Liu, Xiu Li

机构 * Tsinghua University(清华大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 提出MGSD两阶段框架,通过冷启动接地和特权教师蒸馏弥合视觉与符号规划之间的模态差距,在视觉规划基准上显著提升性能。

Comments 18 pages, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26352 2026-08-07 cs.CL 版本更新 57%

RICE-PO: Turning Retrieval Interactions into Credit Signals for Reasoning Agents

RICE-PO:将检索交互转化为推理智能体的信用信号

Mingchen Li, Hansi Zeng, Zhuo Qian, Jiatan Huang, Sunjae Kwon, Hamed Zamani, Hong Yu

机构 * University of Massachusetts, Amherst(马萨诸塞大学阿姆赫斯特分校) Texas Tech University(得克萨斯科技大学) University of Connecticut(康涅狄格大学)

专题命中 推理与问题求解 :language agent(abstract);分类 cs.CL

AI总结 提出RICE-PO框架,通过将检索交互转化为局部学习信号,解决推理型检索智能体在训练中推理步骤的信用分配问题,在BRIGHT和BEIR上优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21597 2026-08-06 cs.AI 版本更新 57%

Risk Is Not the Target: A Monotonic Framework for Evaluating Wildfire Operational Risk Signals

风险不是目标:评估野火运行风险信号的单调框架

Nicolas Caron, Christophe Guyeux, Hassan Noura, Maxime Coulmeau, Benjamin Aynes

机构 * Météo-France(法国气象局) INRAE(法国国家农业、食品与环境研究院)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 研究提出用单调评估框架衡量野火风险系统预测分数与运行负荷关系,比较DFE、GRU模型及FARS三种方法,发现DFE单调性最佳,GRU局部强但风险水平分布不佳,FARS有局限性,好风险模型应能解释运行动态。

Comments Accepted in 2026 IEEE 50th Annual Computers, Software, and Applications Conference (COMPSAC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06708 2026-08-06 cs.CL 版本更新 57%

Signal-Driven Observation for Long-Horizon Web Agents

信号驱动观测:面向长程任务的Web智能体

Shubham Gaur, Ian Lane

机构 * University of Cambridge(剑桥大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL

AI总结 提出信号驱动观测(SDO)方法,通过专用子调用读取完整DOM但仅返回任务相关元素,并由轻量信号检测器触发重新调用,解决长程Web智能体中上下文退化问题。

Comments 10 pages, 1 figure. Accepted to the Failure Modes in Agentic AI (FAGEN) Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06140 2026-08-06 cs.CV cs.AI 版本更新 57%

Place-it-R1: Unlocking Environment-aware Reasoning Potential of MLLM for Video Object Insertion

Place-it-R1: 解锁多模态大语言模型在视频物体插入中的环境感知推理潜力

Bohai Gu, Taiyi Wu, Dazhao Du, Jian Liu, Shuai Yang, Xiaotong Zhao, Alan Zhao, Song Guo

机构 * HKUST(香港科技大学) Tencent Video(腾讯视频) Peking University(北京大学)

专题命中 推理与问题求解 :preference optimization(abstract);分类 cs.AI

AI总结 Place-it-R1通过多模态大语言模型的环境感知推理能力,实现物理一致的视频物体插入,提供两种模式以平衡保真度与合理性。

Comments https://nevsnev.github.io/Place-it-R1/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01755 2026-08-05 cs.AI 版本更新 57%

Deferred Exposure of Future Trajectories for Verifiable Reasoning in Autonomous Driving VLMs

用于自动驾驶视觉语言模型可验证推理的未来轨迹延迟暴露

Zixuan Huang, Yang Zhou, Kaixuan Wang, Guli Zhang, Hongyan Xie, Yakun Zhu, Hao Geng, Xiaozhi Chen, Yikun Ban, Deqing Wang

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 该研究针对自动驾驶VLA模型的轨迹锚定偏差问题,提出AD-MCQ规划框架与DEFT-RLVR方法,将未来轨迹转化为决策后验证目标,提升了自动驾驶推理能力并保留了通用视觉能力。

详情

展开后加载摘要…

URL PDF HTML 收藏