arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7441 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7441 篇

2605.14413 2026-05-15 cs.LG cs.AI 62%

MahaVar: OOD Detection via Class-wise Mahalanobis Distance Variance under Neural Collapse

MahaVar: 通过神经崩溃下类内马哈拉诺斯距离方差实现分布外检测

Donghwan Kim, Hyunsoo Yoon

机构 * Department of Industrial Engineering(工业工程系) Yonsei University(延世大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出MahaVar方法,利用类内马哈拉诺斯距离方差作为分布外检测指标,在CIFAR-100和ImageNet上取得最佳性能。

Comments 29 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14389 2026-05-15 cs.AI cs.CL cs.LG 62%

Nexus : An Agentic Framework for Time Series Forecasting

Nexus:一个用于时间序列预测的代理框架

Sarkar Snigdha Sarathi Das, Palash Goyal, Mihir Parmar, Nanyun Peng, Vishy Tirumalashetty, Chun-Liang Li, Rui Zhang, Jinsung Yoon, Tomas Pfister

机构 * Google(谷歌) Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 Nexus框架通过分解预测任务,整合上下文信息,提升时间序列预测的准确性与可解释性,超越传统模型和LLM的局限。

Comments 30 Pages, 3 figures, 5 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04506 2026-05-14 cs.CV cs.AI 62%

Ilov3Splat: Instance-Level Open-Vocabulary 3D Scene Understanding in Gaussian Splatting

Ilov3Splat:基于高斯散射的实例级开放词汇3D场景理解

Binh Long Nguyen, Kien Nguyen, Sridha Sridharan, Clinton Fookes, Peyman Moghadam

机构 * School of Electrical Engineering and Robotics(电气工程与机器人学学院) Queensland University of Technology(昆士兰理工大学) CSIRO Robotics(CSIRO机器人部) CSIRO

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Ilov3Splat框架,通过增强高斯散射以实现实例级开放词汇3D场景理解,利用多分辨率哈希嵌入和对比损失提升语言语义关联与实例区分能力。

Comments The International Conference on Pattern Recognition (ICPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23013 2026-05-14 cs.CV cs.LG 62%

SubspaceAD: Training-Free Few-Shot Anomaly Detection via Subspace Modeling

SubspaceAD:通过子空间建模实现无训练少样本异常检测

Camile Lendering, Erkut Akdag, Egor Bondarev

机构 * AIMS Group, Department of Electrical Engineering, Eindhoven University of Technology(AIMS组,电气工程系,埃因霍温理工大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 SubspaceAD提出一种无需训练的少样本异常检测方法,通过冻结DINOv2模型提取正常图像的补丁特征,并利用PCA建模估计正常变化的低维子空间,从而在无训练、提示微调或内存库的情况下实现最先进的性能。

Comments Accepted to CVPR 2026. Revised version with corrected AU-PRO evaluation and recomputed metrics

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15867 2026-05-14 cs.LG cs.AI cs.CL cs.MA 62%

RDMA: Cost Effective Agent-Driven Rare Disease Mining from Electronic Health Records

RDMA: 低成本的代理驱动罕见病挖掘从电子健康记录

John Wu, Adam Cross, Jimeng Sun

机构 * Department of Computer Science, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校计算机科学系) Department of Pediatrics, University of Illinois College of Medicine Peoria(伊利诺伊大学皮奥里亚医学院儿科系)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 RDMA通过代理框架在电子健康记录中挖掘罕见病,无需特定任务训练,提升性能并降低部署成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12412 2026-05-13 cs.CL cs.AI cs.LG 62%

Stories in Space: In-Context Learning Trajectories in Conceptual Belief Space

空间中的故事:概念信念空间中的上下文学习轨迹

Eric Bigelow, Raphaël Sarfati, Daniel Wurgaft, Owen Lewis, Thomas McGrath, Jack Merullo, Atticus Geiger, Ekdeep Singh Lubana

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 研究通过故事理解探讨LLM在概念信念空间中的动态信念更新,发现信念更新可描述为低维结构流形上的轨迹,并能通过简单线性探针预测行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12178 2026-05-13 cs.AI cs.CL cs.LG 62%

Do Enterprise Systems Need Learned World Models? The Importance of Context to Infer Dynamics

企业系统需要学习的世界模型吗?上下文对推断动态的重要性

Jishnu Sethumadhavan Nair, Patrice Bechard, Rishabh Maheshwary, Surajit Dasgupta, Sravan Ramachandran, Aakash Bhagat, Shruthan Radhakrishna, Pulkit Pattnaik, Johan Obando-Ceron, Shiva Krishna Reddy Malay, Sagar Davasam, Seganrasan Subramanian, Vipul Mittal, Sridhar Krishna Nemala, Christopher Pal, Srinivas Sunkara, Sai Rajeswar

机构 * ServiceNow Mila

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了在可配置的企业环境中,代理是否仍需学习动态规则,通过实验表明运行时发现动态比离线训练更鲁棒。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11551 2026-05-13 cs.LG cs.CV cs.IT math.IT 62%

VNDUQE: Information-Theoretic Novelty Detection using Deep Variational Information Bottleneck

VNDUQE:基于深度变分信息瓶颈的信息理论新颖性检测

Aryan Gondkar, Hayder Radha, Yiming Deng

机构 * 1 Nondestructive Evaluation Lab, Department of Electrical Computer Engineering Michigan State University East Lansing, MI Email 2 Department of Electrical

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.LG

AI总结 本文提出VNDUQE方法,利用深度变分信息瓶颈进行新颖性检测和不确定性量化,通过KL散度和预测熵实现对Out-of-distribution样本的检测,实验结果显示其在新颖性检测和不确定性估计方面优于基线MSP方法。

Comments 6 pages, 3 figures, Fall 2025 version

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09051 2026-05-13 cs.LG cs.AI 62%

Model-Level GNN Explanations via Rule-to-Graph Readout for Logit Reconstruction

通过规则到图读取实现模型级GNN解释用于logit重建

Shengyao Lu, Jiuding Yang, Aedan J. DeFrates, Keith G. Mills, Baochun Li, Di Niu

机构 * University of Victoria(维多利亚大学) University of Alberta(阿尔伯塔大学) LSU ATHENA Lab(路易斯安那州立大学ATHENA实验室) University of Toronto(多伦多大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于规则的图神经网络解释框架,通过规则级读取重建logit,实现全局解释与子图接地,提升预测一致性并加快速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10833 2026-05-12 cs.CV cs.AI 62%

MMVIAD: Multi-view Multi-task Video Understanding for Industrial Anomaly Detection

MMVIAD:多视角多任务视频理解用于工业异常检测

Xiran Zhao, Jing Jin, Yan Bai, Zhongan Wang, Yifeng Sun, Yihang Lou, Xuanyu Zhu, Tao Feng, Yingna Wu

机构 * ShanghaiTech University(上海科技大学) Tsinghua University(清华大学) Meituan Inc.(美团公司) Peking University(北京大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MMVIAD,首个工业异常检测连续多视角视频数据集及多任务评估基准,通过两阶段训练流程提升模型泛化能力,在四个任务中取得优于GPT-5.4的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13896 2026-05-12 q-bio.QM cs.AI cs.CV cs.MA 62%

GenCellAgent: Generalizable, Training-Free Cellular Image Segmentation via Large Language Model Agents

GenCellAgent:基于大语言模型代理的通用、无需训练的细胞图像分割

Xi Yu, Yang Yang, Qun Liu, Yonghua Du, Sean McSweeney, Yuewei Lin

机构 * Artificial Intelligence Department, Brookhaven National Laboratory, Upton, 11973, NY, US(1 人工智能部门,布鲁赫萨尔国家实验室,乌普顿,11973,纽约,美国) National Synchrotron Light Source II, Brookhaven National Laboratory, Upton, 11973, NY, US(2 国家同步辐射光源II,布鲁赫萨尔国家实验室,乌普顿,11973,纽约,美国) Biology Department, Brookhaven National Laboratory, Upton, 11973, NY, US(3 生物学部门,布鲁赫萨尔国家实验室,乌普顿,11973,纽约,美国)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 GenCellAgent通过规划-执行-评估循环实现无需训练的细胞图像分割,自动分配最佳工具并支持文本引导分割,优于现有方法且减少标注负担。

Comments 43 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08043 2026-05-11 cs.CV cs.AI 62%

SCOPE: Structured Decomposition and Conditional Skill Orchestration for Complex Image Generation

SCOPE:结构分解与条件技能协调用于复杂图像生成

Tianfei Ren, Zhipeng Yan, Yiming Zhao, Zhen Fang, Yu Zeng, Guohui Zhang, Hang Xu, Xiaoxiao Ma, Shiting Huang, Ke Xu, Wenxuan Huang, Lionel Z. Wang, Lin Chen, Zehui Chen, Jie Huang, Feng Zhao

机构 * MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, University of Science and Technology of China(脑启发智能感知与认知 MOE 实验室,中国科学技术大学) The Hong Kong Polytechnic University(香港理工大学) Nanyang Technological University(南洋理工大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SCOPE框架,通过结构化规范和条件技能协调解决复杂图像生成中语义承诺的持续跟踪问题,通过Gen-Arena基准验证其有效性,取得优于基线的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07646 2026-05-11 cs.CL cs.AI cs.LG 62%

MAVEN: Multi-Agent Verification-Elaboration Network with In-Step Epistemic Auditing

MAVEN:具有步骤内认知审计的多智能体验证-扩展网络

Yinsheng Yao, Jiehao Tang, Zhaozhen Yang, Dawei Cheng

机构 * Tongji University(同济大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 MAVEN通过显式角色解耦将LLM转化为有意识的推理者,采用对抗性Skeptic-Researcher-Judge循环,生成可验证的模块化推理轨迹,提升多任务推理质量。

Comments 24 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07395 2026-05-11 cs.LG cs.AI cs.CL 62%

Unsolvability Ceiling in Multi-LLM Routing: An Empirical Study of Evaluation Artifacts

多LLM路由中的不可解上限:评估 artifacts 的实证研究

Saloni Garg, Amit Sagtani

机构 * Independent Researcher(独立研究者) San Francisco State University(圣弗朗西斯科州立大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文通过206000个查询-模型对研究多级LLM路由,发现大量不可解问题源于评估 artifacts,如判断偏差、截断和格式不匹配,并提出改进方法以减少不可解性。

Comments 12 pages, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05344 2026-05-08 cs.CV cs.AI cs.IR 62%

Open-SAT: LLM-Guided Query Embedding Refinement for Open-Vocabulary Object Retrieval in Satellite Imagery

Open-SAT: 一种基于LLM的查询嵌入细化方法用于卫星影像开放词汇物体检索

Md Adnan Arefeen, Biplob Debnath, Ravi K. Rajendran, Murugan Sankaradas, Srimat T. Chakradhar

机构 * North South University(北南大学) NEC Laboratories America(NEC实验室)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 Open-SAT通过LLM引导在推理阶段优化查询与卫星影像内容的对齐,提升开放词汇检索性能,实验表明其F1分数提升达16.04%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01144 2026-05-05 cs.CV cs.AI 62%

Semantic Context-aware mOdality fUsion Transformer (SCOUT): A Context-Aware Multimodal Transformer for Concept-Grounded Pathology Report Generation

语义上下文感知的多模态融合变换器(SCOUT):一种基于概念的多模态变换器,用于病理报告生成

Suryakant Singh, Saarthak Kapse, Joel Saltz, Prateek Prasanna

机构 * Stony Brook University(石桥大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 SCOUT通过整合局部组织学模式、整张滑片上下文和专家编纂的语义描述符,实现病理报告生成的语义上下文感知,提升临床相关性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05534 2026-05-05 cs.LG cs.AI 62%

A Unified Theory of Sparse Dictionary Learning in Mechanistic Interpretability: Piecewise Biconvexity and Spurious Minima

稀疏字典学习在机制可解释性中的统一理论:分段双凸性与虚假极值

Yiming Tang, Harshvardhan Saini, Zhaoqian Yao, Zheng Lin, Yizhen Liao, Jingyi Cui, Yisen Wang, Mengnan Du, Dianbo Liu

机构 * National University of Singapore(新加坡国立大学) Indian Institute of Technology, Dhanbad(印度德里理工学院) Chinese University of Hong Kong(香港中文大学) Hong Kong University of Science and Technology(香港科学与技术大学) Peking University(北京大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出稀疏字典学习的统一理论,揭示其分段双凸性及虚假极值问题,通过线性表示基准揭示路径学,提出特征锚定技术提升特征恢复性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13305 2026-05-04 cs.CV cs.AI 62%

WildfireVLM: AI-powered Analysis for Early Wildfire Detection and Risk Assessment Using Satellite Imagery

WildfireVLM:基于卫星影像的AI分析用于早期野火检测与风险评估

Aydin Ayanzadeh, Prakhar Dixit, Sadia Kamal, Milton Halem

机构 * Department of Computer Science and Electrical Engineering(计算机科学与电气工程系) University of Maryland, Baltimore County(马里兰大学巴尔的摩分校)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 WildfireVLM结合卫星影像检测与语言驱动的风险评估,利用YOLOv12检测火区与烟雾,并通过多模态大语言模型生成风险评估和应急响应建议,验证其有效性并实现实时处理与长期追踪。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28181 2026-05-01 cs.AI cs.CL cs.LG 62%

Synthetic Computers at Scale for Long-Horizon Productivity Simulation

大规模合成计算机用于长期生产力模拟

Tao Ge, Baolin Peng, Hao Cheng, Jianfeng Gao

机构 * Microsoft(微软)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出大规模合成计算机方法,通过生成真实文件夹结构和内容丰富的 artifacts,模拟长期生产力场景,验证了其在不同领域中的有效性。

Comments Preview version; work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12632 2026-05-01 cs.CV cs.LG 62%

TeD-Loc: Text Distillation for Weakly Supervised Object Localization

TeD-Loc: 文本蒸馏用于弱监督目标定位

Shakeeb Murtaza, Soufiane Belharbi, Alexis Guichemerre, Marco Pedersoli, Eric Granger

机构 * LIVIA, ILLS, Dept. of Systems Engineering, ETS Montreal, Canada(LIVIA、ILLs、系统工程系、蒙特利尔工程学院,加拿大)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 TeD-Loc通过对比对齐将CLIP文本嵌入迁移到patch嵌入,实现patch级的前景/背景定位,并引入定位引导的分类模块以提升定位与分类的联合性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22477 2026-04-30 cs.CV cs.LG 62%

Contrastive Semantic Projection: Faithful Neuron Labeling with Contrastive Examples

对比语义投影:利用对比示例实现忠实的神经元标注

Oussama Bouanani, Jim Berend, Wojciech Samek, Sebastian Lapuschkin, Maximilian Dreyer

机构 * Fraunhofer Heinrich Hertz Institute(弗劳恩霍夫海因里希·赫兹研究所) Technische Universität Berlin(柏林技术大学) BIFOLD – Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究所) Centre of eXplainable Artificial Intelligence, Technological University Dublin(可解释人工智能中心,都柏林技术大学)

专题命中 视觉定位与Grounding :vision language model(abstract);分类 cs.CV、cs.LG

AI总结 本文提出对比语义投影(CSP),通过视觉语言模型生成候选标签并结合CLIP-like编码器进行标签分配,改进神经元标注的准确性和语义粒度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26522 2026-04-30 cs.AI cs.LG cs.LO cs.MA cs.SC 62%

AGEL-Comp: A Neuro-Symbolic Framework for Compositional Generalization in Interactive Agents

AGEL-Comp: 一种用于交互智能体组合泛化能力的神经符号框架

Mahnoor Shahid, Hannes Rothe

机构 * Universität Duisburg-Essen(杜伊斯堡- Essen大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 AGEL-Comp通过动态因果程序图、归纳逻辑编程引擎和混合推理核心,实现基于符号和神经网络的组合泛化学习,优于纯LLM模型。

Comments Accepted at IntelliSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14135 2026-04-27 cs.LG cs.AI cs.GT cs.MA 62%

AdaFair-MARL: Enforcing Adaptive Fairness Constraints in Multi-Agent Reinforcement Learning

AdaFair-MARL:在多智能体强化学习中强制适应性公平性约束

Promise Ekpo, Saesha Agarwal, Felix Grimm, Lekan Molu, Angelique Taylor

机构 * Cornell Tech(康奈尔科技) Cornell University(康奈尔大学) Bala-Cynwyd, PA, USA(巴拉-辛威德, 美国宾夕法尼亚州)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AdaFair-MARL框架,通过将工作负载公平性作为显式约束,使智能体在优化团队性能的同时保持贡献平衡,实验表明其在医院协调环境中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15594 2026-04-24 cs.LG cs.CV 62%

Analytical Softmax Temperature Setting from Feature Dimensions for Model- and Domain-Robust Classification

基于特征维度的分析softmax温度设置用于模型和领域鲁棒分类

Tatsuhito Hasegawa, Shunsuke Sakai

机构 * Graduate School of Engineering, University of Fukui(福井大学工学研究院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.LG

AI总结 本文提出基于特征维度确定softmax温度的理论方法,通过优化温度系数和批量归一化层,实现无训练的温度设置,提升分类鲁棒性。

Comments 22 pages, 11 figures, under review

Journal ref Neural Computing and Applications 37, 27985-28016, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20368 2026-04-23 cs.CV cs.AI 62%

LaplacianFormer:Rethinking Linear Attention with Laplacian Kernel

LaplacianFormer:重新思考线性注意力与拉普拉斯核

Zhe Feng, Sen Lian, Changwei Wang, Muyang Zhang, Tianlong Tan, Rongtao Xu, Weiliang Meng, Xiaopeng Zhang

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学) China Electronics Data Corporation(中国电子数据公司) Institute of Computing Technology, Chinese Academy of Sciences(计算技术研究所,中国科学院) The Key Laboratory of Computing Power Network and Information Security, Ministry of Education, Shandong Computer Science Center, Qilu University of Technology(计算能力网络与信息安全重点实验室,教育部,山东计算机科学中心,齐鲁大学) Shandong Provincial Key Laboratory of Computing Power Internet and Service Computing, Shandong Fundamental Research Center for Computer Science(山东省计算能力互联网与服务计算重点实验室,山东省计算机科学基础研究中心) Spatialtemporal AI(时空人工智能)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 LaplacianFormer通过引入拉普拉斯核替代softmax,解决高分辨率视觉任务中注意力机制的二次复杂度问题,提升表达能力并优化计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08620 2026-04-22 cs.AI cs.CV 62%

ViDoRe V3: A Comprehensive Evaluation of Retrieval Augmented Generation in Complex Real-World Scenarios

ViDoRe V3:对复杂现实场景中检索增强生成的综合评估

António Loison, Quentin Macé, Antoine Edy, Victor Xing, Tom Balough, Gabriel Moreira, Bo Liu, Manuel Faysse, Céline Hudelot, Gautier Viaud

机构 * Illuin Technology(Illuin技术公司) NVIDIA CentraleSupélec, Paris-Saclay(巴黎萨克雷中央理工学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 ViDoRe V3是一个多模态检索增强生成基准,涵盖10个专业领域数据集,通过12000小时人工标注评估先进RAG管道,发现视觉检索优于文本检索,晚期交互模型和文本重排序显著提升性能,但模型在非文本元素、开放性查询和细粒度视觉定位上仍有不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15115 2026-04-21 cs.CV cs.AI cs.CL 62%

Self-Correcting Text-to-Video Generation with Misalignment Detection and Localized Refinement

具有对齐检测和局部细化的自纠正文本到视频生成

Daeun Lee, Jaehong Yoon, Jaemin Cho, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) NTU Singapore(新加坡国立大学) Allen Institute for AI(人工智能研究院) Johns Hopkins University(约翰霍普金斯大学)

专题命中 视觉定位与Grounding :MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VideoRepair框架,通过检测并修正视频与文本提示的对齐问题,提升生成质量。框架分为三个阶段,保留正确生成区域并针对性修正错误部分,有效提升多种对齐指标。

Comments Accepted to ACL 2026 Findings. Project page: https://video-repair.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16683 2026-04-21 cs.RO cs.AI cs.CV 62%

Rewind-IL: Online Failure Detection and State Respawning for Imitation Learning

Rewind-IL:在线故障检测与状态重置用于模仿学习

Gehan Zheng, Sanjay Seenivasan, Matthew Johnson-Roberson, Weiming Zhi

机构 * College of Connected Computing, Vanderbilt University(范德比尔特大学连接计算学院) School of Computer Science, University of Waterloo(滑铁卢大学计算机科学学院) School of Computer Science, The University of Sydney(悉尼大学计算机科学学院) Australian Centre for Robotics, The University of Sydney(悉尼大学机器人研究中心)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 Rewind-IL通过零样本故障检测和状态重置机制,提升模仿学习在长时域任务中的可靠性,解决执行漂移问题。

Comments 9 pages, 8 figures, 6 tables. Project page at https://sjay05.github.io/rewind-il

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16587 2026-04-21 cs.CV cs.AI 62%

Real-Time Visual Attribution Streaming in Thinking Model

多模态思维模型中的实时视觉归因流

Seil Kang, Woojung Han, Junhyeok Kim, Jinyeong Kim, Youngeun Kim, Seong Jae Hwang

机构 * Seil Kang Woojung Han Junhyeok Kim Jinyeong Kim Youngeun Kim Seong Jae Hwang

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种用于多模态思维模型实时视觉归因流的近似框架,通过学习从注意力特征中直接估计语义区域的因果效应,实现轻量级学习而非暴力计算的高保真归因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12831 2026-04-21 cs.CL cs.AI cs.DB cs.LG 62%

MTSQL-R1: Towards Long-Horizon Multi-Turn Text-to-SQL via Agentic Training

MTSQL-R1:通过代理训练实现长视界多轮文本到SQL

Taicheng Guo, Hai Wang, ChaoChun Liu, Mohsen Golalikhani, Xin Chen, Xiangliang Zhang, Chandan K. Reddy

机构 * University of Notre Dame(诺特丹大学) Amazon(亚马逊) Salesforce

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 MTSQL-R1通过代理训练框架提升多轮文本到SQL任务的长视界表现,通过环境驱动验证和记忆引导细化提升对话连贯性。

Comments ACL 2026 Main camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏