arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7409 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7409 篇

2512.18933 2026-03-25 cs.CV cs.RO 57%

Point What You Mean: Visually Grounded Instruction Policy

指出你的意图:基于视觉的指令策略

Hang Yu, Juntu Zhao, Yufeng Liu, Kaiyu Li, Cheng Ma, Di Zhang, Yingdong Hu, Guang Chen, Junyuan Xie, Junliang Guo, Junqiao Zhao, Yang Gao

机构 * Tongji University(同济大学) Shanghai Jiao Tong University(上海交通大学) Spirit AI Tsinghua University(清华大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出Point-VLA,通过结合视觉提示提升物体指称能力,在复杂场景中实现更精准的视觉 grounding。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22289 2026-03-25 cs.CL cs.AI 57%

MERIT: Memory-Enhanced Retrieval for Interpretable Knowledge Tracing

MERIT: 用于可解释知识追踪的记忆增强检索

Runze Li, Kedi Chen, Guwei Feng, Mo Yu, Jun Wang, Wei Zhang

机构 * School of Computer Science and Technology, East China Normal University(东华师范大学计算机科学与技术学院) Shanghai Innovation Institute(上海创新研究院) WeChat AI, Tencent(微信AI,腾讯)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 MERIT提出一种无需训练的框架,结合冻结LLM推理与结构化教学记忆,通过语义去噪将学生分类为潜在认知模式,并构建模式库生成显式推理依据,提升教育诊断的可解释性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22249 2026-03-24 cs.CV 57%

EgoGroups: A Benchmark For Detecting Social Groups of People in the Wild

EgoGroups:一种用于检测真实场景中人类社交群体的基准测试

Jeffri Murrugarra-Llerena, Pranav Chitale, Zicheng Liu, Kai Ao, Yujin Ham, Guha Balakrishnan, Paola Cascante-Bonilla

机构 * Stony Brook University(石英布克大学) Rice University(里士满大学)

专题命中 视觉定位与Grounding :VLM(abstract);分类 cs.CV

AI总结 本文提出EgoGroups基准测试,通过第一视角数据集捕捉全球城市中的社交动态,评估了最新VLM/LLMs和监督模型在群体检测中的表现,发现零样本设置下VLM和LLMs优于监督基线,人群密度和文化区域显著影响模型性能。

Comments Project Page: https://lab-spell.github.io/EgoGroups/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21728 2026-03-24 cs.AI cs.CL 57%

EvoIdeator: Evolving Scientific Ideas through Checklist-Grounded Reinforcement Learning

EvoIdeator:通过基于检查表的强化学习进化科学思想

Andreas Sauter, Yuyue Zhao, Jacopo Urbani, Wenxiang Hu, Zaiqiao Meng, Lun Zhou, Xiaohui Yan, Yougang Lyu

机构 * Huawei Technologies Co., Ltd.(华为技术有限公司) Vrije Universiteit Amsterdam(荷兰瓦赫宁根大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出EvoIdeator框架,通过基于检查表的反馈与强化学习结合,提升大语言模型生成高质量科研提案的能力,实验表明其在关键科学指标上优于其他模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23956 2026-03-24 cs.CV 57%

SwitchCraft: Training-Free Multi-Event Video Generation with Attention Controls

SwitchCraft: 无需训练的多事件视频生成与注意力控制

Qianxun Xu, Chenxi Song, Yujun Cai, Chi Zhang

机构 * Westlake University(西湖大学) Duke Kunshan University(杜克-昆山大学) The University of Queensland(昆士兰大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 SwitchCraft通过引入事件对齐查询引导和自动平衡强度求解器,提升多事件视频生成的提示对齐、事件清晰度和场景一致性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01583 2026-03-24 cs.CV 57%

3DSceneEditor: Controllable 3D Scene Editing with Gaussian Splatting

3DSceneEditor: 基于高斯散射的可控3D场景编辑

Ziyang Yan, Yihua Shao, Minwen Liao, Siyu Chen, Nan Wang, Muyuan Lin, Jenq-Neng Hwang, Hao Zhao, Fabio Remondino, Lei Li

机构 * D Optical Metrology unit, Fondazione Bruno Kessler(3D光学测绘单元,布鲁诺·凯斯勒基金会) Department of Information Engineering and Computer Science, University of Trento(信息工程与计算机科学系,特伦托大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出3DSceneEditor,通过高斯散射实现高效精准的3D场景编辑,整合实例分割模型与CLIP实现语义对齐,支持对象添加、重定位等操作,实验表明其在精度和效率上优于现有方法。

Comments Accepted by WACV 2026, Project Page: https://ziyangyan.github.io/3DSceneEditor

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21386 2026-03-24 cs.CV 57%

Mitigating Objectness Bias and Region-to-Text Misalignment for Open-Vocabulary Panoptic Segmentation

缓解对象性偏差和区域到文本对齐问题以实现开放词汇全景分割

Nikolay Kormushev, Josip Šarić, Matej Kristan

机构 * University of Ljubljana(卢布尔雅那大学) ETH Zurich(苏黎世联邦理工学院) University of Zagreb(扎格reb大学) Faculty of Comp. and Inf. Science(计算机与信息科学系) Dept. of Computer Science(计算机科学系) Faculty of Elec. Eng. and Computing(电子工程与计算科学系)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出OVRCOAT框架,通过CLIP条件对象性调整和开放词汇掩码到文本细化,解决开放词汇全景分割中的对象性偏差和区域对齐问题,提升分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21176 2026-03-24 cs.CV 57%

GIDE: Unlocking Diffusion LLMs for Precise Training-Free Image Editing

GIDE: 解锁扩散大语言模型用于精确无训练图像编辑

Zifeng Zhu, Jiaming Han, Jiaxiang Zhao, Minnan Luo, Xiangyu Yue

机构 * Xi'an Jiaotong University MMLab, The Chinese University of Hong Kong(西安交通大学MMLab,香港中文大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出GIDE框架,通过离散噪声逆向机制实现无训练图像编辑,支持多种指令并保持背景不变,实验表明其在语义正确性和感知质量上显著优于现有方法。

Comments 25 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21069 2026-03-24 cs.CV 57%

NoOVD: Novel Category Discovery and Embedding for Open-Vocabulary Object Detection

NoOVD:开放词汇物体检测中的新类别发现与嵌入

Yupeng Zhang, Ruize Han, Zhiwei Chen, Wei Feng, Liang Wan

机构 * College of Intelligence and Computing, Tianjin University(天津大学智能与计算学院) Key Research Center for Surface Monitoring and Analysis of Relics, State Administration of Cultural Heritage(文物表面监测与分析国家重点研究中心) Faculty of Computer Science and Artificial Intelligence, Shenzhen University of Advanced Technology(深圳先进技术大学计算机科学与人工智能学院) School of Artificial Intelligence, Nanchang University(南昌大学人工智能学院)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出NoOVD框架,通过自蒸馏机制和K-FPN模块提升开放词汇物体检测中新类别的识别与嵌入效果,同时引入R-RPN提升召回率,实验表明在多个数据集上表现优异。

Comments CVPR 2026 Accept

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13285 2026-03-24 cs.CV 57%

CausalCLIP: Causally-Informed Feature Disentanglement and Filtering for Generalizable Detection of Generated Images

CausalCLIP:基于因果信息的特征解耦与过滤以实现生成图像的通用检测

Bo Liu, Qiao Qin, Qinghui He

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出CausalCLIP框架,通过解耦因果与非因果特征并利用因果推理原理过滤,提升生成图像检测的泛化能力,实验表明在不同生成模型上准确率和平均精度均优于现有方法。

Comments 9 pages,Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20433 2026-03-24 cs.SD cs.AI cs.CL eess.AS 57%

ALICE: A Multifaceted Evaluation Framework of Large Audio-Language Models' In-Context Learning Ability

ALICE:大型音频-语言模型上下文学习能力的多维评估框架

Yen-Ting Piao, Jay Chiehen Liao, Wei-Tang Chien, Toshiki Ogimoto, Shang-Tse Chen, Yun-Nung Chen, Chun-Yi Lee, Shao-Yuan Lo

机构 * National Taiwan University, Taiwan(台湾国立成功大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出ALICE框架,通过三阶段评估六个LALMs在音频条件下的上下文学习能力,发现上下文示例虽能提升格式合规性,但难以改善核心任务表现,揭示了跨模态整合的潜在局限。

Comments Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19782 2026-03-23 cs.AI 57%

Embodied Science: Closing the Discovery Loop with Agentic Embodied AI

具身科学:通过代理具身AI闭合发现循环

Xiang Zhuang, Chenyi Zhou, Kehua Feng, Zhihui Zhu, Yunfan Gao, Yijie Zhong, Yichi Zhang, Junjie Huang, Keyan Ding, Lei Bai, Haofen Wang, Qiang Zhang, Huajun Chen

机构 * Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Tongji University(同济大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出具身科学框架,将科学发现视为闭环过程,结合代理推理与物理执行,通过感知-语言-行动-发现框架实现自主发现系统。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17432 2026-03-23 cs.CV 57%

AIFloodSense: A Global Aerial Imagery Dataset for Semantic Segmentation and Understanding of Flooded Environments

AIFloodSense:一个全球空中影像数据集,用于洪水环境的语义分割与理解

Georgios Simantiris, Konstantinos Bacharidis, Apostolos Papanikolaou, Petros Giannakakis, Costas Panagiotakis

机构 * Department of Management Science and Technology(管理科学与技术系) Hellenic Mediterranean University(希伯伦地中海大学) Institute of Computer Science, FORTH(信息科学研究所,FORTH)

专题命中 视觉定位与Grounding :visual question answering(abstract);分类 cs.CV

AI总结 本文提出AIFloodSense数据集,包含470张高分辨率图像,覆盖64个国家和六个大洲,支持图像分类、语义分割和视觉问答三个任务,旨在提升洪水环境的灾害评估能力。

Comments 36 pages, 19 figures, 8 tables

Journal ref Remote Sens. 2026, 18(6), 938

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19532 2026-03-23 cs.CL cs.IR cs.LG 57%

EvidenceRL: Reinforcing Evidence Consistency for Trustworthy Language Models

EvidenceRL: 为可信语言模型强化证据一致性

J. Ben Tamo, Yuxing Lu, Benoit L. Marteau, Micky C. Nnamdi, May D. Wang

机构 * Georgia Institute of Technology(佐治亚理工学院) Pekin University(培根大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 EvidenceRL通过强化学习框架在训练中强制证据遵循,提升语言模型在医疗诊断和法律推理中的证据接地和可信度,同时保持任务准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19059 2026-03-20 cs.CV 57%

SignAgent: Agentic LLMs for Linguistically-Grounded Sign Language Annotation and Dataset Curation

SignAgent:用于语言学基础的手语标注和数据集整理的代理LLM

Oliver Cory, Ozge Mercanoglu Sincan, Richard Bowden

机构 * Centre for Vision, Speech and Signal Processing(视觉、语音和信号处理中心)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出SignAgent,一种利用大语言模型进行可扩展、语言学基础的手语标注和数据集整理的新框架。通过SignAgent协调器和SignGraph,解决传统方法和手动标注的瓶颈,实现大规模语言感知数据标注。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18625 2026-03-20 cs.CV 57%

GenVideoLens: Where LVLMs Fall Short in AI-Generated Video Detection?

GenVideoLens:在AI生成视频检测中LVLMs的局限性

Yueying Zou, Pei Pei Li, Zekun Li, Xinyu Guo, Xing Cui, Huaibo Huang, Ran He

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) University of California, Santa Barbara(加州大学圣巴巴拉分校) Center for Research on Intelligent Perception and Computing, NLPR, Institute of Automation, Chinese Academy of Sciences(智能感知与计算中心、国家智能感知与信息处理实验室、中国科学院自动化研究所)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 GenVideoLens通过细粒度评估揭示LVLM在AI生成视频检测中的能力差距,发现其在光学一致性、物理交互和时间因果推理上表现不足,且模型性能在不同维度上差异显著。

Comments ECCV 2026 submission. 14 pages, 6 figures, 4 tables. Supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18510 2026-03-20 cs.CV 57%

OnlinePG: Online Open-Vocabulary Panoptic Mapping with 3D Gaussian Splatting

OnlinePG: 在线开放词汇全景映射与3D高斯点云分裂

Hongjia Zhai, Qi Zhang, Xiaokun Pan, Xiyu Zhang, Yitong Dong, Huaqi Zhang, Dan Xu, Guofeng Zhang

机构 * State Key Lab of CAD & CG(CAD与CG国家重点实验室) VIVO BlueImage Lab(VIVO BlueImage实验室) HKUST(香港科技大学)

专题命中 视觉定位与Grounding :VLM(abstract);分类 cs.CV

AI总结 本文提出OnlinePG,通过在线全景映射结合3D高斯点云分裂实现开放词汇场景理解,解决现有方法在实时性和实例级理解上的不足。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18331 2026-03-20 cs.AI 57%

Understanding the Theoretical Foundations of Deep Neural Networks through Differential Equations

通过微分方程理解深度神经网络的理论基础

Hongjue Zhao, Yizhuo Chen, Yuchen Wang, Hairong Qi, Lui Sha, Tarek Abdelzaher, Huajie Shao

机构 * University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Tennessee, Knoxville(田纳西大学科廷分校) William & Mary(威廉与玛丽学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文通过微分方程探讨深度神经网络的理论基础,分析其架构、性能提升及实际应用,提出模型和层级的双重视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17314 2026-03-20 cs.CV 57%

A Proposal-Free Query-Guided Network for Grounded Multimodal Named Entity Recognition

无提案查询引导网络用于 grounded 多模态命名实体识别

Hongbing Li, Jiamin Liu, Shuo Zhang, Bo Xiao

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出无提案查询引导网络,通过文本引导和跨模态交互统一多模态推理与解码,提升开放域场景下的命名实体识别精度与鲁棒性。

Comments There is an error in the methods section

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10053 2026-03-20 cs.CV 57%

DREAM: A Benchmark Study for Deepfake photoREalism AssessMent

DREAM:深度伪造照片真实感评估基准研究

Bo Peng, Zichuan Wang, Sheng Yu, Xiaochuan Jin, Wei Wang, Jing Dong

机构 * New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences (CASIA)(模式识别新技术实验室,自动化研究所,中国科学院)

专题命中 视觉定位与Grounding :vision language model(abstract);分类 cs.CV

AI总结 本文提出DREAM基准,用于评估深度伪造照片的真实感,包含高质量视频数据集、14万评分及描述文本,分析18种方法,包括基于大视觉语言模型和新提出描述对齐CLIP方法。

Comments Accepted by IEEE T-PAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17831 2026-03-19 cs.AI 57%

RPMS: Enhancing LLM-Based Embodied Planning through Rule-Augmented Memory Synergy

RPMS:通过规则增强的记忆协同提升基于LLM的具身规划

Zhenhang Yuan, Shenghai Yuan, Lihua Xie

机构 * School of Electrical & Electronic Engineering(电子与电气工程学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出RPMS架构,通过结构化规则检索、轻量信念状态和规则优先仲裁解决LLM在封闭世界具身环境中的失效问题,显著提升任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17761 2026-03-19 cs.CV 57%

Evidence Packing for Cross-Domain Image Deepfake Detection with LVLMs

跨领域图像深度伪造检测中的证据打包与大视觉语言模型

Yuxin Liu, Fei Wang, Kun Li, Yiqi Nie, Junjie Chen, Zhangling Duan, Zhaohong Jia

机构 * Anhui University(安徽大学) Hefei University of Technology(合肥工业大学) IAI, Hefei Comprehensive National Science Center(合肥综合国家科学中心人工智能研究院) United Arab Emirates University(阿拉伯联合酋长国大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出SCEP框架,通过证据驱动推理提升跨领域图像深度伪造检测性能,无需微调大视觉语言模型,有效识别伪造线索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17753 2026-03-19 cs.CV 57%

PC-CrossDiff: Point-Cluster Dual-Level Cross-Modal Differential Attention for Unified 3D Referring and Segmentation

PC-CrossDiff:点-簇双级跨模态微分注意力用于统一的3D指称与分割

Wenbin Tan, Jiawen Lin, Fangyong Wang, Yuan Xie, Yong Xie, Yachao Zhang, Yanyun Qu

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出PC-CrossDiff框架,通过双级跨模态微分注意力解决复杂多物体场景中指称理解和分割的挑战,提升3D视觉定位的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17746 2026-03-19 cs.CV 57%

Concept-to-Pixel: Prompt-Free Universal Medical Image Segmentation

概念到像素:无提示通用医学图像分割

Haoyun Chen, Fenghe Tang, Wenxin Ma, Shaohua Kevin Zhou

机构 * School of Biomedical Engineering, Division of Life Sciences Medicine, University of Science Technology of China (USTC), Hefei, Anhui 230026, China Center for Medical Imaging, Robotics, Analytic Computing \& Learning (MIRACLE), Suzhou Institute for Advanced Research, USTC, Suzhou, Jiangsu 215123, China Jiangsu Provincial Key Laboratory of Multimodal Digital Twin Technology, Suzhou Jiangsu, 215123, China State Key Laboratory of Precision

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出C2P框架,通过分离解剖学知识为几何和语义表示,利用多模态大语言模型生成语义令牌,并引入几何令牌约束,实现无提示的通用医学图像分割,实验表明其在多种模态和数据集上表现优异。

Comments 32 pages, code is available at: https://github.com/Yundi218/Concept-to-Pixel

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06313 2026-03-19 cs.CV 57%

WMoE-CLIP: Wavelet-Enhanced Mixture-of-Experts Prompt Learning for Zero-Shot Anomaly Detection

WMoE-CLIP:小波增强的专家混合提示学习用于零样本异常检测

Peng Chen, Chao Huang

机构 * School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University, Shenzhen(中山大学深圳校区计算机科学与技术学院)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出WMoE-CLIP方法,通过小波分解提取多频图像特征并结合变分自编码器提升提示适应性,引入语义感知的专家混合模块,有效提升零样本异常检测性能。

Journal ref ICASSP 2026 (Oral Presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17540 2026-03-19 cs.IR cs.LG 57%

Deploying Semantic ID-based Generative Retrieval for Large-Scale Podcast Discovery at Spotify

在Spotify上部署基于语义ID的生成检索用于大规模播客发现

Edoardo D'Amico, Marco De Nadai, Praveen Chandar, Divita Vohra, Shawn Lin, Max Lefarov, Paul Gigioli, Gustavo Penha, Ilya Kopysitsky, Ivo Joel Senese, Darren Mei, Francesco Fabbri, Oguz Semerci, Yu Zhao, Vincent Tang, Brian St. Thomas, Alexandra Ranieri, Matthew N. K. Smith, Aaron Bernkopf, Bryan Leung, Ghazal Fazelnia, Mark VanMiddlesworth, Timothy Christopher Heath, Petter Pehrson Skiden, Alice Y. Wang, Doug J. Cole, Andreas Damianou, Maya Hristakeva, Reid Wilbur, Tarun Chillara, Vladan Radosavljevic, Pooja Chitkara, Sainath Adapa, Juan Elenter, Bernd Huber, Jacqueline Wood, Saaketh Vedantam, Jan Stypka, Sandeep Ghael, Martin D. Gould, David Murgatroyd, Yves Raimond, Mounia Lalmas, Paul N. Bennett

机构 * Spotify

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文提出GLIDE模型,通过语义ID实现播客推荐,结合语义、上下文和用户状态,提升用户发现新播客和非习惯性流媒体体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17520 2026-03-19 cs.CV 57%

PCA-Seg: Revisiting Cost Aggregation for Open-Vocabulary Semantic and Part Segmentation

PCA-Seg:重新审视开放词汇语义和部分分割中的成本聚合

Jianjian Yin, Tao Chen, Yi Chen, Gensheng Pei, Xiangbo Shu, Yazhou Yao, Fumin Shen

机构 * Nanjing University of Science and Technology(南京理工大学) Nanjing Normal University(南京师范大学) Department of Electrical and Computer Engineering, Sungkyunkwan University(成均馆大学电子与计算机工程系) University of Electronic Science and Technology of China(电子科技大学) State Key Laboratory of Intelligent Manufacturing of Advanced Construction Machinery(先进施工机械智能制造国家重点实验室)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出PCA-Seg方法,通过并行成本聚合缓解类级语义与空间上下文之间的知识干扰,提升开放词汇语义和部分分割性能。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17375 2026-03-19 cs.CV 57%

Stereo World Model: Camera-Guided Stereo Video Generation

立体世界模型:基于摄像头的立体视频生成

Yang-Tian Sun, Zehuan Huang, Yifan Niu, Lin Ma, Yan-Pei Cao, Yuewen Ma, Xiaojuan Qi

机构 * The University of Hong Kong(香港大学) VAST ByteDance Pico(字节跳动Pico)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出StereoWorld,一种基于摄像头的立体世界模型,通过联合学习外观和双眼几何实现端到端的立体视频生成。该模型在RGB模态中操作,直接从视差中获取几何信息,通过统一的相机帧RoPE和立体感知注意力分解提升生成效率和一致性。

Comments Project Page: https://sunyangtian.github.io/StereoWorld-web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17357 2026-03-19 cs.CR cs.AI 57%

WebPII: Benchmarking Visual PII Detection for Computer-Use Agents

WebPII:用于计算机使用代理的视觉个人身份信息检测基准测试

Nathan Zhao

机构 * Stanford University(斯坦福大学)

专题命中 视觉定位与Grounding :VLM(abstract);分类 cs.AI

AI总结 本文提出WebPII基准测试,用于评估计算机使用代理中的视觉PII检测。该基准测试包含44,865个标注的电商UI图像,设计了三个关键特性:扩展的PII分类、前瞻性检测和可扩展的生成方法。实验表明,这些设计提高了在不同界面中的检测能力和对新页面类型的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17063 2026-03-19 cs.AI 57%

Transformers are Bayesian Networks

Transformer 是贝叶斯网络

Gregory Coppola

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文证明Transformer本质上是贝叶斯网络,通过五种方式展示了其与信念传播的联系,并验证了其在概率估计和推理中的正确性。

详情

展开后加载摘要…

URL PDF HTML 收藏