arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7409 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7409 篇

2509.21223 2026-04-01 cs.CV cs.CL 57%

Sigma: Semantically Informative Pre-training for Skeleton-based Sign Language Understanding

Sigma:基于骨骼的语义信息预训练用于手语理解

Muxin Pu, Mei Kuan Lim, Chun Yong Chong, Chen Change Loy

机构 * School of Information Technology, Monash University(莫纳什大学信息技术学院) S-Lab, Nanyang Technological University(南洋理工大学S-Lab)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 Sigma提出一种统一的骨骼手语理解框架,通过语义对齐学习和预训练策略提升手语识别与翻译性能,展现语义信息预训练在多语言手语任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09666 2026-04-01 cs.CV 57%

Unified Multimodal Models as Auto-Encoders

统一多模态模型作为自编码器

Zhiyuan Yan, Kaiqing Lin, Zongjian Li, Junyan Ye, Hui Han, Haochen Wang, Zhendong Wang, Bin Lin, Hao Li, Xinyan Xiao, Jingdong Wang, Haifeng Wang, Li Yuan

机构 * Shenzhen Graduate School, Peking University(北京大学深圳研究生院) Baidu(百度) Rabbitpre AI(兔展智能) SYSU(中山大学) USTC(中国科学技术大学) CASIA(中国科学院自动化研究所)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出统一GRPO方法,通过强化学习联合优化图像到文本和文本到图像任务,利用重建奖励提升语义一致性,增强多模态协同效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28508 2026-03-31 cs.CV 57%

Generalizable Detection of AI Generated Images with Large Models and Fuzzy Decision Tree

基于大模型和模糊决策树的AI生成图像通用检测

Fei Wu, Guanghao Ding, Zijian Niu, Zhenrui Wang, Lei Yang, Zhuosheng Zhang, Shilin Wang

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出结合轻量级特征感知检测器与大模型的模糊决策树框架,提升AI生成图像检测的准确性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28066 2026-03-31 cs.HC cs.AI 57%

Synonymix: Unified Group Personas for Generative Simulations

Synonymix:生成模拟的统一群体人格

Huanxing Chen, Aditesh Kumar

机构 * Stanford University(斯坦福大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出Synonymix,通过图抽象和融合构建统一群体人格,实现群体层面的交互与模拟,验证了在社会调查中保留行为信号并保障隐私。

Comments 6 pages (excluding appendix), 3 figures, CHI'26 Extended Abstract (Poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20062 2026-03-31 cs.IR cs.AI 57%

The End of Rented Discovery: How AI Search Redistributes Power Between Hotels and Intermediaries

发现的终结:AI搜索如何在酒店与中介之间重新分配权力

Peiying Zhu, Sidi Chang

机构 * Blossom AI

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文研究AI搜索如何通过意图-来源分歧影响酒店发现,发现体验型查询更依赖非OTA来源,挑战传统中介主导地位。

Comments 13 pages, 10 tables, Accepted to the 10th Hospitality Finance & Economics Conference (HFE 2026), Tokyo, Japan

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13953 2026-03-31 cs.CV 57%

From Unlearning to UNBRANDING: A Benchmark for Trademark-Safe Text-to-Image Generation

从去学习到去品牌化:一个商标安全的文本到图像生成基准测试

Dawid Malarz, Filip Manjak, Maciej Zięba, Przemysław Spurek, Artur Kasymov

机构 * Jagiellonian University(雅盖隆大学) IDEAS Research Institute(IDEAS研究所)

专题命中 视觉定位与Grounding :vision language model(abstract);分类 cs.CV

AI总结 本文提出去品牌化任务,通过细粒度去除商标和隐含结构特征,同时保持语义连贯性,并构建基准数据集和评估框架,解决现有品牌检测器无法捕捉抽象商标的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12554 2026-03-31 cs.CV 57%

Multimodal Graph Network Modeling for Human-Object Interaction Detection with PDE Graph Diffusion

基于PDE图扩散的多模态图网络建模用于人-物交互检测

Wenxuan Ji, Haichao Shi, Xiao-Yu Zhang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出基于PDE图扩散的多模态图网络模型,通过四阶段图结构建模人-物交互任务,利用白盒PDE扩散方程实现信息传播,并引入变分信息挤压机制优化CLIP提取的多模态特征,实验表明在HICO-DET和V-COCO基准上取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27360 2026-03-31 cs.AI 57%

Defend: Automated Rebuttals for Peer Review with Minimal Author Guidance

Defend:用于同行评审的自动化反驳与最小作者指导

Jyotsana Khatri, Manasi Patwardhan

机构 * TCS Research(塔塔咨询服务研究实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出DEFEND工具,通过作者引导的结构化推理生成反驳,提升事实准确性与反驳力度,对比三种方法显示其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27059 2026-03-31 cs.CV 57%

Towards Intrinsic-Aware Monocular 3D Object Detection

面向内在感知的单目三维物体检测

Zhihao Zhang, Abhinav Kumar, Xiaoming Liu

机构 * Michigan State University(密歇根州立大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出MonoIA框架,通过语言引导表示建模和适应相机内在变化,实现鲁棒的三维物体检测,实验表明在KITTI等基准上取得新突破。

Comments This paper is accepted by CVPR 2026

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10652 2026-03-31 cs.CV cs.CR 57%

TriDF: Evaluating Perception, Detection, and Hallucination for Interpretable DeepFake Detection

TriDF:评估可解释深度伪造检测的感知、检测和幻觉

Jian-Yu Jiang-Lin, Kang-Yang Huang, Ling Zou, Ling Lo, Sheng-Ping Yang, Yu-Wen Tseng, Kun-Hsiang Lin, Chia-Ling Chen, Yu-Ting Ta, Yan-Tsung Wang, Po-Ching Chen, Hongxia Xie, Hong-Han Shuai, Wen-Huang Cheng

机构 * National Taiwan University(国立台湾大学) National Yang Ming Chiao Tung University(国立阳明交通大学) Jilin University(吉林大学) VinUniversity

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV

AI总结 TriDF提出一个全面的可解释深度伪造检测基准,评估模型感知、检测和幻觉能力,揭示三者间的相互作用,为构建可信系统提供基础。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21045 2026-03-31 cs.AI cs.DB cs.IR 57%

From Questions to Queries: An AI-powered Multi-Agent Framework for Spatial Text-to-SQL

从问题到查询:一种基于AI的多智能体框架用于空间文本到SQL

Ali Khosravi Kazazi, Zhenlong Li, M. Naser Lessani, Guido Cervone

机构 * Geoinformation and Big Data Research Laboratory, Department of Geography, The Pennsylvania State University(宾夕法尼亚州立大学地理系地理信息与大数据研究实验室) Institute for Computational and Data Sciences and Department of Geography, The Pennsylvania State University(宾夕法尼亚州立大学计算与数据科学研究所及地理系)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出一种基于AI的多智能体框架,解决空间文本到SQL中的复杂问题,通过分阶段解释、模式绑定、逻辑规划和执行审查提升空间查询的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26541 2026-03-30 cs.CV 57%

OVI-MAP:Open-Vocabulary Instance-Semantic Mapping

OVI-MAP:开放词汇实例语义映射

Zilong Deng, Federico Tombari, Marc Pollefeys, Johanna Wald, Daniel Barath

机构 * ETH Zurich(苏黎世联邦理工学院) Google(谷歌) University of Zurich(苏黎世大学) TU Munich(慕尼黑工业大学) Microsoft(微软)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出OVI-MAP,通过解耦实例重建与语义推断,实现增量开放词汇3D实例语义映射,提升实时处理与零样本语义标注能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26512 2026-03-30 cs.AI 57%

CADSmith: Multi-Agent CAD Generation with Programmatic Geometric Validation

CADSmith: 基于程序化几何验证的多智能体CAD生成

Jesse Barkley, Rumi Loghmani, Amir Barati Farimani

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.AI

AI总结 CADSmith通过多智能体管道生成CadQuery代码,并通过双重嵌套修正循环进行迭代优化,结合精确测量和视觉评估提升CAD生成质量。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26440 2026-03-30 cs.LG cs.CE 57%

Interpretable long-term traffic modelling on national road networks using theory-informed deep learning

基于理论指导的深度学习的国家道路网络长期交通建模

Yue Li, Shujuan Chen, Akihiro Shimoda, Ying Jin

机构 * Martin Centre for Architectural and Urban Studies, University of Cambridge(剑桥大学马丁建筑与城市研究中心) Independent Researcher(独立研究员)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文提出DeepDemand框架,结合交通理论与深度学习,通过社会经济特征和道路网络结构预测长期高速公路交通量,验证了其在长期规划中的有效性与地理可转移性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26252 2026-03-30 cs.HC cs.AI 57%

Channelling, Coordinating, Collaborating: A Three-Layer Framework for Disability-Centered Human-Agent Collaboration

通道、协调与协作:一种面向残疾人的人机协作三层次框架

Lan Xiao, Catherine Holloway

机构 * Global Disability Innovation Hub(全球残障创新中心) UCL Interaction Centre(伦敦大学学院交互中心) University College London(伦敦大学学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出一种三层次框架,重新定义AI在能力多样协作中的作用,通过建立跨能力的信息基础、协调不同能力的协作流程,并作为有界伙伴推动共同目标。

Comments Accepted in CHI '26 Workshop on Human-Agent Collaboration

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17528 2026-03-30 cs.CV 57%

MM-OVSeg:Multimodal Optical-SAR Fusion for Open-Vocabulary Segmentation in Remote Sensing

MM-OVSeg:多模态光学-合成孔径雷达融合用于遥感中的开放词汇分割

Yimin Wei, Aoran Xiao, Hongruixuan Chen, Junshi Xia, Naoto Yokoya

机构 * The University of Tokyo(东京大学) RIKEN AIP(日本理化学研究所先进智能研究中心)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 MM-OVSeg通过融合光学和SAR数据,提升恶劣天气下的开放词汇分割鲁棒性与泛化能力,采用跨模态统一过程和双编码器融合模块实现多传感器表征对齐与多模态分割。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13222 2026-03-30 cs.IR cs.AI 57%

Incorporating Q&A Nuggets into Retrieval-Augmented Generation

将问答 nugget 融入检索增强生成

Laura Dietz, Bryan Li, Gabrielle Liu, Jia-Huei Ju, Eugene Yang, Dawn Lawrie, William Walden, James Mayfield

机构 * University of New Hampshire(新罕布什尔大学) University of Pennsylvania(宾夕法尼亚大学) Yale University(耶鲁大学) University of Amsterdam(阿姆斯特丹大学) Human Language Technology Center of Excellence, Johns Hopkins University(约翰霍普金斯大学人类语言技术卓越中心)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出Crucible系统,通过构建问答nugget库提升生成质量,保留引用溯源,优于现有系统。

Comments To appear in the Proceedings of ECIR 2026, Lecture Notes in Computer Science, Volume 16484

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00255 2026-03-30 cs.CV 57%

BeetleFlow: An Integrative Deep Learning Pipeline for Beetle Image Processing

BeetleFlow: 一种用于甲虫图像处理的集成深度学习流水线

Fangxun Liu, S M Rayeed, Samuel Stevens, Alyson East, Cheng Hsuan Chiang, Colin Lee, Daniel Yi, Junke Yang, Tejas Naik, Ziyi Wang, Connor Kilrain, Elijah H Buckwalter, Jiacheng Hou, Saul Ibaven Bueno, Shuheng Wang, Xinyue Ma, Yifan Liu, Zhiyuan Tao, Ziheng Zhang, Eric Sokol, Michael Belitz, Sydne Record, Charles V. Stewart, Wei-Lun Chao

机构 * The Ohio State University(俄亥俄州立大学) Rensselaer Polytechnic Institute(伦斯勒理工学院) The University of Maine(缅因大学) National Ecological Observatory Network (NEON), Battelle(国家生态观测网络(NEON),巴特尔纪念研究所) Michigan State University(密歇根州立大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出BeetleFlow流水线,通过深度学习方法自动处理大量甲虫图像,实现甲虫检测、排序裁剪和形态分割,提高生物研究效率。

Comments 4 pages, NeurIPS 2025 Workshop Imageomics

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25186 2026-03-27 cs.LG 57%

Knowledge-Guided Retrieval-Augmented Generation for Zero-Shot Psychiatric Data: Privacy Preserving Synthetic Data Generation

基于知识的检索增强生成用于零样本心理数据:隐私保护的合成数据生成

Adam Jakobsen, Sushant Gautam, Hugo Lewi Hammer, Susanne Olofsdotter, Miriam S Johanson, Pål Halvorsen, Vajira Thambawita

机构 * SimulaMet Oslo Metropolitan University(奥斯陆城市大学) Uppsala University(乌普萨拉大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文提出一种零样本知识引导框架,利用检索增强生成技术生成隐私保护的合成心理数据,通过对比CTGAN和TVAE模型,证明临床知识增强LLM在生成高质量、隐私保护的合成数据方面具有优势。

Comments Submitted to CBMS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22752 2026-03-27 cs.CL cs.AI 57%

Towards Simulating Social Media Users with LLMs: Evaluating the Operational Validity of Conditioned Comment Prediction

向LLMs模拟社交媒体用户迈进:评估条件评论预测的运作有效性

Nils Schwager, Simon Münker, Alistair Plum, Achim Rettinger

机构 * Trier University(特里尔大学) University of Luxembourg(卢森堡大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文通过条件评论预测任务评估LLMs在模拟社交媒体用户行为方面的运作有效性,发现监督微调在低资源环境下会导致表层结构与语义脱节,强调真实行为轨迹优于描述性人设。

Comments 14 pages, 1 figure, 7 tables. Accepted to the 15th Workshop on Computational Approaches to Subjectivity, Sentiment & Social Media Analysis (WASSA) at EACL 2026, Rabat, Morocco

Journal ref Proceedings of the 15th Workshop on Computational Approaches to Subjectivity, Sentiment & Social Media Analysis (WASSA), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15186 2026-03-27 cs.CV 57%

Instruction-Guided Lesion Segmentation for Chest X-rays with Automatically Generated Large-Scale Dataset

基于指令的胸部X光片病变分割方法及大规模数据集构建

Geon Choi, Hangyul Yoon, Hyunju Shin, Hyunki Park, Sang Hoon Seo, Eunho Yang, Edward Choi

机构 * KAIST(韩国科学技术院) Samsung Medical Center(三星医学中心) AITRICS

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出基于指令的病变分割方法,构建首个大规模指令-回答数据集,通过自动化流程生成标注,提升胸部X光片病变分割的实用性与准确性。

Comments Camera-ready version for CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15869 2026-03-27 cs.CV 57%

Self-Calibrated CLIP for Training-Free Open-Vocabulary Segmentation

自校准CLIP用于无训练开放词汇分割

Sule Bai, Yong Liu, Yifei Han, Haoji Zhang, Yansong Tang, Jie Zhou, Jiwen Lu

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Department of Automation, Tsinghua University(清华大学自动化系)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出自校准CLIP,通过消除异常token影响,提升CLIP在开放词汇分割中的表现,实现更精细的特征表示和语义一致性。

Comments Accepted by IEEE TIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25097 2026-03-27 cs.AI 57%

ElephantBroker: A Knowledge-Grounded Cognitive Runtime for Trustworthy AI Agents

ElephantBroker:一个基于知识的认知运行时用于可信AI代理

Cristian Lupascu, Alexandru Lupascu

机构 * Elephant Broker(大象经纪人)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出ElephantBroker,一个结合Neo4j知识图谱与Qdrant向量存储的认知运行时,通过Cognee SDK实现可信AI代理的记忆管理,包含认知循环、证据验证、安全防护等模块,支持多部署层级和安全审计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07237 2026-03-27 cs.CV 57%

Unified Camera Positional Encoding for Controlled Video Generation

统一的相机位置编码用于受控视频生成

Cheng Zhang, Boying Li, Meng Wei, Yan-Pei Cao, Camilo Cruz Gambardella, Dinh Phung, Jianfei Cai

机构 * Monash University(莫纳什大学) Building 4.0 CRC(4.0建筑CRC) VAST(VAST研究院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出UCPE,通过统一相机信息实现视频生成中的高可控性与视觉真实性,结合轻量级注意力适配器提升模型性能。

Comments Camera Ready of CVPR2026. Project Page: https://chengzhag.github.io/publication/ucpe/ Code: https://github.com/chengzhag/UCPE

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24166 2026-03-26 cs.CV 57%

Heuristic-inspired Reasoning Priors Facilitate Data-Efficient Referring Object Detection

启发式推理先验促进数据高效的指代物体检测

Xu Zhang, Zhe Chen, Jing Zhang, Dacheng Tao

机构 * The University of Sydney(悉尼大学) La Trobe University(拉特罗布大学) Wuhan University(武汉大学) Nanyang Technological University(南洋理工大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出HeROD框架,通过注入启发式推理先验提升数据稀缺条件下的指代物体检测性能,实验表明其在低数据和少样本场景下优于现有基线。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24057 2026-03-26 cs.CV 57%

Beyond Semantic Priors: Mitigating Optimization Collapse for Generalizable Visual Forensics

超越语义先验:缓解可泛化视觉取证中的优化崩溃

Jipeng Liu, Haichao Shi, Siyu Xing, Rong Yin, Xiao-Yu Zhang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(信息工程研究所,中国科学院) School of Cyber Science and Technology, Beihang University(北京航空航天大学信息与科学学院)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出CoRIT模型,通过对比梯度代理和三种无训练策略缓解优化崩溃,提升跨领域和通用伪造检测的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01540 2026-03-26 cs.CV 57%

FlashVGGT: Efficient and Scalable Visual Geometry Transformers with Compressed Descriptor Attention

FlashVGGT: 高效且可扩展的视觉几何变换器与压缩描述符注意力

Zipeng Wang, Dan Xu

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出FlashVGGT,通过压缩描述符注意力机制解决传统自注意力的可扩展性问题,实现高效多视角图像三维重建,实验表明其在精度和效率上优于VGGT。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17908 2026-03-25 cs.CL cs.AI cs.IR 57%

Principled Context Engineering for RAG: Statistical Guarantees via Conformal Prediction

基于RAG的原理化上下文工程:通过符合预测实现统计保证

Debashish Chakraborty, Eugene Yang, Daniel Khashabi, Dawn Lawrie, Kevin Duh

机构 * HLTCOE, Johns Hopkins University(HLTCOE,约翰霍普金斯大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出通过符合预测框架实现RAG的上下文工程,通过统计可控的过滤方法减少冗余上下文,提升事实准确性。

Comments Accepted at ECIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23126 2026-03-25 cs.CV 57%

3rd Place of MeViS-Audio Track of the 5th PVUW: VIRST-Audio

第5届PVUW比赛MeViS-Audio赛道的第三名:VIRST-Audio

Jihwan Hong, Jaeyoung Do

机构 * AIDAS Laboratory(AIDAS实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出VIRST-Audio框架,通过将音频转换为文本并基于文本进行分割,实现音频驱动的视频对象分割,实验表明其在MeViS-Audio赛道上取得第三名,展示了良好的泛化能力和稳定性。

Comments 4 pages, 2 figures. Technical report for the CVPR 2026 PVUW Workshop (MeViS-Audio Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07990 2026-03-25 cs.LG 57%

MJ1: Multimodal Judgment via Grounded Verification

MJ1: 通过 grounded 验证实现多模态判断

Bhavesh Kumar, Dylan Feng, Leonard Tang

机构 * Haize Labs(哈泽实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 MJ1 通过结构化 grounded 验证链和反事实一致性奖励提升多模态判断准确性,训练后在 MMRB2 数据集上达到 77.0% 准确率,超越更大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏