arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-16 至 2026-02-16 共收录 6 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 6 篇

2602.13028 2026-02-16 cs.CV cs.CL 83%

Human-Aligned MLLM Judges for Fine-Grained Image Editing Evaluation: A Benchmark, Framework, and Analysis

面向细粒度图像编辑评估的人类对齐MLLM评判:一个基准、框架和分析

Runzhou Liu, Hailey Weingord, Sejal Mittal, Prakhar Dungarwal, Anusha Nandula, Bo Ni, Samyadeep Basu, Hongjie Chen, Nesreen K. Ahmed, Li Li, Jiayi Zhang, Koustava Goswami, Subhojyoti Mukherjee, Branislav Kveton, Puneet Mathur, Franck Dernoncourt, Yue Zhao, Yu Wang, Ryan A. Rossi, Zhengzhong Tu, Hongru Du

机构 * University of Virginia(弗吉尼亚大学) Columbia University(哥伦比亚大学) Vanderbilt University(范德比大学) Adobe Research(Adobe研究) Dolby Laboratories(杜比实验室) Cisco Research(思科研究) University of Southern California(南加州大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) University of Oregon(俄勒冈大学) Texas A&M University(德克萨斯大学)

专题命中 视觉定位与Grounding :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出细粒度MLLM评判框架,通过分解十二个可解释因素,提升图像编辑评估的精度与实用性,为研究和改进图像编辑方法提供实用基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13195 2026-02-16 cs.CV 79%

Conversational Image Segmentation: Grounding Abstract Concepts with Scalable Supervision

对话式图像分割:通过可扩展监督将抽象概念具象化

Aadarsh Sahoo, Georgia Gkioxari

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出对话式图像分割方法,通过可扩展监督将抽象概念转化为精确掩码,并引入ConverSeg基准和ConverSeg-Net模型提升分割性能。

Comments Project webpage: https://glab-caltech.github.io/converseg/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07388 2026-02-16 cs.AI 79%

Invert4TVG: A Temporal Video Grounding Framework with Inversion Tasks Preserving Action Understanding Ability

Invert4TVG: 一种具有逆向任务的时序视频定位框架,以保持动作理解能力

Zhaoyu Chen, Hongnan Lin, Yongwei Nie, Fei Ma, Xuemiao Xu, Fei Yu, Chengjiang Long

机构 * Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室) School of Computer Science and Engineering, South China University of Technology(华南理工大学计算机科学与工程学院) ByteDance Inc.(字节跳动公司)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 Invert4TVG通过引入逆向任务保持动作理解能力,提升时序视频定位的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13013 2026-02-16 cs.CV 57%

Towards Universal Video MLLMs with Attribute-Structured and Quality-Verified Instructions

面向具有属性结构和质量验证指令的通用视频MLLMs

Yunheng Li, Hengrui Zhang, Meng-Hao Guo, Wenzhao Gao, Shaoyong Jia, Shaohui Jiao, Qibin Hou, Ming-Ming Cheng

机构 * VCIP, School of Computer Science, Nankai University(VCIP,计算机科学学院,南开大学) ByteDance Inc.(字节跳动公司) Tsinghua University(清华大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本研究提出ASID-1M数据集、ASID-Verify验证流程和ASID-Captioner模型,通过细粒度结构化指令提升视频理解性能,实现高质量描述生成与指令遵循。

Comments Project page: https://asid-caption.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13179 2026-02-16 cs.IR 50%

Fix Before Search: Benchmarking Agentic Query Visual Pre-processing in Multimodal Retrieval-augmented Generation

在搜索前修复:多模态检索增强生成中代理查询视觉预处理的基准测试

Jiankun Zhang, Shenglai Zeng, Kai Guo, Xinnan Dai, Hui Liu, Jiliang Tang, Yi Chang

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出V-QPP-Bench,通过代理决策任务评估视觉查询预处理的改进,揭示视觉不完美对检索性能的严重影响及训练方法的优化潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12721 2026-02-16 cs.SE 50%

Reconciling Complexity and Simplicity in the Business Model Canvas Design Through Metamodelling and Domain-Specific Modelling

通过元建模和领域特定建模在商业模型画布设计中调和复杂性与简洁性

Nordine Benkeltoum

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文通过元建模和领域特定建模方法,提出一种严谨且易用的商业模型画布元模型,提升其建模严谨性与实用性,促进企业建模与架构实践的整合。

详情

展开后加载摘要…

URL PDF HTML 收藏