arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-01-21 至 2026-01-21 共收录 102 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 13 篇

2601.14084 2026-01-21 cs.CV cs.AI cs.CL 86%

DermaBench: A Clinician-Annotated Benchmark Dataset for Dermatology Visual Question Answering and Reasoning

DermaBench:一种用于皮肤科视觉问答和推理的临床标注基准数据集

Abdurrahim Yilmaz, Ozan Erdem, Ece Gokyayla, Ayda Acar, Burc Bugra Dagtas, Dilara Ilhan Erdil, Gulsum Gencoglan, Burak Temelkuran

机构 * Imperial College London(帝国理工学院伦敦分校) Istanbul Medeniyet University(伊斯坦布尔医学大学) Usak Research and Training Hospital(Usak研究与培训医院) Istanbul Research and Training Hospital(伊斯坦布尔研究与培训医院) Ipswich Hospital(伊普斯韦奇医院) Medicana Atakoy Hospital(Medicana阿塔基医院)

专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 DermaBench是首个由临床专家标注的皮肤科视觉问答基准数据集,通过精细标注和开放式描述提升多模态模型在皮肤科图像理解与临床推理中的评估能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10054 2026-01-21 q-bio.OT 85%

SurgPub-Video: A Comprehensive Surgical Video Dataset for Enhanced Surgical Intelligence in Vision-Language Model

SurgPub-Video: 一个全面的外科视频数据集,用于增强视觉-语言模型中的外科智能

Yaoqian Li, Xikai Yang, Dunyuan Xu, Yang Yu, Litao Zhao, Xiaowei Hu, Jinpeng Li, Pheng-Ann Heng

专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract);visual question answering(abstract)

AI总结 SurgPub-Video数据集和SurgLLaVA-Video模型通过提供高质量外科视频数据和专门的视觉-语言模型,提升了手术场景分析的智能水平。

Journal ref AAAI-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10427 2026-01-21 cs.CV 83%

STRIDE-QA: Visual Question Answering Dataset for Spatiotemporal Reasoning in Urban Driving Scenes

STRIDE-QA:用于城市驾驶场景时空推理的视觉问答数据集

Keishi Ishihara, Kento Sasaki, Tsubasa Takahashi, Daiki Shiono, Yu Yamaguchi

专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract);分类 cs.CV

AI总结 STRIDE-QA通过大规模视觉问答数据集提升自动驾驶中动态交通场景的时空推理能力,显著提升VLMs在空间定位和未来运动预测中的表现。

Comments Accepted to AAAI 2026 (Oral). project page: https://turingmotors.github.io/stride-qa/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13919 2026-01-21 cs.CL cs.CV 70%

HyperWalker: Dynamic Hypergraph-Based Deep Diagnosis for Multi-Hop Clinical Modeling across EHR and X-Ray in Medical VLMs

HyperWalker: 基于动态超图的多跳临床建模深度诊断方法,跨EHR和X光在医学视觉语言模型中

Yuezhe Yang, Hao Wang, Yige Peng, Jinman Kim, Lei Bi

机构 * Institute of Translational Medicine, Shanghai Jiao Tong University(翻译医学研究院,上海交通大学) School of Computer Science, University of Sydney(计算机科学学院,悉尼大学)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV

AI总结 HyperWalker通过动态超图和测试时训练,实现跨EHR和X光的多跳临床建模深度诊断,提升医疗视觉语言模型的诊断性能。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11976 2026-01-21 cs.CV 70%

AVIR: Adaptive Visual In-Document Retrieval for Efficient Multi-Page Document Question Answering

AVIR: 为高效多页文档问答的自适应视觉在文档检索

Zongmin Li, Yachuan Li, Lei Kang, Dimosthenis Karatzas, Wenkang Ma

机构 * China University of Petroleum (East China)(中国石油大学(华东)) Shandong Xiehe University(山东谢家大学)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV

AI总结 AVIR通过自适应视觉在文档检索框架减少多页文档问答所需的页面数,提升效率并降低计算成本。

Comments 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02888 2026-01-21 cs.LG 70%

RPIQ: Residual-Projected Multi-Collaboration Closed-Loop and Single Instance Quantization for Visually Impaired Assistance

RPIQ: 基于残差投影多协作闭环和单实例量化的方法用于视障辅助

Xuanyu Wang, Haisen Su, Jingtao Zhang, Xiangxiang Wang, Yongbin Yu, Manping Fan, Jialing Xiao, Bo Gong, Siqi Chen, Mingsheng Cao, Liyong Ren, Zhenglin Yang

机构 * School of Information Software Engineering, University of Electronic Science School of Mathematical Sciences, Sichuan Normal University, Chengdu, Sichuan, China Sichuan Provincial Key Laboratory for Human Disease Gene Study, Sichuan Academy of Medical Sciences \& Sichuan Provincial People's Hospital, University of Electronic Science Research Unit for Blindness Prevention, Chinese Academy of Medical Sciences, Sichuan Academy of Medical Sciences Sichuan Provincial People’s Hospital, Chengdu, Sichuan, China School of Medicine, University of Electronic Science Tibetan Language Intelligence National Key Laboratory, Qinghai Normal University, Xining, Qinghai, China

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.LG

AI总结 RPIQ通过残差投影多协作闭环和单实例量化方法,实现大规模模型在4位表示下的高效压缩,显著降低内存消耗并保持高性能,适用于视障辅助系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12505 2026-01-21 cs.CL 67%

DoPE: Decoy Oriented Perturbation Encapsulation Human-Readable, AI-Hostile Documents for Academic Integrity

DoPE: 伪装导向扰动封装用于学术诚信的人可读AI敌对文档

Ashish Raj Shekhar, Shiven Agarwal, Priyanuj Bordoloi, Yash Shah, Tejas Anvekar, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学)

专题命中 视觉问答 :multimodal large language model(abstract);MLLM(abstract)

AI总结 DoPE通过在考试文档中嵌入语义伪装,利用MLLM pipelines的渲染-解析差异,实现对AI自动解决的预防和检测,提升学术诚信保障。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10671 2026-01-21 cs.CV cs.AI 62%

Image-to-Video Transfer Learning based on Image-Language Foundation Models: A Comprehensive Survey

基于图像-语言基础模型的图像到视频迁移学习:全面综述

Jinxuan Li, Chaolei Tan, Haoxuan Chen, Jianxin Ma, Jian-Fang Hu, Jianhuang Lai, Wei-Shi Zheng

机构 * School of Computer Science and Engineering, Sun Yat-sen University(计算机科学与工程学院,中山大学)

专题命中 视觉问答 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文综述了基于图像-语言基础模型的图像到视频迁移学习,系统分类了现有技术并分析了其在视频-文本任务中的应用与挑战。

Comments Updated version, github repository is available at https://github.com/YuriPreisdent/awesome-image-to-video-transfer

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18177 2026-01-21 cs.CV cs.LG cs.MA 62%

Scene-Aware Vectorized Memory Multi-Agent Framework with Cross-Modal Differentiated Quantization VLMs for Visually Impaired Assistance

具有跨模态差异化量化功能的场景感知向量内存多智能体框架用于视障辅助

Xiangxiang Wang, Xuanyu Wang, YiJia Luo, Yongbin Yu, Manping Fan, Jingtao Zhang, Liyong Ren

机构 * School of Information Software Engineering, University of Electronic Science Sichuan Provincial Key Laboratory for Human Disease Gene Study, Sichuan Academy of Medical Sciences \& Sichuan Provincial People's Hospital, University of Electronic Science Faculty of Computing, Harbin Institute of Technology, Harbin, China

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本文提出了一种具有跨模态差异化量化的多智能体框架,通过减少内存消耗和提升处理效率,为视障人士提供更高效的环境感知与辅助导航支持。

Comments 28 pages,9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19529 2026-01-21 cs.CV 57%

Vidi2.5: Large Multimodal Models for Video Understanding and Creation

Vidi2.5:大型多模态模型用于视频理解和创作

Vidi Team, Chia-Wen Kuo, Chuang Huang, Dawei Du, Fan Chen, Fanding Lei, Feng Gao, Guang Chen, Haoji Zhang, Haojun Zhao, Jin Liu, Jingjing Zhuge, Lili Fang, Lingxi Zhang, Longyin Wen, Lu Guo, Lu Xu, Lusha Li, Qihang Fan, Rachel Deng, Shaobo Fang, Shu Zhang, Sijie Zhu, Stuart Siew, Weiyan Tao, Wen Zhong, Xiaohui Shen, Xin Gu, Ye Yuan, Yicheng He, Yiming Cui, Zhenfang Chen, Zhihua Wu, Zuhua Lin

机构 * ByteDance Inc.(字节跳动公司)

专题命中 视觉问答 :grounding(abstract);分类 cs.CV

AI总结 Vidi2.5通过细粒度时空定位和复杂情节推理模型,提升了视频理解和创作的多模态能力,同时在多个基准测试中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19498 2026-01-21 cs.CL 50%

DomainCQA: Crafting Knowledge-Intensive QA from Domain-Specific Charts

DomainCQA: 从领域特定图表中构建知识密集型问答

Yujing Lu, Ling Zhong, Jing Yang, Weiming Li, Peng Wei, Yongheng Wang, Manni Duan, Qing Zhang

专题命中 视觉问答 :multimodal large language model(abstract)

AI总结 DomainCQA通过构建领域特定图表问答基准测试,提升多模态大语言模型在视觉理解和知识密集型推理方面的能力。

Comments 83 pages, 59 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12700 2026-01-21 eess.AS cs.SD 50%

Improving Audio Question Answering with Variational Inference

通过变分推断改进音频问答

Haolin Chen

机构 * Idiap Research Institute, Martigny, Switzerland(日内瓦研究所) École Polytechnique Fédérale de Lausanne, Lausanne, Switzerland(洛桑联邦理工学院)

专题命中 视觉问答 :multimodal large language model(abstract)

AI总结 本文通过改进的变分推断优化器提升音频问答任务的预测准确性与校准性。

Comments ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04720 2026-01-21 cs.CL 50%

Qwen3-VL-Embedding and Qwen3-VL-Reranker: A Unified Framework for State-of-the-Art Multimodal Retrieval and Ranking

Qwen3-VL-Embedding 和 Qwen3-VL-Reranker:面向最新多模态检索与排序的统一框架

Mingxin Li, Yanzhao Zhang, Dingkun Long, Keqin Chen, Sibo Song, Shuai Bai, Zhibo Yang, Pengjun Xie, An Yang, Dayiheng Liu, Jingren Zhou, Junyang Lin

专题命中 视觉问答 :visual question answering(abstract)

AI总结 Qwen3-VL-Embedding和Qwen3-VL-Reranker通过统一框架实现多模态检索与排序的高精度性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 21 篇

2509.25142 2026-01-21 cs.AI 85%

Visual serial processing deficits explain divergences in human and VLM reasoning

视觉序列处理缺陷解释了人类与VLM推理之间的差异

Nicholas Budny, Kia Ghods, Declan Campbell, Raja Marjieh, Amogh Joshi, Sreejan Kumar, Jonathan D. Cohen, Taylor W. Webb, Thomas L. Griffiths

机构 * Princeton Neuroscience Institute(普林斯顿神经科学研究所) Department of Psychology, Princeton University(普林斯顿大学心理学系) Department of Psychology, Université de Montréal(蒙特利尔大学心理学系) Mila - Quebec AI Institute(魁北克AI研究所) Department of Computer Science, Princeton University(普林斯顿大学计算机科学系)

专题命中 视觉推理 :VLM(title,abstract);vision language model(abstract);visual reasoning(abstract);分类 cs.AI

AI总结 研究发现视觉语言模型在视觉序列处理能力上存在缺陷,导致其在不同领域中的推理表现与人类存在显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11666 2026-01-21 cs.CV cs.AI 84%

MATEX: Multi-scale Attention and Text-guided Explainability of Medical Vision-Language Models

MATEX: 医疗视觉-语言模型的多尺度注意力与文本引导可解释性

Muhammad Imran, Chi Lee, Yugyung Lee

机构 * Computer Science, School of Science and Engineering(科学与工程学院计算机科学)

专题命中 视觉推理 :vision-language model(title,abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 MATEX通过多尺度注意力与文本引导方法提升医疗视觉-语言模型的可解释性,实现更精确和临床相关的梯度归因图。

Comments 12 pages, 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11644 2026-01-21 cs.CV cs.AI 84%

Predicting When to Trust Vision-Language Models for Spatial Reasoning

预测何时信任视觉-语言模型进行空间推理

Muhammad Imran, Yugyung Lee

机构 * University of Missouri Kansas City(密苏里大学堪萨斯城分校)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 本研究提出一种基于视觉的置信度估计框架,通过几何验证提升VLM空间推理的可靠性,实验显示其在BLIP-2和CLIP上的AUROC显著优于文本方法基线。

Comments 9 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13096 2026-01-21 cs.RO cs.CV 83%

LLM-VLM Fusion Framework for Autonomous Maritime Port Inspection using a Heterogeneous UAV-USV System

基于异构无人机-水下机器人系统的LLM-VLM融合框架用于自主港口检测

Muhayy Ud Din, Waseem Akram, Ahsan B. Bakht, Irfan Hussain

机构 * Khalifa University Center for Autonomous Robotic Systems (KUCARS)(卡利法大学自主机器人系统中心(KUCARS)) Khalifa University(卡利法大学)

专题命中 视觉推理 :VLM(title,abstract);vision language model(abstract);分类 cs.CV

AI总结 本文提出基于LLM和VLM的融合框架,利用异构无人机-水下机器人系统实现自主港口检测,通过符号规划与语义检测提升检测效率和安全性。

Comments submitted in AEJ

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12626 2026-01-21 cs.CV 83%

Linear Mechanisms for Spatiotemporal Reasoning in Vision Language Models

线性机制用于视觉语言模型中的时空推理

Raphi Kang, Hongqiao Chen, Georgia Gkioxari, Pietro Perona

机构 * California Institute of Technology(加利福尼亚理工学院)

专题命中 视觉推理 :vision language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出了一种线性机制用于视觉语言模型中的时空推理,通过分析空间ID和时间ID的结合,揭示了模型内部的因果推理过程,以提升模型的可解释性和设计能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13705 2026-01-21 cs.CV 79%

Reasoning or Pattern Matching? Probing Large Vision-Language Models with Visual Puzzles

推理还是模式匹配?通过视觉谜题探测大型视觉-语言模型

Maria Lymperaiou, Vasileios Karampinis, Giorgos Filandrianos, Angelos Vlachos, Chrysoula Zerva, Athanasios Voulodimos

机构 * National Technical University of Athens(国家技术大学雅典) Instituto de Telecomunicações(电信研究所)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文通过视觉谜题探测大型视觉-语言模型的推理能力,揭示其在泛化、感知与推理整合及执行一致性方面的局限,并提出未来基准和系统的发展方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11801 2026-01-21 cs.RO cs.AI 79%

RobotDesignGPT: Automated Robot Design Synthesis using Vision Language Models

RobotDesignGPT: 基于视觉语言模型的自动化机器人设计合成

Nitish Sontakke, K. Niranjan Kumar, Sehoon Ha

机构 * School of Interactive Computing, Georgia Institute of Technology(交互计算学院,佐治亚理工学院)

专题命中 视觉推理 :vision language model(title);vision-language model(abstract);分类 cs.AI

AI总结 RobotDesignGPT利用视觉语言模型实现自动化机器人设计,通过用户提示和参考图像生成美观且运动学有效的机器人设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11633 2026-01-21 cs.CV 77%

Beyond Accuracy: Evaluating Grounded Visual Evidence in Thinking with Images

超越准确率:评估图像推理中的 grounded 视觉证据

Xuchen Li, Xuzhao Li, Renjie Pi, Shiyu Hu, Jian Zhao, Jiahui Gao

机构 * ZGCA(中钢集团自动化研究院) NTU(国立.ntu) HKUST(香港科技大学) HKU(香港大学) ZGCI(中钢集团信息院)

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);grounding(abstract);分类 cs.CV

AI总结 ViEBench 是一个用于评估视觉语言模型图像推理能力的基准,通过细粒度视觉证据和双轴矩阵评估模型在不同任务复杂度下的推理表现。

Comments Preprint, Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13453 2026-01-21 cs.CL cs.HC 75%

PhysicsSolutionAgent: Towards Multimodal Explanations for Numerical Physics Problem Solving

PhysicsSolutionAgent: 向数值物理问题求解的多模态解释迈进

Aditya Thole, Anmol Agrawal, Arnav Ramamoorthy, Dhruv Kumar

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);visual reasoning(abstract)

AI总结 PhysicsSolutionAgent通过生成多模态视频解释,提升数值物理问题的可视化教学效果,揭示了多模态推理与评估的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13401 2026-01-21 cs.CV cs.AI 73%

Reasoning with Pixel-level Precision: QVLM Architecture and SQuID Dataset for Quantitative Geospatial Analytics

基于像素级精度的推理:QVLM架构与SQuID数据集用于定量遥感分析

Peter A. Massih, Eric Cosatto

机构 * Department of Machine Learning, NEC Laboratories America(机器学习系,NEC美国实验室)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出QVLM架构和SQuID数据集,通过解耦语言理解和视觉分析,提升定量空间推理的准确性。

Comments Submitted to CVPR 2026. Introduces the QVLM architecture and the SQuID dataset for quantitative geospatial reasoning. Dataset DOI: 10.57967/hf/7565

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05014 2026-01-21 cs.AI cs.LG 73%

Think Then Embed: Generative Context Improves Multimodal Embedding

思考后再嵌入:生成性上下文提升多模态嵌入

Xuanming Cui, Jianpeng Cheng, Hong-you Chen, Satya Narayan Shukla, Abhijeet Awasthi, Xichen Pan, Chaitanya Ahuja, Shlok Kumar Mishra, Yonghuan Yang, Jun Xiao, Qi Guo, Ser-Nam Lim, Aashu Singh, Xiangjun Fan

机构 * AI at Meta(Meta人工智能部门) University of Central Florida(中央佛罗里达大学) New York University(纽约大学)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出Think-Then-Embed框架,通过生成性推理提升多模态嵌入性能,实现更高效的复杂指令处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13299 2026-01-21 cs.CV 70%

Enginuity: Building an Open Multi-Domain Dataset of Complex Engineering Diagrams

Enginuity:构建一个复杂的工程图多领域开放数据集

Ethan Seefried, Prahitha Movva, Naga Harshita Marupaka, Tilak Kasturi, Tirthankar Ghosal

机构 * Oak Ridge National Laboratory(奥克伍德国家实验室)

专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 Enginuity是一个开放的多领域工程图数据集,旨在通过结构注释帮助AI处理工程图解析和科学发现。

Comments Accepted at the 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: Ai4 Science

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12585 2026-01-21 cs.HC cs.AI cs.ET 70%

Do MLLMs See What We See? Analyzing Visualization Literacy Barriers in AI Systems

MLLMs是否看到我们看到的?分析AI系统中可视化素养障碍

Mengli, Duan, Yuhe, Jiang, Matthew Varona, Carolina Nobre

机构 * University of Toronto(多伦多大学)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI

AI总结 本研究分析了MLLMs在可视化素养中的障碍,揭示了两种机器特定的障碍,并展示了模型在复杂可视化任务上的表现差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13562 2026-01-21 cs.AI cs.CV cs.LG 67%

Reasoning is a Modality

推理是一种模态

Zhiguang Liu, Yi Shang

机构 * University of Missouri - Columbia(密苏里大学哥伦比亚分校)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出了一种新的视觉推理方法,通过分离控制器和工作区令牌,实现了更高效的规则执行,从而在ARC任务中取得优于人类和先前方法的准确率。

Comments Code access: https://github.com/lz7fd/Reasoning_is_a_Modality

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14127 2026-01-21 cs.CV cs.CL 57%

The Side Effects of Being Smart: Safety Risks in MLLMs' Multi-Image Reasoning

智能的副作用:MLLMs多图像推理中的安全风险

Renmiao Chen, Yida Lu, Shiyao Cui, Xuan Ouyang, Victor Shea-Jay Huang, Shumin Zhang, Chengwei Pan, Han Qiu, Minlie Huang

机构 * CoAI group, DCST, Tsinghua University(清华大学) Beihang University(北航) Tsinghua University(清华大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 研究发现,多图像推理能力越强的模型在安全测试中越容易产生不安全响应,揭示了模型在任务解决中可能忽视安全约束的风险。

Comments *15 pages, 5 figures. Introduces MIR-SafetyBench (2,676 instances; 9 multi-image relations). Equal contribution; †Corresponding author. Code/data: https://github.com/thu-coai/MIR-SafetyBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13886 2026-01-21 cs.CV 57%

Revisiting Multi-Task Visual Representation Learning

重新审视多任务视觉表示学习

Shangzhe Di, Zhonghua Zhai, Weidi Xie

机构 * SAI, Shanghai Jiao Tong University(上海交通大学SAI) ByteDance Seed(字节跳动种子)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 MTV框架通过多任务学习结合视觉-语言对比、自监督和密集空间目标,提升空间推理能力的同时保持全局语义理解。

Comments Code: https://github.com/Becomebright/MTV

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13547 2026-01-21 cs.CL cs.AI 57%

HateXScore: A Metric Suite for Evaluating Reasoning Quality in Hate Speech Explanations

HateXScore: 一个评估仇恨言论解释推理质量的度量套件

Yujia Hu, Roy Ka-Wei Lee

机构 * Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

AI总结 HateXScore通过四个维度评估仇恨言论解释的推理质量,揭示可解释性问题,提升审核透明度

Comments EACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏