arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-01-28 至 2026-01-28 共收录 41 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 6 篇

2502.14780 2026-01-28 cs.CL cs.AI cs.CV 84%

ReVision: A Dataset and Baseline VLM for Privacy-Preserving Task-Oriented Visual Instruction Rewriting

ReVision:一个用于隐私保护任务导向视觉指令重写的数据集和基线VLM

Abhijit Mishra, Mingda Li, Hsiang Fu, Richard Noh, Minji Kim

机构 * School of Information(信息学院) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Department of Statistics and Data Science(统计与数据科学系) Yale University(耶鲁大学) School of Computing and Augmented Intelligence(计算与增强智能学院)

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 ReVision提出一个数据集和基线VLM,通过将多模态指令转换为纯文本命令,实现轻量级设备端指令重写,提升隐私保护的多模态AI应用能力。

Comments In Proceedings of the IJCNLP-AACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19228 2026-01-28 cs.CV 83%

Towards Pixel-Level VLM Perception via Simple Points Prediction

通过简单的点预测实现像素级VLM感知

Tianhui Song, Haoyu Lu, Hao Yang, Lin Sui, Haoning Wu, Zaida Zhou, Zhiqi Huang, Yiping Bao, Y. Charles, Xinyu Zhou, Limin Wang

专题命中 VLM训练与架构 :VLM(title);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 SimpleSeg通过简单点预测实现多模态大语言模型的像素级感知,无需复杂架构即可获得高精度分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19325 2026-01-28 cs.CV cs.AI 81%

Innovator-VL: A Multimodal Large Language Model for Scientific Discovery

Innovator-VL:一种用于科学发现的多模态大语言模型

Zichen Wen, Boxue Yang, Shuang Chen, Yaojie Zhang, Yuhang Han, Junlong Ke, Cong Wang, Yicheng Fu, Jiawang Zhao, Jiangchao Yao, Xi Fang, Zhen Wang, Henxing Cai, Lin Yao, Zhifeng Gao, Yanhui Hong, Nang Yuan, Yixuan Li, Guojiang Zhao, Haoyi Tao, Nan Wang, Han Lyu, Guolin Ke, Ning Liao, Xiaoxing Wang, Kai Chen, Zhiyu Li, Feiyu Xiong, Sihan Hu, Kun Chen, Yanfeng Wang, Weinan E, Linfeng Zhang, Linfeng Zhang

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Institute of Theoretical Physics, Chinese Academy of Sciences(中国科学院理论物理研究所)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

AI总结 Innovator-VL通过高效数据选择和透明训练方法,在科学发现中实现高性能多模态模型。

Comments Innovator-VL tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09201 2026-01-28 cs.CR cs.AI cs.CV 81%

Learning to Detect Unseen Jailbreak Attacks in Large Vision-Language Models

学习检测未见过的大型视觉-语言模型中的对抗攻击

Shuang Liang, Zhihao Xu, Jiaqi Weng, Jialing Tao, Hui Xue, Xiting Wang

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 LoD通过学习模型内部激活生成安全表示,实现对未见过的对抗攻击的高效检测,提升检测性能和效率。

Comments 12 pages; Previously this version appeared as arXiv:2510.15430 which was submitted as a new work by accident

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19850 2026-01-28 cs.CV 57%

EgoHandICL: Egocentric 3D Hand Reconstruction with In-Context Learning

EgoHandICL: 以自身为中心的3D手重建与上下文学习

Binzhu Xie, Shi Qiu, Sicheng Zhang, Yinqiao Wang, Hao Xu, Muzammal Naseer, Chi-Wing Fu, Pheng-Ann Heng

机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong(计算机科学与工程系,香港中文大学) Institute of Medical Intelligence and XR, The Chinese University of Hong Kong(医学智能与XR研究院,香港中文大学) Department of Computer Science, Khalifa University(计算机科学系,哈利法大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 EgoHandICL通过上下文学习框架提升以自身为中心的3D手重建的鲁棒性和一致性,结合视觉语言模型和掩码自动编码器实现更精确的手-物体交互推理。

Comments Accepted in ICLR 2026, Codebase: https://github.com/Nicous20/EgoHandICL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13126 2026-01-28 eess.IV cs.CV 57%

Knowledge-enhanced Pretraining for Vision-language Pathology Foundation Model on Cancer Diagnosis

基于知识增强的视觉语言病理基础模型用于癌症诊断

Xiao Zhou, Luoyi Sun, Dexuan He, Wenbin Guan, Ge Wang, Ruifen Wang, Lifeng Wang, Xiaojun Yuan, Xin Sun, Ya Zhang, Kun Sun, Yanfeng Wang, Weidi Xie

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Xinhua Hospital Affiliated to Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属新华医院) School of Artificial Intelligence(人工智能学院) Department of Pathology(病理学部) Department of Oral Pathology(口腔病理学部) Department of Pediatric Hematology/Oncology(儿科血液肿瘤科) Clinical Research and Innovation Unit(临床研究与创新单元) Department of Pediatric Cardiology(儿童心脏病科)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出KEEP模型,通过整合疾病知识图谱提升癌症诊断的视觉语言基础模型性能,显著优于现有方法。

Comments V2: fixed typos, updated experimental results, added ablation

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他VLM 5 篇

2601.19267 2026-01-28 cs.CL 71%

DiaDem: Advancing Dialogue Descriptions in Audiovisual Video Captioning for Multimodal Large Language Models

DiaDem: 促进音频视频字幕中的对话描述以提升多模态大语言模型

Xinlong Chen, Weihong Lin, Jingyun Hua, Linli Yao, Yue Ding, Bozhou Li, Bohan Zeng, Yang Shi, Qiang Liu, Yuanxing Zhang, Pengfei Wan, Liang Wang, Tieniu Tan

机构 * New Laboratory of Pattern Recognition, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别新实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Kling Team, Kuaishou Technology(快手科技 Kling 团队) Peking University(北京大学) Nanjing University(南京大学)

专题命中 其他VLM :multimodal large language model(title)

AI总结 DiaDem通过合成高质量数据集和难度分区的两阶段GRPO策略,提升了音频视频字幕中的对话描述准确性,并在多种基准测试中表现出色。

Comments Project webpage: https://diadem-captioner.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19659 2026-01-28 cs.CV cs.LG 62%

KeepLoRA: Continual Learning with Residual Gradient Adaptation

KeepLoRA: 基于残差梯度适应的持续学习

Mao-Lin Luo, Zi-Hao Zhou, Yi-Lin Zhang, Yuanyu Wan, Tong Wei, Min-Ling Zhang

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Key Laboratory of Computer Network and Information Integration (Southeast University), Ministry of Education, China(教育部计算机网络与信息集成重点实验室) School of Software Technology, Zhejiang University(浙江大学软件学院)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 KeepLoRA通过残差梯度适应方法实现持续学习,有效平衡知识保留、任务知识保持和新知识获取,取得最佳性能。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22506 2026-01-28 cs.CR cs.AI 57%

SABRE-FL: Selective and Accurate Backdoor Rejection for Federated Prompt Learning

SABRE-FL:面向联邦提示学习的选样和准确后门拒绝

Momin Ahmad Khan, Yasra Chandio, Fatima Muhammad Anwar

机构 * University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校)

专题命中 其他VLM :vision-language model(abstract);分类 cs.AI

AI总结 SABRE-FL通过嵌入空间异常检测器有效识别并过滤联邦提示学习中的恶意客户端,显著降低后门攻击效果,提升系统鲁棒性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16435 2026-01-28 cs.CV cs.CL 57%

Human Cognitive Benchmarks Reveal Foundational Visual Gaps in MLLMs

人类认知基准揭示大规模多模态语言模型中的基础视觉缺陷

Jen-Tse Huang, Dasen Dai, Jen-Yuan Huang, Youliang Yuan, Xiaoyuan Liu, Wenxuan Wang, Wenxiang Jiao, Pinjia He, Zhaopeng Tu, Haodong Duan

机构 * CUHK(香港中文大学) PKU(北京大学) CUHKSZ(香港中文大学深圳分校) RUC(中国人民大学) Tencent(腾讯) SHLab(深圳实验室)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

AI总结 人类认知基准揭示大规模多模态语言模型在基础视觉能力上的不足,通过VisFactor评估发现模型在关键视觉任务上表现不佳。

Comments Update: Evaluated 23 SOTA MLLMs

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19203 2026-01-28 cs.HC 50%

Before Smelling the Video: A Two-Stage Pipeline for Interpretable Video-to-Scent Plans

在嗅觉之前:一种可解释的视频到香氛计划的两阶段流程

Kaicheng Wang, Kevin Zhongyang Shao, Ruiqi Chen, Sep Makhsous, Denise Wilson

专题命中 其他VLM :vision-language model(abstract)

AI总结 本文提出了一种两阶段流程,通过视觉语言模型和大型语言模型分离视频语义提取与气味推断,验证了语义规划在提升嗅觉媒体体验中的有效性。

Comments In submission of poster as ongoing project

详情

展开后加载摘要…

URL PDF HTML 收藏