arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-11-25 至 2025-11-25 共收录 79 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 22 篇

2511.18640 2025-11-25 cs.CV cs.AI cs.LG 67%

Health system learning achieves generalist neuroimaging models

健康系统学习实现通用神经影像模型

Akhil Kondepudi, Akshay Rao, Chenhui Zhao, Yiwei Lyu, Samir Harake, Soumyanil Banerjee, Rushikesh Joshi, Anna-Katharina Meissner, Renly Hou, Cheng Jiang, Asadur Chowdury, Ashok Srinivasan, Brian Athey, Vikas Gulani, Aditya Pandey, Honglak Lee, Todd Hollon

机构 * Machine Learning in Neurosurgery Lab University of Michigan(密歇根大学机器学习神经外科实验室) University of Michigan Computational Medicine and Bioinformatics(密歇根大学计算医学与生物信息学) University of Michigan Computer Science and Engineering(密歇根大学计算机科学与工程) University of Michigan Radiology(密歇根大学放射学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 NeuroVFM通过健康系统学习范式,在临床MRI和CT影像上训练,实现高性能通用神经影像模型,提升放射学诊断和报告生成的准确性与临床实用性。

Comments 53 pages, 4 main figures, 10 extended data figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19149 2025-11-25 cs.CV cs.AI cs.CL 62%

From Pixels to Posts: Retrieval-Augmented Fashion Captioning and Hashtag Generation

从像素到帖子:基于检索的时尚描述与标签生成

Moazzam Umer Gondal, Hamad Ul Qudous, Daniya Siddiqui, Asma Ahmad Farhan

机构 * organization= School of Computing, National University of Computer \& Emerging Sciences (FAST) , city= Lahore , postcode= 54000 , country= Pakistan

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种基于检索的时尚描述与标签生成方法,结合多件服装检测、属性推理和大语言模型,提升描述准确性和标签生成的视觉相关性。

Comments Submitted to Expert Systems with Applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19046 2025-11-25 cs.CV cs.AI 62%

MedSAM3: Delving into Segment Anything with Medical Concepts

MedSAM3:深入探索医学概念中的分割任务

Anglin Liu, Rundong Xue, Xu R. Cao, Yifan Shen, Yi Lu, Xiang Li, Qianqian Chen, Jintai Chen

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 MedSAM3通过引入可文本提示的医学分割模型,实现了基于开放词汇文本描述的精准解剖结构分割,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15622 2025-11-25 cs.CV cs.AI 62%

The SA-FARI Dataset: Segment Anything in Footage of Animals for Recognition and Identification

SA-FARI数据集:用于识别和鉴定的动物视频中的片段任何事物

Dante Francisco Wasmuht, Otto Brookes, Maximillian Schall, Pablo Palencia, Chris Beirne, Tilo Burghardt, Majid Mirmehdi, Hjalmar Kühl, Mimi Arandjelovic, Sam Pottie, Peter Bermant, Brandon Asheim, Yi Jin Toh, Adam Elzinga, Jason Holmberg, Andrew Whitworth, Eleanor Flatt, Laura Gustafson, Chaitanya Ryali, Yuan-Ting Hu, Baishan Guo, Andrew Westbury, Kate Saenko, Didac Suris

机构 * Conservation X Labs (CXL)(Conservation X Labs) Meta University of Bristol(布里斯托大学) Hasso Plattner Institute(哈索罗滕堡研究所) University of Oviedo(奥维多大学) Osa Conservation(Osa保护) Senckenberg Museum of Natural History(Senckenberg自然史博物馆) Max Planck Institute for Evolutionary Anthropology(马克斯·普朗克进化人类学研究所) Climate Corridors(气候走廊)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 SA-FARI数据集通过高物种多样性、多地区覆盖和高质量时空标注,为野生动物多动物跟踪提供了新的研究基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01558 2025-11-25 cs.CV cs.AI 62%

VideoLights: Feature Refinement and Cross-Task Alignment Transformer for Joint Video Highlight Detection and Moment Retrieval

VideoLights: 用于联合视频亮点检测和时刻检索的特征细化与跨任务对齐变换器

Dhiman Paul, Md Rizwan Parvez, Nabeel Mohammed, Shafin Rahman

机构 * North South University(北南大学) Qatar Computing Research Institute (QCRI)(卡塔尔计算研究 institute)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 VideoLights通过引入特征细化、跨模态融合和联合任务反馈机制,提升视频亮点检测与时刻检索的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18319 2025-11-25 cs.AI cs.LG cs.SY eess.SY 62%

Weakly-supervised Latent Models for Task-specific Visual-Language Control

弱监督潜在模型用于任务特定的视觉语言控制

Xian Yeow Lee, Lasitha Vidyaratne, Gregory Sin, Ahmed Farahat, Chetan Gupta

机构 * Industrial AI Lab, Hitachi America, Ltd.(日立美国有限公司工业人工智能实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种任务特定的潜在动态模型,利用目标状态监督学习动作诱导位移,以提高空间定位任务中的视觉语言控制性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19430 2025-11-25 cs.CV 57%

Cook and Clean Together: Teaching Embodied Agents for Parallel Task Execution

烹饪与清洁同时进行:教授并行任务执行的具身智能体

Dingkang Liang, Cheng Zhang, Xiaopeng Xu, Jianzhong Ju, Zhenbo Luo, Xiang Bai

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 GRANT通过结合语言理解、3D定位和效率优化,实现并行任务调度,提升智能体在复杂环境中的任务执行效率。

Comments Accepted to AAAI 2026 (Oral). The code is available at \url{https://github.com/H-EmbodVis/GRANT}

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18983 2025-11-25 cs.CV 57%

UMCL: Unimodal-generated Multimodal Contrastive Learning for Cross-compression-rate Deepfake Detection

UMCL: 单模生成多模对比学习用于跨压缩率深度伪造检测

Ching-Yi Lai, Chih-Yu Jian, Pei-Cheng Chuang, Chia-Ming Lee, Chih-Chung Hsu, Chiou-Ting Hsu, Chia-Wen Lin

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 UMCL通过单模生成多模对比学习,提升跨压缩率深度伪造检测的鲁棒性和准确性。

Comments 24-page manuscript accepted to IJCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18978 2025-11-25 cs.CV 57%

Zero-shot segmentation of skin tumors in whole-slide images with vision-language foundation models

基于视觉语言基础模型的全切片图像皮肤肿瘤零样本分割

Santiago Moreno, Pablo Meseguer, Rocío del Amor, Valery Naranjo

机构 * Instituto Universitario de Investigación en Tecnología Centrada en el Ser Humano (HUMAN-Tech), Universitat Politécnica de Valencia(人类中心技术大学研究机构(HUMAN-Tech)、西班牙巴塞罗那理工大学) Artikode Intelligence S.L.(Artikode Intelligence公司)

专题命中 视觉定位与Grounding :VLM(abstract);分类 cs.CV

AI总结 本研究提出ZEUS框架,利用视觉语言基础模型实现全切片图像中皮肤肿瘤的零样本分割,减少标注负担并提高分割精度。

Comments Conference manuscript accepted for oral presentation at CASEIB 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18405 2025-11-25 cs.AI cs.HC cs.IR 57%

A Multimodal Conversational Agent for Tabular Data Analysis

面向表格数据分析的多模态对话代理

Mohammad Nour Al Awad, Sergey Ivanov, Olga Tikhonova, Ivan Khodnenko

机构 * ITMO University(ITMO大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 Talk2Data是一种多模态对话代理,通过语音和文本交互实现表格数据分析,结合LLM、ASR、代码生成和TTS技术,提供多轮对话和可验证计算。

Comments \c{opyright} 2025 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18116 2025-11-25 cs.CV 57%

PromptMoE: Generalizable Zero-Shot Anomaly Detection via Visually-Guided Prompt Mixtures

PromptMoE: 通过视觉引导的提示混合实现通用零样本异常检测

Yuheng Shao, Lizhang Wang, Changhao Li, Peixian Chen, Qinyuan Liu

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 PromptMoE通过视觉引导的提示混合方法,实现了通用零样本异常检测,提升了模型对未见异常的泛化能力。

Comments 14 pages, 8 figures. Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18104 2025-11-25 cs.CV 57%

Consolidating Diffusion-Generated Video Detection with Unified Multimodal Forgery Learning

通过统一多模态伪造学习巩固扩散生成视频检测

Xiaohong Liu, Xiufeng Song, Huayu Zheng, Lei Bai, Xiaoming Liu, Guangtao Zhai

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) School of Information Science and Electronic Engineering, Shanghai Jiao Tong University(上海交通大学信息科学与电子工程学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Department of Computer Science and Engineering, Michigan State University(密歇根州立大学计算机科学与工程系)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出MM-Det++算法,通过统一多模态学习检测扩散生成视频,结合时空分支和多模态分支,提升视频伪造检测的准确性和泛化能力。

Comments Code and dataset are available at https://github.com/SparkleXFantasy/MM-Det-Plus

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24466 2025-11-25 cs.CV 57%

SA-Person: Text-Based Person Retrieval with Scene-aware Re-ranking

SA-Person: 基于文本的人检索与场景感知重排序

Yingjia Xu, Jinlin Wu, Daming Gao, Zhen Chen, Yang Yang, Min Cao, Mang Ye, Zhen Lei

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) Centre for Artificial Intelligence and Robotics, Hong Kong Institute of Science and Innovation, Chinese Academy of Sciences(中国科学院香港创新研究院人工智能与机器人中心) Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统(MAIS)) Wuhan University(武汉大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 SA-Person通过整合个体外观和全局场景上下文,提升基于文本的人检索准确性,提出ScenePerson-13W数据集和两阶段检索框架。

Comments 13 pages, 8 figures. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17991 2025-11-25 cs.CV cs.CL 57%

VideoLLM Knows When to Speak: Enhancing Time-Sensitive Video Comprehension with Video-Text Duet Interaction Format

VideoLLM 知何时言:通过视频-文本双人对话交互格式增强时间敏感视频理解

Yueqian Wang, Xiaojun Meng, Yuxuan Wang, Jianxin Liang, Jiansheng Wei, Huishuai Zhang, Dongyan Zhao

机构 * Wangxuan Institute of Computer Technology, Peking University(王炫计算机技术研究所,北京大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Beijing Institute for General Artificial Intelligence(北京通用人工智能研究院) State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出视频-文本双人对话交互格式,通过MMDuetIT数据集和MAGQA任务提升VideoLLM在时间敏感任务中的表现,实现高效实时响应。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19226 2025-11-25 physics.med-ph 50%

In-vivo imaging with a low-cost MRI scanner and cloud data processing in low-resource settings

在低资源环境中使用低成本MRI扫描仪和云数据处理进行体内成像

Teresa Guallart-Naval, Robert Asiimwe, Patricia Tusiime, Mary A. Nassejje, Leo Kinyera, Lemi Robin, Maureen Nayebare, Luiz G. C. Santos, Marina Fernández-García, Lucas Swistunow, José M. Algarín, John Stairs, Michael Hansen, Ronald Amodoi, Andrew Webb, Joshua Harper, Steven J. Schiff, Johnes Obungoloch, Joseba Alonso

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本研究展示了在低资源环境中通过改进硬件和软件实现低成本MRI系统获得临床相关图像质量的可行性。

Comments 10 pages, 10 figures, comments welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01588 2025-11-25 cs.SD eess.AS eess.SP 50%

Learning Perceptually Relevant Temporal Envelope Morphing

学习具有感知相关性的时序包络变形

Satvik Dixit, Sungjoon Park, Chris Donahue, Laurie M. Heller

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出了一种基于感知指导的学习方法,用于生成具有时间中间性的音频包络变形,通过人类听觉研究和大规模数据集训练,优于现有方法。

Comments Accepted at WASPAA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.02977 2025-11-25 cond-mat.stat-mech 50%

Open Problems within Nonextensive Statistical Mechanics

非广延统计力学中的开放问题

Kenric P. Nelson

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文综述了非广延统计力学中的开放问题,包括熵与泛化熵的差异量化、参数q的物理解释、泛化乘积的定义改进、广义傅里叶变换的应用以及非广延熵的归一化重新审视,并提出形状参数可能用于定义系统统计复杂性。

Comments 19 pages; 1 figure; 2 tables; recommended for publication in Entropy, special issue Nonadditive Entropies and Nonextensive Statistical Mechanics

Journal ref Entropy 2024, 26(2), 118

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 文档图表理解 1 篇

2511.18434 2025-11-25 cs.CV cs.AI 62%

DocPTBench: Benchmarking End-to-End Photographed Document Parsing and Translation

DocPTBench: 用于照片文档解析与翻译的基准测试

Yongkun Du, Pinxuan Chen, Xuye Ying, Zhineng Chen

机构 * College of Computer Science and Artificial Intelligence(计算机科学与人工智能学院) Institute of Trustworthy Embodied AI(可信具身人工智能研究所)

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 DocPTBench是一个针对真实拍摄文档解析与翻译的基准测试,揭示了从数字生成文档到真实拍摄文档的性能下降问题。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. GUI与屏幕智能体 5 篇

2511.18823 2025-11-25 cs.CV 79%

VideoPerceiver: Enhancing Fine-Grained Temporal Perception in Video Multimodal Large Language Models

VideoPerceiver: 提升视频多模态大语言模型的细粒度时序感知能力

Fufangchen Zhao, Liao Zhang, Daiqi Shi, Yuanjun Gao, Chen Ye, Yang Cai, Jian Gao, Danfeng Yan

机构 * State Key Laboratory of Networking and Switching Technology, BUPT(网络与交换技术国家重点实验室)

专题命中 GUI与屏幕智能体 :multimodal large language model(title,abstract);分类 cs.CV

AI总结 VideoPerceiver通过两阶段训练框架提升视频多模态大语言模型对细粒度动作和短暂事件的感知能力,显著优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21354 2025-11-25 cs.CV cs.AI 76%

KV-Efficient VLA: A Method to Speed up Vision Language Models with RNN-Gated Chunked KV Cache

KV-Efficient VLA: 一种加速视觉语言模型的方法通过RNN门控分块KV缓存

Wanshun Xu, Long Zhuang, Lianlei Shan

机构 * University of Toronto(多伦多大学) Tsinghua University(清华大学)

专题命中 GUI与屏幕智能体 :vision language model(title);分类 cs.CV、cs.AI

AI总结 KV-Efficient VLA通过RNN门控分块KV缓存机制,有效降低视觉语言模型的计算和内存开销,提升推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19033 2025-11-25 cs.CV 57%

ReEXplore: Improving MLLMs for Embodied Exploration with Contextualized Retrospective Experience Replay

ReEXplore: 通过上下文化回顾经验回放提升具身探索的MLLMs

Gengyuan Zhang, Mingcong Ding, Jingpei Wu, Ruotong Liao, Volker Tresp

机构 * LMU Munich(慕尼黑大学) Munich Center for Machine Learning(慕尼黑机器学习中心) TU Munich(慕尼黑技术大学)

专题命中 GUI与屏幕智能体 :MLLM(abstract);分类 cs.CV

AI总结 ReEXplore通过回顾经验回放和分层前沿选择,提升MLLMs在具身探索中的效率和性能。

Comments 8 main pages plus 13 pages Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00416 2025-11-25 cs.RO cs.CV 57%

Evo-0: Vision-Language-Action Model with Implicit Spatial Understanding

Evo-0:具有隐式空间理解的视觉-语言-动作模型

Tao Lin, Gen Li, Yilei Zhong, Yanwen Zou, Yuxin Du, Jiting Liu, Encheng Gu, Bo Zhao

机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院) EvoMind Tech(EvoMind科技) IAAR-Shanghai(IAAR-上海) University of Cambridge(剑桥大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV

AI总结 Evo-0通过隐式整合3D几何特征,提升视觉-语言-动作模型在现实世界中的空间理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17889 2025-11-25 cs.RO cs.CV 57%

MobileVLA-R1: Reinforcing Vision-Language-Action for Mobile Robots

MobileVLA-R1: 为移动机器人强化视觉-语言-动作

Ting Huang, Dongjian Li, Rui Yang, Zeyu Zhang, Zida Yang, Hao Tang

机构 * Peking University(北京大学)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV

AI总结 MobileVLA-R1通过结合监督CoT对齐与GRPO强化学习,提升四足机器人在复杂环境中的视觉-语言-动作控制性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 幻觉与鲁棒性 5 篇

2507.10510 2025-11-25 cs.NI cs.AI cs.HC cs.MM 70%

Chat with AI: The Surprising Turn of Real-time Video Communication from Human to AI

与AI聊天:从人类到AI的实时视频通信惊人转变

Jiangkai Wu, Zhiyuan Ren, Liming Liu, Xinggong Zhang

机构 * Peking University(北京大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI

AI总结 本文提出了一种面向AI的实时视频通信方法,通过上下文感知视频流技术降低延迟并提升AI理解视频的准确性。

Comments 9 pages, 10 figures, Proceedings of the 24th ACM Workshop on Hot Topics in Networks (HotNets 2025), College Park, Maryland, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23518 2025-11-25 cs.AI 70%

TRAP: Targeted Redirecting of Agentic Preferences

TRAP:面向目标的代理偏好重定向

Hangoo Kang, Jehyeok Yeon, Gagandeep Singh

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);LLaVA(abstract);分类 cs.AI

AI总结 TRAP通过语义引导的跨模态操纵,诱导代理AI系统产生一致的选择偏见,揭示了语义层面的安全漏洞。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19257 2025-11-25 cs.CR cs.AI cs.LG 62%

Medusa: Cross-Modal Transferable Adversarial Attacks on Multimodal Medical Retrieval-Augmented Generation

Medusa: 跨模态可转移的对抗攻击用于多模态医疗检索增强生成

Yingjia Shang, Yi Liu, Huimin Wang, Furong Li, Wenfang Sun, Wu Chengyu, Yefeng Zheng

机构 * Westlake University(西湖大学) Heilongjiang University(黑龙江大学) City University of Hong Kong(香港城市大学) Tencent(腾讯)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.AI、cs.LG

AI总结 Medusa提出了一种针对多模态医疗检索增强生成系统的跨模态可转移对抗攻击方法,通过优化扰动和双循环策略实现高攻击成功率并抵御主流防御措施。

Comments Accepted at KDD 2026 First Cycle (full version). Authors marked with * contributed equally. Yi Liu is the lead author

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19659 2025-11-25 cs.CV 57%

Bias in the Picture: Benchmarking VLMs with Social-Cue News Images and LLM-as-Judge Assessment

图像中的偏见:使用社会线索新闻图像和LLM作为裁判的基准测试

Aravind Narayanan, Vahid Reza Khazaie, Shaina Raza

机构 * Vector Institute for AI(向量人工智能研究院)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 本文通过社会线索新闻图像基准测试,揭示了VLMs在视觉上下文中存在系统性偏见,特别是性别和职业属性,指出高忠实度并不必然降低偏见,提出公平的多模态评估方法。

Comments Accepted to NeurIPS 2025 Workshop (Evaluating the Evolving LLM Lifecycle)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15478 2025-11-25 cs.CL 50%

Red Teaming Multimodal Language Models: Evaluating Harm Across Prompt Modalities and Models

针对多模态语言模型的红队测试:评估不同提示模态和模型的有害性

Madison Van Doren, Casey Ford

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract)

AI总结 本研究通过红队测试评估多模态语言模型在不同提示模态下的安全性,发现Pixtral 12B的有害响应率最高,而Claude Sonnet 3.5最安全,凸显了建立多模态安全基准的必要性。

Journal ref AAAI 2026 AIGOV Workshop and EurIPS 2025 Workshop on Unifying Perspectives on Learning Biases

详情

展开后加载摘要…

URL PDF HTML 收藏

5. VLM训练与架构 19 篇

2511.19155 2025-11-25 cs.AI 88%

EEG-VLM: A Hierarchical Vision-Language Model with Multi-Level Feature Alignment and Visually Enhanced Language-Guided Reasoning for EEG Image-Based Sleep Stage Prediction

EEG-VLM:一种具有多级特征对齐和视觉增强语言引导推理的分层视觉-语言模型,用于基于EEG图像的睡眠阶段预测

Xihe Qiu, Gengchen Ma, Haoyu Wang, Chen Zhan, Xiaoyu Tan, Shuo Li

机构 * School of Electronic and Electrical Engineering, Shanghai University of Engineering Science(上海工程技术大学电子与电气工程学院) Department of Control Science and Engineering, College of Electronics and Information Engineering, Tongji University(同济大学电子信息工程学院控制科学与工程系) Tencent Youtu Lab(腾讯云视觉实验室) Case Western Reserve University(凯斯西储大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(title,abstract);分类 cs.AI

AI总结 EEG-VLM通过多级特征对齐和视觉增强语言引导推理,提升基于EEG图像的睡眠阶段分类的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18692 2025-11-25 cs.LG cs.AI cs.CV cs.PF 88%

VLM in a flash: I/O-Efficient Sparsification of Vision-Language Model via Neuron Chunking

VLM即刻:通过神经元分块实现高效的I/O压缩

Kichang Yang, Seonjun Kim, Minjae Kim, Nairan Zhang, Chi Zhang, Youngki Lee

机构 * Seoul National University(首尔国立大学) Meta Amazon(亚马逊公司)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(title);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出Neuron Chunking方法,通过神经元分块实现高效的I/O压缩,提升边缘部署VLMs的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏