arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-12-24 至 2025-12-24 共收录 33 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 1 篇

2512.15649 2025-12-24 cs.CV cs.AI cs.CL 81%

VTCBench: Can Vision-Language Models Understand Long Context with Vision-Text Compression?

VTCBench: 视觉-语言模型能否通过视觉-文本压缩理解长上下文?

Hongbo Zhao, Meng Wang, Fei Zhu, Wenzhuo Liu, Bolin Ni, Fanhu Zeng, Gaofeng Meng, Zhaoxiang Zhang

机构 * 1 Institute of Automation, Chinese Academy of Sciences 2 School of Artificial Intelligence, University of Chinese Academy of Sciences 3 Centre for Artificial Intelligence Robotics, Hong Kong Institute of Science \& Innovation, CAS 4 Independent Researcher

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 VTCBench评估视觉-文本压缩对视觉语言模型长上下文理解能力的影响,发现多数模型在处理压缩信息时表现不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 8 篇

2512.20595 2025-12-24 cs.CL cs.AI cs.CV 84%

Cube Bench: A Benchmark for Spatial Visual Reasoning in MLLMs

Cube Bench: 一个用于多模态大语言模型空间视觉推理的基准测试

Dhruv Anand, Ehsan Shareghi

机构 * Department of Data Science and AI, Monash University(数据科学与人工智能系,墨尔本大学)

专题命中 视觉推理 :visual reasoning(title);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 Cube Bench通过评估多模态大语言模型在空间视觉推理中的能力,揭示了模型在复杂任务中的表现差异及自我纠正的局限性。

Comments 27 pages, 5 figures, 9 tables. Cube available at https://github.com/dana-23/cube-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20557 2025-12-24 cs.CV 83%

Learning to Reason in 4D: Dynamic Spatial Understanding for Vision Language Models

在4D中学习推理:面向视觉语言模型的动态空间理解

Shengchao Zhou, Yuxin Chen, Yuying Ge, Wei Huang, Jiehong Lin, Ying Shan, Xiaojuan Qi

机构 * The University of Hong Kong(香港大学) ARC Lab, Tencent PCG(腾讯PCG实验室)

专题命中 视觉推理 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本研究提出DSR套件,通过生成多选题-答案对和轻量级几何选择模块提升视觉语言模型的动态空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20417 2025-12-24 cs.CV cs.MA 79%

Chain-of-Anomaly Thoughts with Large Vision-Language Models

基于大视觉-语言模型的异常思维链

Pedro Domingos, João Pereira, Vasco Lopes, João Neves, David Semedo

机构 * NOVALINCS, NOVA School of Science and Technology(NOVALINCS、NOVA科学与技术学院) NOVALINCS, Universidade da Beira Interior(NOVALINCS、贝拉内尔大学) DeepNeuronic

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出CoAT框架,通过引入异常偏见提升大视觉-语言模型在异常检测和分类任务中的性能。

Comments 2 pages, 3 figures, 1 table. Accepted for RECPAD 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20618 2025-12-24 cs.AI cs.CV cs.LG cs.MA 67%

LongVideoAgent: Multi-Agent Reasoning with Long Videos

LongVideoAgent: 多智能体推理与长视频

Runtao Liu, Ziyi Liu, Jiaqi Tang, Yue Ma, Renjie Pi, Jipeng Zhang, Qifeng Chen

机构 * Hong Kong University of Science and Technology(香港理工大学)

专题命中 视觉推理 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 LongVideoAgent通过多智能体框架实现长视频的多模态推理,利用强化学习提升多智能体协作效率,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08674 2025-12-24 cs.AI cs.MA 57%

Multi-Agent Intelligence for Multidisciplinary Decision-Making in Gastrointestinal Oncology

多智能体智能在胃肠肿瘤多学科决策中的应用

Rongzhao Zhang, Junqiao Wang, Shuyun Yang, Mouxiao Bian, Chihao Zhang, Dongyang Wang, Qiujuan Yan, Yun Zhong, Yuwei Bai, Guanxu Zhu, Kangkun Mao, Miao Wang, Chao Ding, Renjie Lu, Lei Wang, Lei Zheng, Tao Zheng, Xi Wang, Zhuo Fan, Bing Han, Meiling Liu, Luyi Jiang, Dongming Shan, Wenzhong Jin, Jiwei Yu, Zheng Wang, Jie Xu, Meng Luo

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Ninth People’s Hospital, Shanghai Jiao Tong University School of Medicine(上海第九人民医院,上海交通大学医学院) Renji Hospital, Shanghai Jiao Tong University School of Medicine(仁济医院,上海交通大学医学院) Shanghai Institute of Infectious Disease and Biosecurity, Fudan University(上海市传染病防治研究所暨生物安全研究所,复旦大学) Shanghai Health Development Research Center (Shanghai Medical Information Center)(上海市卫生健康发展研究中心(上海市医疗信息中心)) Shanghai Kupas Technology Co., Ltd.(上海库帕斯科技有限公司)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出基于多智能体的框架,用于提升胃肠肿瘤多学科决策的自动化支持,通过模拟多学科团队协作,提高推理逻辑和医疗准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13256 2025-12-24 cs.AI cs.CY cs.MA 57%

CardAIc-Agents: A Multimodal Framework with Hierarchical Adaptation for Cardiac Care Support

CardAIc-Agents: 一种用于心脏护理支持的多模态框架,具有分层适应性

Yuting Zhang, Karina V. Bunting, Asgher Champsi, Xiaoxia Wang, Wenqi Lu, Alexander Thorley, Sandeep S Hothi, Zhaowen Qiu, Baturalp Buyukates, Dipak Kotecha, Jinming Duan

机构 * School of Computer Science, University of Birmingham, UK(英国伯明翰大学计算机科学学院) Department of Cardiovascular Sciences, University of Birmingham, UK(英国伯明翰大学心血管科学系) NIHR Birmingham Biomedical Research Centre and West Midlands NHS Secure Data Environment, University Hospitals Birmingham NHS Foundation Trust, UK(英国伯明翰大学医院 NHS 基础信任机构) Department of Computing and Mathematics, Manchester Metropolitan University, UK(曼彻斯特 Metropolitan 大学计算与数学系) Department of Cardiology, Heart and Lung Centre, Royal Wolverhampton NHS Trust, UK(皇家沃尔夫汉普顿 NHS 委员会心内科部门) College of Computer and Control Engineering, Northeast Forestry University, China(中国东北林业大学计算机与控制工程学院) Julius Center, University Medical Center Utrecht, the Netherlands(荷兰乌得勒支大学医学中心朱利叶斯中心) Division of Informatics, Imaging and Data Sciences, University of Manchester, UK(英国曼彻斯特大学信息学、成像与数据科学系)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI

AI总结 CardAIc-Agents通过多模态框架和分层适应性,提升心脏护理支持的效率和灵活性,有效解决传统AI代理在适应性推理、工具支持、知识更新和视觉输出方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19280 2025-12-24 cs.CV 57%

RemoteReasoner: Towards Unifying Geospatial Reasoning Workflow

RemoteReasoner: 向统一地理空间推理流程迈进

Liang Yao, Fan Liu, Hongbo Lu, Chuanyi Zhang, Rui Min, Shengxiang Xu, Shimin Di, Pai Peng

机构 * COWARobot

专题命中 视觉推理 :MLLM(abstract);分类 cs.CV

AI总结 RemoteReasoner通过强化学习实现统一地理空间推理流程,具备多粒度任务处理能力和自主推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20092 2025-12-24 cs.CL 50%

Memory-T1: Reinforcement Learning for Temporal Reasoning in Multi-session Agents

Memory-T1: 基于强化学习的多会话代理时间推理

Yiming Du, Baojun Wang, Yifan Xiang, Zhaowei Wang, Wenyu Huang, Boyang Xue, Bin Liang, Xingshan Zeng, Fei Mi, Haoli Bai, Lifeng Shang, Jeff Z. Pan, Yuxin Jiang, Kam-Fai Wong

机构 * The Chinese University of Hong Kong(香港中文大学) Huawei Technologies Co.,Ltd(华为技术有限公司) HKUST(香港科技大学) The University of Edinburgh(爱丁堡大学)

专题命中 视觉推理 :grounding(abstract)

AI总结 Memory-T1通过强化学习提升多会话代理的时间推理能力,实现7B模型在Time-Dialog基准上的67.0%高分,优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 10 篇

2512.17601 2025-12-24 cs.CV 83%

HeadHunt-VAD: Hunting Robust Anomaly-Sensitive Heads in MLLM for Tuning-Free Video Anomaly Detection

HeadHunt-VAD: 在MLLM中寻找鲁棒的异常敏感头部以实现无调优视频异常检测

Zhaolin Cai, Fan Li, Ziwei Zheng, Haixia Bi, Lijun He

专题命中 视觉定位与Grounding :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 HeadHunt-VAD通过直接在冻结的MLLM中寻找鲁棒的异常敏感头部,实现高效的无调优视频异常检测。

Comments AAAI 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13891 2025-12-24 cs.CV 83%

Weakly Supervised Ephemeral Gully Detection In Remote Sensing Images Using Vision Language Models

基于视觉语言模型的弱监督瞬时沟壑遥感图像检测

Seyed Mohamad Ali Tousi, Ramy Farag, John A. Lory, G. N. DeSouza

机构 * Vision Guided and Intelligent Robotics Laboratory (ViGIR)(视觉引导与智能机器人实验室) EECS Dept.(电子工程与计算机科学系) Division of Plant Science and Technology(植物科学与技术系)

专题命中 视觉定位与Grounding :vision language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出基于视觉语言模型的弱监督瞬时沟壑检测方法,通过半监督学习和噪声感知损失函数提升遥感图像检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20013 2025-12-24 cs.CV 70%

SegEarth-R2: Towards Comprehensive Language-guided Segmentation for Remote Sensing Images

SegEarth-R2: 向远程 sensing 图像的全面语言引导分割迈进

Zepeng Xin, Kaiyu Li, Luodi Chen, Wanchen Li, Yuchen Xiao, Hui Qiao, Weizhan Zhang, Deyu Meng, Xiangyong Cao

机构 * Xi’an Jiaotong University(西安交通大学) China Telecom Shaanxi Branch(中国电信陕西分支)

专题命中 视觉定位与Grounding :grounding(abstract);MLLM(abstract);分类 cs.CV

AI总结 SegEarth-R2通过MLLM架构实现远程 sensing 图像的全面语言引导分割,解决复杂场景下的多目标和隐含意图识别问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19943 2025-12-24 cs.CV 70%

SE360: Semantic Edit in 360$^\circ$ Panoramas via Hierarchical Data Construction

SE360:通过分层数据构建实现360度全景图的语义编辑

Haoyi Zhong, Fang-Lue Zhang, Andrew Chalmers, Taehyun Rhee

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 SE360通过分层数据构建实现360度全景图的语义编辑,提出自主数据生成管道和两阶段数据精修策略,提升编辑质量和语义准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20451 2025-12-24 cs.CV 57%

Beyond Motion Pattern: An Empirical Study of Physical Forces for Human Motion Understanding

超越运动模式:人体运动理解中物理力的实证研究

Anh Dao, Manh Tran, Yufei Zhang, Xiaoming Liu, Zijun Cui

机构 * Michigan State University(密歇根州立大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本研究通过引入物理推断的力,提升了人体运动理解在步态识别、动作识别和视频描述中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20344 2025-12-24 cs.AI 57%

A DeepSeek-Powered AI System for Automated Chest Radiograph Interpretation in Clinical Practice

基于DeepSeek的AI系统用于临床实践中自动胸部X光解读

Yaowei Bai, Ruiheng Zhang, Yu Lei, Xuhua Duan, Jingfeng Yao, Shuguang Ju, Chaoyang Wang, Wei Yao, Yiwan Guo, Guilin Zhang, Chao Wan, Qian Yuan, Lei Chen, Wenjuan Tang, Biqiang Zhu, Xinggang Wang, Tao Sun, Wei Zhou, Dacheng Tao, Yongchao Xu, Chuansheng Zheng, Huangxuan Zhao, Bo Du

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.AI

AI总结 基于DeepSeek的AI系统在临床实践中实现自动胸部X光解读,提升诊断可靠性与效率,减少解读时间并获得专家认可。

Comments arXiv admin note: substantial text overlap with arXiv:2507.19493

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20278 2025-12-24 cs.AI 57%

Synthesizing Procedural Memory: Challenges and Architectures in Automated Workflow Generation

生成程序记忆:自动化工作流生成中的挑战与架构

Nishant Gaurav, Adit Akarsh, Ankit Ranjan, Manoj Bajaj

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出通过科学方法自主生成工作流技能,解决自动化技能生成中的四个结构性瓶颈。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20257 2025-12-24 cs.CV 57%

LADLE-MM: Limited Annotation based Detector with Learned Ensembles for Multimodal Misinformation

LADLE-MM:基于有限标注的多模态虚假信息检测器

Daniele Cardullo, Simone Teglia, Irene Amerini

机构 * Sapienza University of Rome(罗马萨皮恩扎大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 LADLE-MM是一种基于有限标注的多模态虚假信息检测器,通过学习的集成方法在有限资源下实现高效检测,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12711 2025-12-24 cs.CV 57%

Drifting Away from Truth: GenAI-Driven News Diversity Challenges LVLM-Based Misinformation Detection

远离真相:生成式AI驱动的新闻多样性对基于LVLM的虚假信息检测的挑战

Fanxiao Li, Jiaying Wu, Tingchao Fu, Yunyun Dong, Bingbing Song, Wei Zhou

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文探讨生成式AI驱动的新闻多样性对基于LVLM的虚假信息检测系统造成的挑战,通过DriftBench基准揭示了现有系统在多级漂移下的鲁棒性问题,并指出需要更稳健的解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19959 2025-12-24 cs.CG 50%

A Comprehensive Guide to Mesh Simplification using Edge Collapse

基于边折叠的网格简化全面指南

Purva Kulkarni, Aravind Shankara Narayanan

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提供基于边折叠的网格简化方法的全面指南,涵盖理论基础、实现细节及实用技巧,帮助从业者和研究人员理解和应用该技术。

Comments 46 pages, 23 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 文档图表理解 2 篇

2512.20479 2025-12-24 cs.CV 57%

UTDesign: A Unified Framework for Stylized Text Editing and Generation in Graphic Design Images

UTDesign: 一种统一框架,用于图形设计图像中的风格化文本编辑与生成

Yiming Zhao, Yuanpeng Gao, Yuxuan Luo, Jiwei Duan, Shisong Lin, Longfei Xiong, Zhouhui Lian

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所) State Key Laboratory of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室)

专题命中 文档图表理解 :MLLM(abstract);分类 cs.CV

AI总结 UTDesign提出了一种统一框架,实现高精度风格化文本编辑与生成,支持中英文文本,通过多模态编码器和DiT模型提升设计图像中的文本生成与编辑能力。

Comments 22 pages, 25 figures, SIGGRAPH Asia 2025, Conference Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20174 2025-12-24 cs.CV cs.CL cs.IR 57%

Towards Natural Language-Based Document Image Retrieval: New Dataset and Benchmark

迈向基于自然语言的文档图像检索:新数据集和基准

Hao Guo, Xugong Qin, Jun Jie Ou Yang, Peng Zhang, Gangyan Zeng, Yubo Li, Hailun Lin

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Science and Engineering, Nanjing University of Science and Technology(南京理工大学 cyber 科学与工程学院) State Key Laboratory of Cyberspace Security Defense(网络空间安全防御国家重点实验室) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) University of Southern California(美国南加州大学) Laboratory for Advanced Computing and Intelligence Engineering(先进计算与智能工程实验室)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出基于自然语言的文档图像检索基准,通过生成细粒度语义查询提升检索性能,推动视觉文档理解领域研究。

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

5. GUI与屏幕智能体 5 篇

2512.20276 2025-12-24 cs.AI cs.RO 74%

ActionFlow: A Pipelined Action Acceleration for Vision Language Models on Edge

ActionFlow:面向边缘设备的视觉语言模型流水线动作加速

Yuntao Dai, Hang Gu, Teng Wang, Qianyu Cheng, Yifei Zheng, Zhiyong Qiu, Lei Gong, Wenqi Lou, Xuehai Zhou

机构 * School of Computer Science and Technology, University of Science and Technology of China(计算机科学与技术学院,中国科学技术大学) Suzhou Institute for Advanced Research, University of Science and Technology of China(苏州市先进研究院,中国科学技术大学) IEIT SYSTEMS Co., Ltd.(IEIT SYSTEMS公司)

专题命中 GUI与屏幕智能体 :vision language model(title);分类 cs.AI

AI总结 ActionFlow通过跨请求流水线策略提升边缘设备上VLA模型的推理速度,实现2.55倍的FPS提升,无需重新训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20188 2025-12-24 cs.RO cs.AI 70%

Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation

异步快速-慢速视觉-语言-动作策略用于全身机器人操作

Teqiang Zou, Hongliang Zeng, Yuxuan Nong, Yifan Li, Kehui Liu, Haotian Yang, Xinyang Ling, Xin Li, Lianyang Ma

机构 * AstriBot Team(AstriBot团队)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.AI

AI总结 DuoCore-FS通过异步快速-慢速框架提升全身机器人操作的实时性能与任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14396 2025-12-24 cs.RO cs.AI cs.CV 62%

Continuous Vision-Language-Action Co-Learning with Semantic-Physical Alignment for Behavioral Cloning

具有语义-物理对齐的连续视觉-语言-动作共学用于行为克隆

Xiuxiu Qi, Yu Yang, Jiannong Cao, Luyao Bai, Chongshan Fan, Chengtai Cao, Hongpeng Wang

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出CCoL框架,通过连续共学视觉、语言和动作,解决行为克隆中的语义-物理不一致问题,提升动作执行的准确性和鲁棒性。

Comments Accepted at AAAI 2026, the Project website is available at https://qhemu.github.io/CCoL/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20206 2025-12-24 cs.AI 57%

TongSIM: A General Platform for Simulating Intelligent Machines

TongSIM: 一个用于模拟智能机器的通用平台

Zhe Sun, Kunlun Wu, Chuanjian Fu, Zeming Song, Langyong Shi, Zihe Xue, Bohan Jing, Ying Yang, Xiaomeng Gao, Aijia Li, Tianyu Guo, Huiying Li, Xueyuan Yang, Rongkai Liu, Xinyi He, Yuxi Wang, Yue Li, Mingyuan Liu, Yujie Lu, Hongzhao Xie, Shiyun Zhao, Bo Dai, Wei Wang, Tao Yuan, Song-Chun Zhu, Yujia Peng, Zhenliang Zhang

机构 * State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室) BIGAI Beijing, China(中国北京)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.AI

AI总结 TongSIM是一个通用平台,用于训练和评估具身智能代理,提供多样化的场景和交互丰富的环境,支持从低级导航到高级复合活动的广泛研究需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20166 2025-12-24 cs.RO 50%

LoLA: Long Horizon Latent Action Learning for General Robot Manipulation

LoLA:面向通用机器人操作的长周期隐式动作学习

Xiaofan Wang, Xingyu Gao, Jianlong Fu, Zuolei Li, Dean Fortier, Galen Mullins, Andrey Kolobov, Baining Guo

机构 * Institute of Microelectronics, Chinese Academy of Sciences(中国科学院微电子研究所) University of Chinese Academy of Sciences(中国科学院大学) Microsoft Research(微软研究院)

专题命中 GUI与屏幕智能体 :vision-language model(abstract)

AI总结 LoLA通过整合长期多视角观察和机器人本体感觉,实现长周期、语言引导的机器人操作任务,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 幻觉与鲁棒性 2 篇

2511.17004 2025-12-24 cs.CV cs.CL 79%

Vision Language Models are Confused Tourists

视觉语言模型是困惑的游客

Patrick Amadeus Irawan, Ikhlasul Akmal Hanif, Muhammad Dehan Al Kautsar, Genta Indra Winata, Fajri Koto, Alham Fikri Aji

专题命中 幻觉与鲁棒性 :vision language model(title);vision-language model(abstract);分类 cs.CV

AI总结 本研究提出ConfusedTourist,通过文化对抗鲁棒性测试揭示视觉语言模型在文化线索干扰下的稳定性问题,发现其在简单扰动下表现显著下降,凸显了多文化环境下模型鲁棒性的关键挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20168 2025-12-24 cs.CR cs.AI cs.LG 73%

Odysseus: Jailbreaking Commercial Multimodal LLM-integrated Systems via Dual Steganography

奥德赛:通过双隐写术对集成多模态大语言模型系统的商业系统进行劫持

Songze Li, Jiameng Cheng, Yiming Li, Xiaojun Jia, Dacheng Tao

机构 * S3IC-Lab(S3IC实验室)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI、cs.LG

AI总结 奥德赛通过双隐写术劫持多模态大语言模型集成系统,揭示现有安全过滤器的局限性,实现高达99%的攻击成功率。

Comments This paper is accepted by Network and Distributed System Security Symposium (NDSS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

7. VLM训练与架构 4 篇

2512.20561 2025-12-24 cs.CV 70%

FlashVLM: Text-Guided Visual Token Selection for Large Multimodal Models

FlashVLM: 大规模多模态模型中的文本引导视觉令牌选择

Kaitong Cai, Jusheng Zhang, Jing Yang, Yijia Fan, Pengtao Xie, Jian Wang, Keze Wang

机构 * Sun Yat-sen University(中山大学) University of California, San Diego(加州大学圣地亚哥分校) Snap Inc.(Snap公司)

专题命中 VLM训练与架构 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV

AI总结 FlashVLM通过文本引导的视觉令牌选择,实现了高效压缩和高准确率,在大规模多模态模型中表现出色。

Comments Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20409 2025-12-24 cs.CV cs.AI 62%

DETACH : Decomposed Spatio-Temporal Alignment for Exocentric Video and Ambient Sensors with Staged Learning

DETACH:解构时空对齐用于外向视频和环境传感器的分阶段学习

Junho Yoon, Jaemo Jung, Hyunju Kim, Dongman Lee

机构 * KAIST(韩国科学技术院)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 DETACH通过解构时空对齐方法,解决外向视频与环境传感器在动作识别中的对齐问题,提升模型在Opportunity++和HWU-USP数据集上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏