arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-27 至 2026-08-27 共收录 32 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 2 篇

2509.08897 2026-08-27 cs.CV cs.AI cs.CL cs.MM 版本更新 62%

Recurrence Meets Transformers for Universal Multimodal Retrieval

循环机制与Transformer结合的通用多模态检索模型

Davide Caffagni, Sara Sarto, Marcella Cornia, Lorenzo Baraldi, Rita Cucchiara

机构 * Department of Education and Humanities, University of Modena and Reggio Emilia(教育与人文学院, Modena and Reggio Emilia大学)

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出结合循环机制与Transformer的统一多模态检索模型ReT-2,其支持多模态查询,在M2KR等基准上达最优性能,推理更快、内存占用更低,还可提升下游任务表现。

Comments TPAMI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05393 2026-08-27 cs.CV 版本更新 57%

PreResQ-R1: Response-Preference Disentangled Ranking-and-Scoring Reinforcement Optimization for Robust Visual Quality Assessment

PreResQ-R1:用于鲁棒视觉质量评估的响应偏好解耦排序与评分强化优化

Zehui Feng, Weichuan Wang, Xiaohan Chen, Ting Han

机构 * Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出PreResQ-R1框架,通过解耦响应偏好的强化学习统一评分与排序目标,结合GRPO优化,在IQA和VQA基准上取得最优结果,推理轨迹更贴合人类感知。

Comments 27 pages, 16 figures, Accepted as EMNLP 2026 conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 8 篇

2606.01287 2026-08-27 cs.CV cs.AI 版本更新 81%

Beyond Visual Memory: Mechanistic Diagnostics of Latent Visual Reasoning

超越视觉记忆:潜在视觉推理的机制诊断

Jiawei Guo, Yu Chen, Xiang Wang, Shuai Li, Xinpei Zhao, Huaxing Liu, Shuai Dong, Feifei Zhai, Yu Zhou

机构 * Amap, Alibaba Group(阿里集团亚马通) Shanghai Innovation Institute(上海创新研究院)

专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV、cs.AI

AI总结 通过分解潜在令牌为三个可测试组件,发现边界标记和格式而非潜在槽贡献了主要性能提升,揭示了潜在视觉推理的真正机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03890 2026-08-27 cs.CV 版本更新 77%

OVO-S-Bench: A Hierarchical Benchmark for Streaming Spatial Intelligence in Multimodal LLMs

OVO-S-Bench:多模态大语言模型中流式空间智能的分层基准

Yifei Li, Pengyiang Liu, Yuhang Zang, Zhongyue Shi, Qi Fu, Hongye Hao, Jiwen Lu

机构 * Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室) Beihang University(北京航空航天大学)

专题命中 视觉推理 :MLLM(summary_cn,abstract_cn);分类 cs.CV

AI总结 提出OVO-S-Bench,一个完全人工标注的流式空间智能基准,包含1680个问题,涵盖四个抽象层次,评估38个MLLM,发现Gemini-3.1-Pro落后人类专家27分,流式空间微调MLLM表现不如其骨干模型。

Comments Accepted to EMNLP 2026 Main Conference. 55 pages, 12 figures, 20 tables. Project page: this https URL (https://internlm.github.io/OVO-S-Bench/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18504 2026-08-27 cs.AI 版本更新 70%

UMER: Unifying Embedding and Ranking via Pair-Aware Discriminative Reasoning for Universal Multimodal Retrieval

UMER:通过感知对的判别推理统一嵌入与排序以实现通用多模态检索

Libiao Chen, Xiyang Liu, Yanheng Wei, Tao Wang, Zhenyu Tang

专题命中 视觉推理 :MLLM(abstract,abstract_cn);分类 cs.AI

AI总结 本研究针对通用多模态检索的需求,提出UMER框架,通过感知对的判别推理联合学习对比式嵌入与判别式排序,在MMEB-V2基准上实现最优性能且支持可调整预算的推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08603 2026-08-27 cs.AI 版本更新 70%

OSCAR: Optimization-Steered Agentic Planning for Composed Image Retrieval

OSCAR:基于优化的代理规划用于组合图像检索

Teng Wang, Rong Shan, Jianghao Lin, Junjie Wu, Tianyi Xu, Jianping Zhang, Wenteng Chen, Changwang Zhang, Zhaoxiang Wang, Weinan Zhang, Jun Wang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 视觉推理 :VLM(abstract,abstract_cn);分类 cs.AI

AI总结 OSCAR通过优化引导的代理规划框架,提升组合图像检索的性能,仅用10%训练数据即超越现有最佳方法。

Comments EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19583 2026-08-27 cs.CV cs.AI 版本更新 62%

VGI-Bench: Probing Visual Intelligence in Video Generation Models

VGI-BENCH:探究视频生成模型的视觉智能

Xuan He, Cong Wei, Yuhao Cheng, Linrui Ma, Yuxuan Zhang, Zuojun Li, Yuhao Wen, Jize Jiang, Zeyi Liu, Yuren Hao, Songcheng Cai, Keming Wu, Penghui Du, Kai Zou, Rui Yang, Chenkai Sun, Ke Yang, Ping Nie, Kelsey R Allen, Chenglong Wang, Michel Galley, Jianfeng Gao, ChengXiang Zhai

机构 * University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) Tsinghua University(清华大学) University of Waterloo(滑铁卢大学) Massachusetts Institute of Technology(麻省理工学院) University of British Columbia(不列颠哥伦比亚大学) Vector Institute(矢量研究所) Microsoft Research(微软研究院) Etude AI

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 本研究推出VGI-bench基准,含27项任务810个实例,评估视频生成模型视觉推理能力,发现最强模型Seedance~2.0仅达51.0%,将推动下一代视频生成模型发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18073 2026-08-27 cs.AI cs.CL cs.LG 版本更新 62%

Infer Human's Intentions Before Following Natural Language Instructions

在遵循自然语言指令前推断人类的意图

Yanming Wan, Yue Wu, Yiping Wang, Jiayuan Mao, Natasha Jaques

专题命中 视觉推理 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对人类指令的歧义问题,提出FISER框架,通过显式推断人类意图改进协作具身任务的指令遵循,在HandMeThat基准上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07445 2026-08-27 cs.AI 版本更新 57%

StarDojo: Benchmarking Open-Ended Behaviors of Agentic Multimodal LLMs in Production-Living Simulations with Stardew Valley

StarDojo:基于Stardew Valley的多模态大语言模型在生产-生活模拟中的开放性行为基准测试

Weihao Tan, Changjiu Jiang, Yu Duan, Mingcong Lei, Jiageng Li, Yitian Hong, Xinrun Wang, Bo An

机构 * Nanyang Technological University(南洋理工大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) East China University of Science and Technology(华东理工大学) Singapore Management University(新加坡管理大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

AI总结 StarDojo通过Stardew Valley模拟评估多模态大语言模型在生产与社交活动中的综合能力,包含1000个任务,发现GPT-4.1在视觉理解与多模态推理方面存在显著不足。

Comments Accepted by ECCV 2026. Project website: this https URL (https://weihaotan.github.io/StarDojo)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12065 2026-08-27 cs.RO 版本更新 50%

Scene2Demo: Self-Evolving Embodied Data Generation via Object-Action Graph

具身学习的可扩展任务生成:基于 affordance 的任务世界

Xiang Liu, Sen Cui, Guocai Yao, Zhong Cao, Jingheng Ma, Min Zhang, Changshui Zhang

专题命中 视觉推理 :vision-language model(abstract)

AI总结 本文提出 AGT-World 框架,通过结构化图方法实现任务空间的精确分解,并结合混合反馈机制实现策略的自进化,从而提升机器人任务生成的可扩展性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 9 篇

2510.20803 2026-08-27 cs.CV 版本更新 84%

ARGenSeg: Image Segmentation with Autoregressive Image Generation Model

ARGenSeg:基于自回归图像生成模型的图像分割

Xiaolong Wang, Lixiang Ru, Ziyuan Huang, Kaixiang Ji, Dandan Zheng, Jingdong Chen, Jun Zhou

机构 * Ant Group(蚂蚁集团)

专题命中 视觉定位与Grounding :MLLM(summary_cn,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 该研究提出ARGenSeg框架,将图像生成融入MLLM,通过并行生成视觉令牌实现高效图像分割,在多数据集上性能优于现有方法且推理速度显著提升。

Comments Accepted to NeurIPS 2025, 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16558 2026-08-27 cs.CV cs.MM 版本更新 83%

Segmentation-Based Attention Entropy: Detecting and Mitigating Object Hallucinations in Large Vision-Language Models

基于分割的注意力熵:在大视觉-语言模型中检测和缓解对象幻觉

Jiale Song, Jiaxin Luo, Xue-song Tang, Kuangrong Hao, Mingbo Zhao

机构 * School of Information and Intelligent Science, Donghua University, Shanghai, 201620, China(信息与智能科学学院,东华大学,上海,201620,中国)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出基于分割的注意力熵(SAE),通过语义分割量化视觉注意力不确定性,设计可靠性评分和注意力调整方法,有效缓解大视觉-语言模型中的对象幻觉问题。

Comments Accepted to ACM Multimedia 2026 (MM '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14572 2026-08-27 cs.IR cs.AI cs.CL cs.MA 版本更新 81%

Corpus2Skill: Distilling Enterprise Knowledge into Navigable Agent Skills for QA and RAG

不要检索,导航:将企业知识转化为可导航的代理技能用于问答和RAG

Yiqun Sun, Pengfei Wei, Lawrence B. Hsieh

机构 * Magellan Technology Research Institute(马格纳技术研究 institute)

专题命中 视觉定位与Grounding :grounding(summary_cn,abstract);分类 cs.AI

AI总结 本文提出Corpus2Skill,通过将文档库转化为层次化技能目录,使LLM代理在服务时能导航该目录,提升问答质量和 grounding,但指出导航并非所有场景下的最佳替代方案。

Comments Accepted to EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24044 2026-08-27 cs.LG 版本更新 74%

JEPA-x: Cross-Predictive Physics Grounding for Forecastable Latent Dynamics

XP-JEPA:用于可预测潜在动力学的交叉预测物理基础

Kehan Wen, Ziming Li, Siyuan Luo, Fan Shi

专题命中 视觉定位与Grounding :grounding(title);分类 cs.LG

AI总结 XP-JEPA通过将视觉与物理表征交叉预测,提升了潜在动力学的可预测性,在多任务套件上降低了展开漂移并提高了控制成功率,无需特权输入即可实现更优的基于展开的控制性能。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18227 2026-08-27 cs.CV 版本更新 70%

FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry

FlowMimic:基于像素对扭曲流场的无掩码视觉编辑与生成,用于在线视频编辑数据生成及模态模仿

Dingyun Zhang, Lixue Gong, Wei Liu

专题命中 视觉定位与Grounding :VLM(abstract);MLLM(abstract);分类 cs.CV

AI总结 研究探索在单一模型中整合视频和图像模态的生成与编辑能力,开发像素对时间扭曲流场实时生成视频编辑样本,设计模态模仿损失对齐模态能力,引入相关任务及损失让模型内化基于语言的视觉编辑能力。

Comments Due to file size constraints, the figures in the arXiv file have been heavily lossy-compressed. Please visit the uncompressed file at: this https URL (https://huggingface.co/datasets/FlowMimic/Uncompressed/blob/main/main.pdf)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13207 2026-08-27 cs.CV 版本更新 70%

GTPred: Benchmarking MLLMs for Interpretable Geo-localization and Time-of-capture Prediction

GTPred:评估多模态大语言模型在可解释地理定位和拍摄时间预测中的基准测试

Jinnao Li, Tingzhu Chen, Changbo Wang

机构 * School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院) Institute of Image Communication and Information Processing, Shanghai Jiao Tong University(上海交通大学图像通信与信息处理研究院) School of Humanities, Shanghai Jiao Tong University(上海交通大学人文学院) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视觉定位与Grounding :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 GTPred是一个新的地理-时间预测基准测试,通过评估多模态大语言模型在可解释地理定位和拍摄时间预测中的表现,揭示了当前模型在世界知识和时空推理方面的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02689 2026-08-27 cs.CV cs.AI 版本更新 62%

S-EMBER: A Large-Scale Benchmark for Streaming Egocentric Memory Retrieval

S-EMBER:用于流式自我中心记忆检索的大规模基准测试

Xiaodong Wang, Xuanyi Zhao, Pedro Rodriguez, Devendra Singh Sachan, Barlas Oguz, Seungwhan Moon, Shang-Wen Li, Gargi Ghosh, Xin Dong, Wen-Tau Yih

机构 * FAIR, Meta(公平研究院,元公司) Reality Labs, Meta(现实实验室,元公司)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 研究针对可穿戴设备连续第一人称记录下AI助手的情景记忆问题,引入S-EMBER基准测试,通过视频及问答对模拟真实交互,发现前沿模型存在定位矛盾,为可穿戴AI代理情景记忆发展奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20754 2026-08-27 cs.CV 版本更新 57%

SPARK-SAM: Learning How to Prompt and Respond for Infrared Small Target Segmentation

SPARK-SAM:面向红外小目标分割SAM的、基于响应知识的自提示适配

Aji Mao, Zhenming Peng, Bailin Mu, Tian Pu

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 针对SAM直接迁移至红外小目标分割存在的提示-响应不匹配问题,提出SPARK-SAM方法,仅增0.726M参数即实现高IoU,在两个基准上排名第一。

Comments 9 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26604 2026-08-27 cs.GT cs.DC cs.NI econ.TH 版本更新 50%

Credibility Trilemma in Polymatroidal Service Markets

多拟阵服务市场中的可信度三难困境

Lauri Lovén, Sujit Gujar, Kalle Timperi, Hassan Mehmood, Praveen Kumar Donta, Sasu Tarkoma, Schahram Dustdar

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文研究多拟阵服务市场中市场运营者的策略行为,证明在非模多拟阵上不存在同时满足收益最优、激励兼容和可信的静态密封投标机制,并引入不可信成本度量该困境的福利损失。

Comments 60 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 文档图表理解 2 篇

2605.18359 2026-08-27 cs.CV 版本更新 57%

RAVE: Re-Allocating Visual Attention in Large Multimodal Models

RAVE: 重新分配大型多模态模型中的视觉注意力

Xi Leng, Xinhong Ma, Ziqiang Dong, Feng Zhang, Xiaoying Tang, Yang Yang, Guanjun Jiang

机构 * Qwen Business Unit of Alibaba(阿里巴巴文勤业务部) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Beijing Institute of Technology(北京理工大学)

专题命中 文档图表理解 :grounding(abstract);分类 cs.CV

AI总结 针对大型多模态模型中标准注意力机制存在的跨模态误分配和视觉内不平衡问题,提出轻量级成对门控机制RAVE,通过学习查询-键偏置重新分配视觉注意力,在多个多模态基准上平均提升3个百分点,尤其对感知密集型任务效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10918 2026-08-27 cs.AI 版本更新 57%

CSPO: Alleviating Reward Ambiguity for Structured Table-to-LaTeX Generation

CSPO:缓解结构化表格到LaTeX生成中的奖励模糊性

Yunfan Yang, Cuiling Lan, Jitao Sang, Yan Lu

机构 * Beijing Jiaotong University(北京交通大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出CSPO框架,通过分离LaTeX表格组件的优化,缓解奖励模糊性,提升结构化生成的可靠性。

Comments Accepted by ACL2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏

5. GUI与屏幕智能体 1 篇

2603.00188 2026-08-27 cs.CV cs.AI cs.LG 版本更新 67%

ST-Lite: Training-Free KV Cache Compression with Spatio-Trajectory Guidance for Long-Horizon GUI Agents

通过无训练KV缓存压缩实现高效的长周期GUI代理

Bowen Zhou, Zhou Xu, Wanli Li, Jingyu Xiao, Pingan Gan, Haoqian Wang

机构 * Tsinghua University(清华大学) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 ST-Lite通过无训练的KV缓存压缩方法,提升GUI代理的解码效率,实现2.45倍加速并保持性能优势。

Comments Accepted to Findings of EMNLP 2026. Camera-ready version. 37 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 幻觉与鲁棒性 4 篇

2608.16081 2026-08-27 cs.CV 版本更新 85%

SafeGesture: Evaluating Fine-Grained Hand Gesture Understanding in Vision-Language Models through Scenario-Conditioned Safety Interpretation

SafeGesture:通过场景条件安全解释评估视觉语言模型的细粒度手势理解能力

Taegang Kim, Saleh Afroogh, Junfeng Jiao

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Urban Information Lab, The University of Texas at Austin(德克萨斯大学奥斯汀分校城市信息实验室)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);LLaVA(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出SafeGesture基准,评估5款视觉语言模型的细粒度手势安全理解能力,发现模型存在感知与推理脱节,瓶颈为场景条件安全推理而非手势识别。

Comments 14 pages, 22 tables, 2 figures. Code and benchmark resources available at this https URL (https://github.com/The-Responsible-AI-Initiative/SafeGesture)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22829 2026-08-27 cs.CV 版本更新 79%

Lost in Motion: Vision Language Models Fail the Dynamic Gauges Test

迷失在振动中:视觉语言模型在动态刻度测试中失败

Tairan Fu, Francisco Javier Santos-Martín, Javier Conde, Elena Merino-Gómez, Pedro Reviriego

专题命中 幻觉与鲁棒性 :vision language model(title);vision-language model(abstract);分类 cs.CV

AI总结 本文评估了最新视觉语言模型在动态刻度测试中的表现,发现其在分析高频事件和指针振动方面存在不足,无法满足计量学和不确定性量化的要求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22338 2026-08-27 cs.RO cs.AI cs.LG 版本更新 62%

RoboMME-Interference: Benchmarking Robot Memory Under Interference

干扰下的机器人记忆基准测试

Soumil Rathi

机构 * Independent Researcher(独立研究员)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.AI、cs.LG

AI总结 提出RoboMME-Interference基准,通过跨会话干扰评估机器人长期记忆能力,发现现有系统在干扰下性能显著下降。

Comments 9 pages, 5 figures. Updated results; added subgoal-memory systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04235 2026-08-27 cs.ET 版本更新 50%

Scale-CDA: A Scalable Aftermarket Platform to Democratize Cooperative Driving Automation in Production Cars

Scale-CDA:一款用于量产车的、可扩展的原型,旨在普及AI辅助的协同驾驶自动化(CDA)

Hao Zhou, Shengming Yuan, Yuhang Wang, Alina Hagen, Haibin Wen

专题命中 幻觉与鲁棒性 :MLLM(abstract_cn)

AI总结 本研究提出Scale-CDA这一开源工具链,基于OpenDBC与Openpilot构建,成本低于1000美元,可实现AI辅助CDA的即插即用改装,通过多车辆测试验证了其低时延与数据隐私保护能力,为普及协同自动驾驶提供了实用方案。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. VLM训练与架构 5 篇

2607.26326 2026-08-27 cs.CV 版本更新 83%

Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models

视觉还是认知?多模态大语言模型的视觉上下文敏感性

Jiaang Li, Chengzu Li, Zhaochong An, Yifei Yuan, Xi Liu, Serge Belongie, Vésteinn Snæbjarnarson

机构 * University of Copenhagen(哥本哈根大学) University of Cambridge(剑桥大学) ETH Zürich(苏黎世联邦理工学院) Clemson University(克莱姆森大学)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.CV

AI总结 该研究探究多模态大语言模型在视觉证据与先验冲突任务上的失效原因,引入WhatIfVis基准,发现其能编码视觉证据但难以控制对其的依赖,监督微调等方法可提升可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09201 2026-08-27 cs.CR cs.AI cs.CV 版本更新 81%

Learning to Detect Unseen Jailbreak Attacks in Large Vision-Language Models

学习检测未见过的大型视觉-语言模型中的对抗攻击

Shuang Liang, Zhihao Xu, Jiaqi Weng, Jialing Tao, Hui Xue, Xiting Wang

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 LoD通过学习模型内部激活生成安全表示,实现对未见过的对抗攻击的高效检测,提升检测性能和效率。

Comments 17 pages; Previously this version appeared as arXiv:2510.15430 (https://arxiv.org/abs/2510.15430) which was submitted as a new work by accident

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01990 2026-08-27 cs.LG cs.AI 版本更新 73%

SAME: Stabilized Mixture-of-Experts for Multimodal Continual Instruction Tuning

SAME: 用于多模态持续指令调优的稳定混合专家模型

Zhen-Hao Xie, Jun-Tao Tang, Yu-Cheng Shi, Han-Jia Ye, De-Chuan Zhan, Da-Wei Zhou

机构 * State Key Laboratory of Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室) School of Artificial Intelligence, Nanjing University, China(南京大学人工智能学院)

专题命中 VLM训练与架构 :grounding(abstract);multimodal large language model(abstract);分类 cs.AI、cs.LG

AI总结 针对多模态持续指令调优中专家路由漂移和专家漂移问题,提出稳定混合专家模型(SAME),通过正交子空间分解路由动态和曲率感知缩放更新专家,实现无重放的状态最优性能。

Comments Accepted to ICML 2026. Code is available at this https URL (https://github.com/LAMDA-CL/Prism)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15062 2026-08-27 cs.CL cs.LG 版本更新 57%

Gated Recurrent Transformers: Expressive Depth through Recurrent Modulation

RecurrentGPT:通过Transformer中的循环调制实现表达性深度

Amr Hegazy, Amr Alanwar, Mostafa Elhoushi

机构 * The German University in Cairo(开罗德国大学) Technical University of Munich(慕尼黑工业大学) Cerebras Systems Inc.(赛布拉斯系统公司)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.LG

AI总结 本文提出RecurrentGPT,通过循环调制解决Transformer语言模型表达性与内存效率的矛盾,在多约束下优于基线模型,实现参数与内存的高效利用。

详情

展开后加载摘要…

URL PDF HTML 收藏