arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-09-01 至 2026-09-01 共收录 39 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 39 篇

2505.03654 2026-09-01 cs.CV cs.AI 版本更新 92%

ReGraP-LLaVA: Reasoning enabled Graph-based Personalized Large Language and Vision Assistant

ReGraP-LLaVA:支持推理的基于图的个性化多模态大语言与视觉助手

Yifan Xiang, Zhenxi Zhang, Bin Li, Yixuan Weng, Bo Gao, Shoujun Zhou, Yangfan He, Yilin Yuan, Keqin Li

机构 * Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所) School of Engineering, Westlake University(西湖大学工程学院) University of Minnesota – Twin Cities(明尼苏达大学双城分校) University of Toronto(多伦多大学)

专题命中 VLM训练与架构 :LLaVA(title,title_cn);MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 针对现有个性化多模态大语言模型忽略概念关联的局限,本文构建ReGraP数据集与基准,提出ReGraP-LLaVA模型,实现个性化关系推理,在对比基准中性能最优。

Comments accepted in EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30352 2026-09-01 cs.AI cs.HC 新提交 91%

Co-Annotator: Expert-Distilled ViT and VLM for Visual and Documentation Guidance in Age-Related Macular Degeneration

Co-Annotator:用于年龄相关性黄斑变性视觉与文档指导的专家蒸馏ViT及VLM

Ziheng "Leo" Li, Benjamin Freeman, Akshay Raman, Kavin Aravindhan Rajkumar, Xinxin Fang, Rishabh Srivastava, Steven Feiner, Kaveri A. Thakoor

机构 * Columbia University(哥伦比亚大学)

专题命中 VLM训练与架构 :VLM(title,title_cn);vision-language model(abstract);分类 cs.AI

AI总结 本研究提出Co-Annotator,将专家注视与口述提炼为AOI指导的ViT和生物标志物预填充的VLM,在AMD诊断中联合应用可显著提升效率且不降低准确率。

Comments 23 pages, 11 figures. To appear in UIST '26: Proceedings of the 39th Annual ACM Symposium on User Interface Software and Technology, November 02-05, 2026, Detroit, MI, USA. DOI: 10.1145/3830398.3830722

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21762 2026-09-01 cs.CV cs.CL 版本更新 91%

Learning to Look Again: Loss-Gap Supervision for Free-form Crop Routing in Vision-Language Models

重新学习观察:面向视觉语言模型的自由格式裁剪重路由的损失间隙监督

Jinchang Zhu, Rong Fu, Yi Ding, Chenghao Wu, Ying Liu, Menglin Yang

专题命中 VLM训练与架构 :LLaVA(summary_cn,abstract);vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出GapSight框架,利用损失间隙监督让VLMs选择性重读图像局部区域,在多个基准测试中显著提升了LLaVA、InternVL2.5等VLMs的细节类任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30428 2026-09-01 cs.CL cs.AI cs.CV cs.LG 新提交 90%

Lies We Can See: Joint Verbal and Non-Verbal Deception by VLM Agents in Embodied Social Interactions

我们能看见的谎言:具身社交交互中VLM智能体的联合言语与非言语欺骗

Jaewoo Ahn, Junseo Kim, Hyunseo Kim, Heeseung Yun, Jaehyeon Son, Zsolt Kira, Gunhee Kim

机构 * Seoul National University(首尔大学) Inha University(仁荷大学) KAIST(韩国科学技术院) Georgia Institute of Technology(佐治亚理工学院)

专题命中 VLM训练与架构 :VLM(title,title_cn);分类 cs.CV、cs.AI、cs.LG

AI总结 本研究构建了3D多模态社交推理游戏测试平台MineAmongUs,提出可配置VLM智能体控制程序ARIA,发现非言语通道是VLM智能体欺骗取胜的更关键因素,为具身VLM智能体对齐研究开辟新方向。

Comments Workshop on Agent Behavior (WAB) at COLM 2026. Project page: https://junseokim0103.github.io/Lies-We-Can-See/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25493 2026-09-01 cs.CV 版本更新 90%

SMART: MLLM-guided Temporal Alignment for Unifying Sign Language Recognition and Spotting

SMART:用于统一手语识别与定位的多模态大语言模型(MLLM)引导的时间对齐框架

Eunjee Choi, JungHoon Sung, Seongwhan Cho, Chu Xin, Younggeun Choi

机构 * Dankook University(檀国大学)

专题命中 VLM训练与架构 :MLLM(title,title_cn);分类 cs.CV

AI总结 本研究提出 MLLM 引导的 SMART 框架,整合多尺度时间适配器与 CSFormer 模块,在四个手语基准数据集上实现了手语识别与定位任务的性能提升。

Comments 19 pages, Accepted 37th British Machine Vision Conference, BMVC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16990 2026-09-01 cs.CV 版本更新 89%

Dimple: Discrete Diffusion Multimodal Large Language Model with Parallel Decoding

Dimple:采用并行解码的离散扩散多模态大语言模型

Runpeng Yu, Xinyin Ma, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学)

专题命中 VLM训练与架构 :LLaVA(summary_cn,abstract);multimodal large language model(title,abstract);分类 cs.CV

AI总结 本研究提出首个离散扩散多模态大语言模型Dimple,采用自回归与扩散结合的训练范式,性能优于LLaVA-NEXT 3.9%,通过置信解码提升推理效率,还探索了结构先验的响应控制能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28691 2026-09-01 cs.CV cs.AI 新提交 87%

Defending Wearable VLMs Against Private Attribute Inference

防御可穿戴视觉语言模型(VLM)抵御私有属性推断

Zhimin Li, Pan Wang, Jingxian Chen, Yuantao Tang, Anthony Chen, Qian Lou, Jingtong Hu

机构 * Swanson School of Engineering, University of Pittsburgh(匹兹堡大学斯旺森工程学院) North Allegheny Senior High(北阿勒格尼高级中学) College of Engineering, Michigan State University(密歇根州立大学工程学院) University of Central Florida(中佛罗里达大学)

专题命中 VLM训练与架构 :VLM(title_cn,summary_cn);分类 cs.CV、cs.AI

AI总结 针对可穿戴VLM的视觉令牌可能泄露私有属性的问题,提出TGAP方法,可大幅降低隐私推断准确率,同时维持较高效用,为可穿戴多模态AI的隐私保护提供可行路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29996 2026-09-01 cs.CV cs.AI cs.LG 新提交 87%

Partition-Aware Unlearning for Removing Spurious Correlations in Large Vision-Language Models

用于移除大型视觉语言模型中虚假关联的感知分区式遗忘

Aditi Sarker, Nazreen Shah, Rafi Ibn Sultan, Rhongho Jang, Dongxiao Zhu, Prashant Khanduri

机构 * Wayne State University(韦恩州立大学) IIIT Delhi(德里印度信息技术学院) Institute for AI and Data Science (AIDaS), Wayne State University(韦恩州立大学人工智能与数据科学研究所)

专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract,abstract_cn);分类 cs.CV、cs.AI、cs.LG

AI总结 本研究提出PURGE框架,通过结构化数据集构建和感知分区式遗忘,减少大型视觉语言模型的虚假关联诱导错误,同时保持或提升整体性能。

Comments 35 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29802 2026-09-01 cs.CV 新提交 85%

Foundation and Multimodal Large Language Models for Face Presentation and Morph Attack Detection

用于人脸呈现与变形攻击检测的基础模型及多模态大语言模型

Hatef Otroshi Shahreza, Asif Hussain Khan, Peter Lorenz, Alain Komaty, Sébastien Marcel

机构 * Idiap Research Institute(Idiap研究所) Université de Lausanne(洛桑大学)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文研究通用基础模型和多模态大语言模型是否包含人脸呈现与变形攻击相关信息,通过五种方法在8个公开数据集上测试,发现微调后模型跨数据集检测性能达SOTA,将开源代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29663 2026-09-01 cs.CV 新提交 85%

PhysVR: Vision-Language Model Guided Interference-aware Temporal Feature Refinement for Remote Physiological Measurement

PhysVR:面向远程生理测量的、由视觉语言模型引导的感知干扰的时间特征优化框架

Zixu Li, Jianjun Qian, Hang Shao, Daoheng Li, Lei Luo, Jian Yang

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) College of Computer Science and Technology, Qingdao University(青岛大学计算机科学技术学院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV

AI总结 该研究针对远程生理测量中rPPG易受干扰的问题,提出PhysVR框架,通过视觉语言模型引导优化时间特征,在5个公共基准上表现优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29395 2026-09-01 cs.CV 新提交 85%

GATE: Reliability-Gated Gaussian Evidence Fusion for Training-Free Test-Time Adaptation of Vision-Language Models

GATE:用于视觉语言模型无训练测试时自适应的可靠性门控高斯证据融合

Pedram MohajerAnsari, Amir Salarpour, Run Wang, Mert D. Pesé

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV

AI总结 本研究提出无训练的两阶段直推式TTA框架GATE,通过可靠性门控融合文本与图像高斯证据,在多数据集及模型上显著提升视觉语言模型的零样本测试时自适应性能。

Comments Accepted to the British Machine Vision Conference (BMVC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30510 2026-09-01 cs.CV cs.AI cs.CL cs.DL 新提交 85%

Lot Machine: Multimodal Lot Extraction from Auction Catalogs

拍品提取模型:从拍卖目录中进行多模态拍品提取

Mathias Zinnen, Alisha Mund, Sabine Lang, Lukas Hüttner, Thomas Gorges, Vincent Christlein

机构 * FAU Erlangen(埃尔朗根-纽伦堡大学) Pattern Recognition Lab(模式识别实验室)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 该研究提出基于视觉语言模型(VLM)的流水线,从历史拍卖目录中自动提取结构化拍品级元数据,对比不同部署模式的模型性能,为文化遗产机构提供可行的自动化分析方案。

Comments Accepted at the VISART Workshop (Computer Vision for Art Analysis), ECCV 2026. 19 pages, 6 figures, 5 tables. Supplementary material included as an appendix. Code, benchmark data, and prompt templates: https://github.com/mathiaszinnen/auction-lot-extraction

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30836 2026-09-01 eess.SP 新提交 85%

Channel Gains to Captions: Task-Unified Multi-Level RF Sensing with Vision-Language Models

信道增益到描述:面向任务统一的多级射频感知与视觉语言模型

Tianyu Hu, Zhiren Gong, Haowei Cui, Shuai Wang, Samson Lasaulce, Lingxiang Li, Wassim Hamidouche, Zhi Chen, Merouane Debbah

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn)

AI总结 本文提出基于VLMs的任务统一多级RF感知框架,通过生成式方案将mmWave/THz信道增益映射为环境语义描述,引入LoRA专家实现级别适配,仿真显示其性能优于基线且适配性更广。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18734 2026-09-01 cs.CV 版本更新 84%

CL4D: Contrastive Language-4D Pretraining for Vision-Language Reasoning in Dynamic Scenes

CL4D:用于动态场景视觉-语言推理的对比语言-4D预训练

Kumal Hewagamage, Isuranga Senavirathne, Sasika Amarasinghe, Hasitha Gallella, Dulanga Weerakoon, Vigneshwaran Subbaraju, Ranga Rodrigo

机构 * University of Moratuwa(莫拉图瓦大学) Singapore-MIT Alliance for Research & Technology (SMART) Centre(新加坡-麻省理工研究与技术联盟(SMART)中心) Agency for Science, Technology and Research (A*STAR)(新加坡科学、技术与研究局(A*STAR))

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV

AI总结 本研究提出CL4D(首个4D视觉编码器)及基于其的4DVLM,在自建DynAction4D数据集上训练,CL4D性能较现有方法提升约16.75%,4DVLM优于Gemini、GPT-5等前沿视频VLM。

Comments Accepted at the 19th European Conference on Computer Vision (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31556 2026-09-01 cs.CV cs.AI cs.CL cs.CY cs.HC 版本更新 84%

Vision-Language Models Suppress Female Representations Under Ambiguous Input

视觉-语言模型在模糊输入下抑制女性表征

Arnau Marin-Llobet, Simon Henniger, Mahzarin R. Banaji

机构 * School of Engineering and Applied Sciences(工程与应用科学系) Department of Psychology(心理学系)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 本研究通过引入零样本度量LALS,发现视觉-语言模型在模糊输入下内部编码与输出存在系统性解耦,女性信号在生成前被抑制,揭示了模型对性别偏见的内部处理机制。

Comments Accepted at EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29681 2026-09-01 cs.CY 新提交 83%

MMMMM: A Unified Taxonomy for Investigating the Mechanisms of Multilingual MultiModal Misinformation

MMMMM:用于研究多语言多模态虚假信息机制的统一分类体系

Nadav Borenstein, Greta Warren, Desmond Elliott, Isabelle Augenstein

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract)

AI总结 该研究针对多模态虚假信息研究的分类体系缺失与自动化不足问题,构建了7种语言的数据集与多模态虚假信息分类体系,结合VLM实现自动化标注,为针对性检测提供了指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26956 2026-09-01 cs.CV 版本更新 81%

RubricRM: Generative Reward Modeling via Dynamic Rubrics for Image Generation and Editing

RubricRM:基于动态评分规则的生成式奖励模型,用于图像生成与编辑

Zijian Kan, Wei Wang, Long Luo, Bing Zhao, Xuan Ren, Weixu Qiao, Wenbo Li, Hu Wei, Lin Qu

机构 * Peking University(北京大学) Alibaba Group(阿里巴巴集团) Alibaba DAMO Academy(阿里巴巴达摩院)

专题命中 VLM训练与架构 :MLLM(summary_cn,abstract);分类 cs.CV

AI总结 该研究提出RubricRM框架,为文本到图像生成和图像编辑训练专用模型,其性能优于现有专用奖励模型,且与强专有MLLM评估器竞争力相当,可用于图像生成与编辑的奖励建模。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30530 2026-09-01 cs.CL cs.SE 新提交 80%

WebWorld: The Browser as a World Model for Self-Improving Web Code

WebWorld:将浏览器作为自改进网页代码的世界模型

Jiajun Wu, Jian Yang, Yaxin Du, Wei Zhang, Haowen Wang, Junhang Cheng, Yuxuan Zhang, Tuney Zheng, Xianglong Liu, Ming Zhou

机构 * Beihang University(北京航空航天大学) Shanghai Jiao Tong University(上海交通大学) IQuest Research(IQuest研究院) Langboat

专题命中 VLM训练与架构 :VLM(summary_cn,abstract)

AI总结 本研究提出WebWorld,将浏览器作为VLM无法欺骗的网页代码世界模型,通过浏览器签发合格证书的机制实现VLM自主交互与监督,使WebWorld-27B在两个基准任务上实现显著性能提升,达到强前沿系统水平。

Comments EMNLP Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29313 2026-09-01 cs.CV cs.AI 新提交 79%

Hyper3-CLIP: Hierarchy-Conditioned Hyperbolic Vision-Language Training

Hyper3-CLIP:层级条件双曲视觉-语言训练

Matin Mahmood, Antonio Rueda-Toicen, Mohamed ElBassat, Seifeldin Elkerdany, Weixing Wang, Gerard de Melo

机构 * hyper 3 labs(超3实验室) Hasso Plattner Institute(哈索·普拉特纳研究所) University of Potsdam(波茨坦大学) Faculty of Computers and Data Science, Alexandria University(亚历山大大学计算机与数据科学学院) Faculty of Computer Science and Engineering, Alamein International University(阿拉曼国际大学计算机科学与工程学院)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 Hyper3-CLIP结合层级条件与双曲几何,通过文本构建多粒度查询层级训练视觉-语言模型,提升图像-文本检索与多标签分类性能,在层级指标上保持竞争力。

Comments 16 pages, 2 figures, ECCV 2026 Beyond Euclidean Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28609 2026-09-01 cs.CL cs.AI cs.CV 新提交 79%

Parametric Multimodal User Memory: Storing What Captions Cannot Carry

参数化多模态用户记忆:存储字幕无法承载的内容

Bojie Li, Noah Shi

机构 * Pine AI(派恩人工智能) University of Washington(华盛顿大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 该研究提出参数化多模态用户记忆,结合视觉语言模型与专用编码器,解决传统文本用户记忆丢失感知信息的问题,在PerceptMem数据集上验证了其有效性与可推广性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18586 2026-09-01 cs.CV cs.AI 版本更新 79%

APT: Atomic Physical Transitions for Causal Video-Language Understanding

APT: 用于因果视频语言理解的原子物理转变

Shang Wu, Haoran Lu, Songling Liu, Chenwei Xu, Lie Lu, Pranav Maneriker, Fan Du, Zhaoran Wang, Han Liu

机构 * Northwestern University(西北大学) Dolby Laboratories(杜比实验室)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract_cn);分类 cs.CV、cs.AI

AI总结 提出原子物理转变(APT)作为视频中因果状态变化的显式表示,并构建混合来源数据集,通过APT-Tune微调方法使VLM学习物理转变而不遗忘事件级知识。

Comments v2:Expanded the experiment section with more baselines. Expand supplementary materials and LLM usage--corrected some typographical errors, and corrected author-affiliation information that was inaccurate in the previous version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12824 2026-09-01 cs.IR cs.CV cs.LG 版本更新 79%

NanoVDR: Distilling a 2B Vision-Language Retriever into a 70M Text-Only Encoder for Visual Document Retrieval

NanoVDR:将20亿参数的视觉语言检索器蒸馏为7000万参数的纯文本编码器用于视觉文档检索

Zhuchenyang Liu, Yao Zhang, Yu Xiao

机构 * Aalto University(阿alto大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 利用查询-文档不对称性,通过蒸馏将20亿参数的视觉语言模型教师蒸馏为7000万参数的纯文本学生编码器,采用点态余弦对齐目标,实现视觉文档检索的高效推理。

Comments Accepted to EMNLP 2026 (Main Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29610 2026-09-01 cs.CL 新提交 78%

Beyond Surface Alignment: Grounding the Dynamics of Situational Understanding and Generative Control in LLMs

超越表面对齐:基于情境理解与生成控制的动态机制研究

Chenghao Yang

专题命中 VLM训练与架构 :grounding(title,abstract)

AI总结 本研究针对LLM表面对齐导致的情境脆弱问题,提出根基对齐框架,通过多维度评估缺陷并开发动态控制方法,实现锚定上下文与生成的智能体。

Comments PhD Thesis submitted to UChicago (https://knowledge.uchicago.edu/records/5jrnc-nvp13). Update Branching Factor, AI Realtor, and BACo to the latest versions

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30997 2026-09-01 cs.CV 新提交 77%

Multi-View Reflective Surface Inspection via Semantic-Saliency Cross-Verification

基于语义-显著性交叉验证的多视角反射表面检测

Van-Giang Nguyen, Thanh-Tuan Tran, Xuan-Hieu Phan, Xiem HoangVan

机构 * University of Engineering and Technology, Vietnam National University(越南国家大学工程技术大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 该研究针对反射表面检测的视角局限问题,提出多视角检测框架,通过语义-显著性交叉验证提升缺陷检测的AP₅₀与跨视角证据召回率。

Comments Submitted to RIVF 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30209 2026-09-01 cs.CV 新提交 77%

DICS: Exploring Data Intrinsic Consistency for Visual Instruction Selection

DICS:探索数据内在一致性用于视觉指令选择

Yuyang Hong, Jinhui Guo, Jiaqi Gu, Lubin Fan, Ruixiang Wang, Kun Ding, Yue Wu, Shiming Xiang, Jieping Ye

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Alibaba Token Hub, Alibaba Group(阿里巴巴集团)

专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 提出基于数据内在一致性(DIC)的自适应视觉指令选择方法DICS,仅用25%数据就超越现有最优方法,还构建600万样本语料库,用不足25%训练数据达到InternVL3-8B-Instruct的94.52%性能

Comments Accepted by EMNLP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28696 2026-09-01 cs.CV 新提交 77%

Instruction Distillation: Text Instructions as Visual Examples

指令蒸馏:将文本指令作为视觉示例

Hardik Jindal, Soumyabrata Pal, Sayak Ray Chowdhury

机构 * IIT Kanpur(印度理工学院坎普尔分校) Adobe Research(奥多比研究院)

专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 该研究针对视觉上下文学习的高成本问题,提出指令蒸馏方法,为每个训练图像生成结构化指令,在细粒度视觉分类任务中提升性能并降低推理成本,且视觉与文本ICL信号互补。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30968 2026-09-01 cs.CL cs.AI 新提交 70%

CogEvol: Towards Efficient and Reliable Learning Environment Generation

CogEvol:面向高效且可靠的学习环境生成

Shangqing Tu, Daniel Zhang-Li, Yucheng Wang, Shiyu Gan, Yanpeng Wang, Huiqiang Rong, Mofei Chen, Shen Yang, Yini Chen, Yinuo Duan, Haoxuan Li, Binglin Liu, Ye He, Danqi Zheng, Zhanxin Hao, Yuxuan Wu, Mengting Tao, Yuqiu Liu, Jifan Yu, Juanzi Li, Bin Xu, Lei Hou, Huiqin Liu, Yu Zhang

机构 * CogEvol Inc.(CogEvol公司) Tsinghua University(清华大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.AI

AI总结 本研究提出专门用于学习环境生成的CogEvol模型,可将课程简介一次性转化为学习产物,在22万条生产请求中表现高效可靠,参数规模远小于旗舰编码模型,还可在国产昇腾加速器运行,降低AI原生教育单位成本。

Comments 29 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28726 2026-09-01 cs.AI 新提交 70%

Pro-Router: Token-Aware Progressive Model Routing with Adaptive Edge-Cloud Collaboration for Efficient Multimodal LLM Inference

Pro-Router:面向高效多模态大语言模型推理的、具备自适应边云协作的令牌感知渐进式模型路由方法

Xinyuan Gui, Shaowen Wang, Sheng Sun, Zijian Wang, Zishu Yu, Zheming Yang

机构 * Anyscale(安尼斯科尔公司) Mississippi State University(密西西比州立大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Institute of AI for Industries, Chinese Academy of Sciences(中国科学院产业人工智能研究院)

专题命中 VLM训练与架构 :multimodal large language model(abstract,abstract_cn);分类 cs.AI

AI总结 针对多模态大语言模型推理开销大的问题,提出具备自适应边云协作的Pro-Router方法,通过两阶段渐进式决策机制提升路由准确率与速度,端到端吞吐量显著优于现有方案。

Comments 9 pages, 7 figures, 2 tables. Code: https://github.com/xinyuangui2/pro-router

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26495 2026-09-01 cs.CV 版本更新 70%

Video-FLAIR: Not Whether to Reason, But How

Video-FLAIR:不是是否推理,而是如何推理

Yogesh Kulkarni, Pooyan Fazli

机构 * Arizona State University(亚利桑那州立大学)

专题命中 VLM训练与架构 :grounding(abstract,abstract_cn);分类 cs.CV

AI总结 该研究提出 Video-FLAIR 训练框架,通过强化学习让模型为多模态查询选择适配的推理模式,在多个视频多模态基准上提升准确率并降低 token 用量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30263 2026-09-01 cs.CV cs.AI 新提交 62%

Centering before Pruning: Lightweight Geometry Correction for Diversity-Based Visual Token Pruning in LVLMs

修剪前的中心化:用于多模态大语言模型(LVLMs)中基于多样性的视觉标记修剪的轻量级几何校正

Shunjie Wen, Jaeyeon Lee, Dong-Wan Choi

机构 * Inha University(仁荷大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 针对LVLMs视觉标记序列冗余导致推理成本高的问题,提出Cen-Prune方法,通过保留原始空间独特性并结合中心化余弦相似度,提升了现有多样性视觉标记修剪器的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏