arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5058 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5058 篇

2605.03219 2026-05-29 physics.bio-ph q-bio.TO 50%

The Incommensurability Principle in Biological Transport

生物输运中的不可公度性原理

Riccardo Marchesi

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 本文提出一个网络级最小最大原理,证明哺乳动物血管树的分支指数普适性源于结构异质性和拓扑刚性,并通过粘性-惯性能量划分的双阈值框架解释了其发育稳定性。

Comments 46 pages, 2 figures. Paper IV in a series on branching transport networks, Supplemental Material available; see also arXiv:2603.13687 (Paper I), arXiv:2603.14691 (Paper II), and arXiv:2604.10476 (Paper III). Zenodo: https://doi.org/10.5281/zenodo.20030962

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03430 2026-05-29 cs.MA cs.NI 50%

Scaling Multi-agent Systems: A Smart Middleware for Improving Agent Interactions

扩展多智能体系统:一种用于改善智能体交互的智能中间件

Charles Fleming, Guillaume De Saint Marc, Ramana Kompella, Peter Bosch, Vijoy Pandey

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 提出认知织物节点(CFN)中间件,通过强化学习和优化算法动态管理智能体间通信,在HotPotQA和MuSiQue数据集上性能提升超过10%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25120 2026-05-20 cs.DC 50%

DFLOP: A Data-driven Framework for Multimodal LLM Training Pipeline Optimization

DFLOP: 一种基于数据的多模态大语言模型训练流水线优化框架

Hyeonjun An, Sihyun Kim, Chaerim Lim, Hyunjoon Kim, Rathijit Sen, Sangmin Jung, Hyeonsoo Lee, Dongwook Kim, Takki Yu, Jinkyu Jeong, Youngsok Kim, Kwanghyun Park

专题命中 VLM训练与架构 :multimodal large language model(abstract)

AI总结 本文提出DFLOP框架,通过数据驱动的方法优化多模态大语言模型的训练流水线,提升GPU利用率和训练效率,实验证明其比现有框架快3.6倍。

Comments Accepted to Proceedings of the ACM on Management of Data (SIGMOD 2026)

Journal ref Proc. ACM Manag. Data 4, 3, Article 160 (June 2026), 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17152 2026-05-19 cs.CL 50%

Multilingual and Multimodal LLMs in the Wild: Building for Low-Resource Languages

多语言和多模态大语言模型在野:为低资源语言构建

Firoj Alam, Shammur Absar Chowdhury, Enamul Hoque Prince

机构 * Qatar Computing Research Institute(卡塔尔计算研究所) HBKU(哈马德大学) York University(约克大学)

专题命中 VLM训练与架构 :VLM(abstract)

AI总结 本文探讨了在有限数据和计算资源下构建多语言多模态大语言模型的方法,涵盖了低成本数据创建、三模态对齐适配器堆栈以及文化感知评估等核心技术和资源。

Comments Multimodal Foundation Models, Large Language Models, Native, Multilingual, Language Diversity, Low-resources-language

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16407 2026-05-19 cs.LO cs.CL cs.CR cs.PL 50%

Proof-Carrying Certificates for LLM Pipelines: A Trust-Boundary Architecture

为LLM流水线提供证明携带证书:一种信任边界架构

George Koomullil

机构 * Ascendr, Inc.(Ascendr公司)

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 本文提出一种验证大型语言模型周围确定性结构计算的框架,扩展了Lean 4信任边界架构至现代LLM流水线的通用接口。核心贡献包括三个证书家族和两个操作符,用于高风险部署中的专利检索、金融监管等场景。

Comments 83 pages, 1 figure, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14442 2026-05-15 cs.CY 50%

GGBound: A Genome-Grounded Agent for Microbial Life-Boundary Prediction

GGBound:一种基于基因组的微生物生命边界预测代理

Hanbo Huang, Xuan Gong, Jing Wang, Lei Bai, Xiang Xiao, Weishu Zhao, Shiyu Liang

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 本文提出GGBound代理,通过基因组条件化和工具增强的LLM,解决微生物生命边界预测问题,构建了涵盖1525种菌株的基准数据集,并通过三阶段优化流程提升预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11516 2026-05-13 cs.NI 50%

Agents Should Replace Narrow Predictive AI as the Orchestrator in 6G AI-RAN

智能体应取代窄预测AI作为6G AI-RAN的协调者

Pranshav Gajjar, Vijay K Shah

专题命中 VLM训练与架构 :multimodal large language model(abstract)

AI总结 本文主张为实现Level 5自主6G网络,AI-RAN应从碎片化的窄预测模型转向多模态大语言模型作为核心推理智能体,通过提升LLM作为认知操作系统,动态翻译人类意图并自主诊断网络异常。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09338 2026-05-12 cs.IR 50%

A General Framework for Multimodal LLM-Based Multimedia Understanding in Large-Scale Recommendation Systems

多模态大语言模型在大规模推荐系统中的通用框架

Yiming Zhu, Xu Liu, Ziyun Xu, Zheng Wu, Joena Zhang, Sirius Chen, Chenheli Hua, Silvester Yao, Qichao Que, Wentao Shi, Junfeng Pan, Linhong Zhu

专题命中 VLM训练与架构 :multimodal large language model(abstract)

AI总结 本文提出一个通用框架,利用多模态大语言模型提升多媒体内容理解,通过三部分架构实现内容解析、特征提取和系统集成,实验证明在推荐系统中提升了AUC和在线指标。

Comments Accepted by SIGIR 2026 short

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01008 2026-05-12 cs.CL 50%

MARS-SQL: A multi-agent reinforcement learning framework for Text-to-SQL

MARS-SQL: 一种用于文本到SQL的多智能体强化学习框架

Haolin Yang, Jipeng Zhang, Zhitao He, Alexander Zhou, Yi R. Fung

机构 * Hong Kong University of Science and Technology(香港理工大学) Hong Kong Polytechnic University(香港理工大学)

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 MARS-SQL通过多智能体框架解决文本到SQL任务中的逻辑与模式对齐问题,采用生成代理与验证机制提升交互学习效果,实现77.84%和89.75%的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08924 2026-05-12 cs.CE 50%

PPI2Text: Captioning Protein-Protein Interactions with Coordinate-Aligned Pair-Map Decoding

PPI2Text:基于坐标对齐的配对映射解码进行蛋白质-蛋白质相互作用描述

Xiao Fei, Sarah Almeida Carneiro, Yang Zhang, Lawrence P. Petalidis, Achilleas Tsortos, Costas Bouyioukos, Michalis Vazirgiannis

专题命中 VLM训练与架构 :multimodal large language model(abstract)

AI总结 PPI2Text通过自由文本描述蛋白质-蛋白质相互作用,利用ESM3编码器和Qwen3解码器生成更丰富的表达,提升可解释性和文献整合能力,同时引入PaCo-RoPE位置编码和PPI2Text-Dataset数据集,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08847 2026-05-12 cs.CL 50%

EmoS: A High-Fidelity Multimodal Benchmark for Fine-grained Streaming Emotional Understanding

EmoS:一种高保真多模态基准,用于细粒度流式情感理解

Pengze Guo, Jingxi Liang, Zhiwen Xie, Qifeng Wang, Derek F. Wong

机构 * NLP(自然语言处理) CT Lab, Department of Computer and Information Science, University of Macau(计算机与信息科学学院,澳门大学CT实验室) School of Computer Science, Central China Normal University(Central China Normal University计算机科学学院)

专题命中 VLM训练与架构 :multimodal large language model(abstract)

AI总结 本文提出EmoS基准,通过严格过滤静态片段与动态流式独白子集结合,解决现有数据集在生态效度和噪声方面的不足,提升多模态大语言模型在情感识别和共情模型训练中的性能。

Comments acl - 2026 main accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08725 2026-05-12 cs.AR cs.PF 50%

Single 32-bit Sub-Channel DDR5 DIMMs: Architecture, Performance Bounds, and Standardisation

单32位子通道DDR5 DIMM:架构、性能界限与标准化

Chih-Hua Ke

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 本文探讨了DDR5内存子通道架构,分析了单子通道DIMM在性能和标准化方面的挑战与贡献。

Comments 10 pages, 1 figure, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09933 2026-05-12 cs.IR 50%

A Voronoi Cell Formulation for Principled Token Pruning in Late-Interaction Retrieval Models

基于Voronoi单元的原理化令牌修剪方法:用于晚期交互检索模型

Yash Kankanampati, Yuxuan Zong, Nadi Tomeh, Benjamin Piwowarski, Joseph Le Roux

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 本文提出基于超空间几何的Voronoi单元方法,用于原理化修剪晚期交互检索模型中的令牌嵌入,通过保留检索质量的同时减少索引存储开销。

Comments Accepted at SIGIR 2026 Full Paper Track; 11 pages; 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12286 2026-05-12 q-bio.GN cs.CL 50%

Mind the Gap No More: Achieving Zero-Gap Multimodal Integration via One Tokenizer

不再有间隙:通过一个分词器实现零间隙多模态整合

Yanan Li, Christina Yi Jin, Yuan Jin, Manli Luo, Tie Xu, Shuai Jiao, Wei He, Qing Zhang

机构 * Research Center for Frontier Fundamental Studies, Zhejiang Lab(前沿基础研究研究中心,浙江实验室) Research Center for Scientific Data Hub, Zhejiang Lab(科学数据枢纽研究中心,浙江实验室)

专题命中 VLM训练与架构 :multimodal large language model(abstract)

AI总结 本文提出One Tokenizer,通过统一词汇实现多模态无缝整合,克服传统架构的几何模态间隙问题,提升生物推理性能。

Comments Under review at NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07110 2026-05-11 cs.CL cs.SE 50%

Securing Computer-Use Agents: A Unified Architecture-Lifecycle Framework for Deployment-Grounded Reliability

保障计算机使用代理:一种面向部署的架构-生命周期框架用于可靠性

Zejian Chen, Zhanyuan Liu, Chaozhuo Li, Mengxiang Han, Songyang Liu, Litian Zhang, Feng Gao, Yiming Hei, Xi Zhang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) China Academy of Information and Communications Technology, Artificial Intelligence Institute(信息与通信技术研究院,人工智能研究所)

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 本文提出一种面向部署的架构-生命周期框架,用于提升计算机使用代理的可靠性,通过分析感知、决策和执行层,以及创建、部署、操作和维护阶段,解决能力形成、授权暴露、故障表现和控制放置之间的联系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13372 2026-05-11 cs.CY 50%

Semantic Alignment Between Normative Theories of Ethics and the European Union Artificial Intelligence Act: A Transformer-Based Semantic Textual Similarity Analysis

伦理规范理论与欧盟人工智能法案之间的语义对齐:基于Transformer的语义文本相似性分析

Mehmet Murat Albayrakoglu, Mehmet Nafiz Aydin

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 本文通过Transformer模型分析伦理理论与欧盟AI法案的语义对齐,发现义务伦理学在法案两部分中具有最高相似性。

Comments 18 pages, 5 tables, 3 figures; the concept of alignment introduced as an indication of influence

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19316 2026-05-08 cs.CL 50%

KORE: Enhancing Knowledge Injection for Large Multimodal Models via Knowledge-Oriented Controls

KORE:通过知识导向控制增强大型多模态模型的知识注入

Kailin Jiang, Hongbo Jiang, Ning Jiang, Zhi Gao, Jinhe Bi, Yuchen Ren, Bin Li, Yuntao Du, Lei Liu, Qing Li

机构 * University of Science State Key Laboratory of General Artificial Intelligence, BIGAI Xiamen University Northeast Forestry University Beijing Institute of Technology Ludwig Maximilian University of Munich The University of Sydney C-FAIR\&school of software, Shandong University State Key Lab. for Novel Software Technology, Nanjing University, P.R. China

专题命中 VLM训练与架构 :LLaVA(abstract)

AI总结 KORE通过知识导向的增强和约束,提升大型多模态模型的知识注入能力,同时保留旧知识。方法利用协方差矩阵和投影初始化,有效减少灾难性遗忘。

Comments ICML 2026, Project Page: https://kore-lmm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12778 2026-05-05 cs.CL 50%

HeteroRAG: A Heterogeneous Retrieval-Augmented Generation Framework for Medical Vision Language Tasks

HeteroRAG:一种用于医疗视觉语言任务的异构检索增强生成框架

Zhe Chen, Yusheng Liao, Zhiyuan Zhu, Haolin Li, Hongcheng Liu, Yanfeng Wang, Yu Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 VLM训练与架构 :vision-language model(abstract)

AI总结 本文提出HeteroRAG框架,通过异构知识源增强医疗大视觉语言模型,解决异构数据检索问题,提升事实准确性与可靠性。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27393 2026-05-01 cs.CL 50%

MiniCPM-o 4.5: Towards Real-Time Full-Duplex Omni-Modal Interaction

MiniCPM-o 4.5:迈向实时全双工多模态交互

Junbo Cui, Bokai Xu, Chongyi Wang, Tianyu Yu, Weiyue Sun, Yingjing Xu, Tianran Wang, Zhihui He, Wenshuo Ma, Tianchi Cai, Jiancheng Gui, Luoyuan Zhang, Xian Sun, Fuwei Huang, Moye Chen, Zhuo Lin, Hanyu Liu, Qingxin Gui, Qingzhe Han, Yuyang Wen, Huiping Liu, Rongkang Wang, Yaqi Zhang, Hongliang Wei, Chi Chen, You Li, Kechen Fang, Jie Zhou, Yuxuan Li, Guoyang Zeng, Chaojun Xiao, Yankai Lin, Xu Han, Maosong Sun, Zhiyuan Liu, Yuan Yao

机构 * OpenBMB(开放大脑)

专题命中 VLM训练与架构 :multimodal large language model(abstract)

AI总结 MiniCPM-o 4.5通过实时全双工多模态交互技术,解决多模态交互中感知与响应分离及被动响应的问题,实现更接近人类水平的多模态交互能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19405 2026-04-22 cs.CL 50%

Lost in Translation: Do LVLM Judges Generalize Across Languages?

迷失在翻译中:大型视觉-语言模型(LVLM)的评判者是否能跨语言泛化?

Md Tahmid Rahman Laskar, Mohammed Saidul Islam, Mir Tafseer Nayeem, Amran Bhuiyan, Mizanur Rahman, Shafiq Joty, Enamul Hoque, Jimmy Huang

机构 * York University(约克大学) University of Alberta(阿尔伯塔大学) Nanyang Technological University(南洋理工大学) Salesforce AI Research(Salesforce AI研究)

专题命中 VLM训练与架构 :vision-language model(abstract)

AI总结 本文提出MM-JudgeBench,首个多语言多模态评判模型评估基准,包含60000+跨25种语言的配对偏好实例,揭示了LVLM评判器在跨语言性能上的显著差异,指出模型大小和架构并非多语言鲁棒性的良好预测因素。

Comments Accepted at ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17543 2026-04-21 cs.CL 50%

PoliLegalLM: A Technical Report on a Large Language Model for Political and Legal Affairs

PoliLegalLM:政治与法律领域大型语言模型的技术报告

Yuting Huang, Yinghao Hu, Qian Xiao, Wenlin Zhong, Yiquan Wu, Taishi Zhou, Moke Chen, Changlong Sun, Kun Kuang, Fei Wu

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团) Zhejiang University(浙江大学) Zhejiang Zhengfa Xinxi Guanli Zhongxin(浙江正法信息警务中心)

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 本文提出PoliLegalLM,通过统一训练框架提升法律知识和推理能力,针对法律领域挑战实现高性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21262 2026-04-17 cs.CL 50%

CausalEmbed: Auto-Regressive Multi-Vector Generation in Latent Space for Visual Document Embedding

CausalEmbed: 在潜在空间中实现自动回归多向量生成用于视觉文档嵌入

Jiahao Huo, Yu Huang, Yibo Yan, Ye Pan, Kening Zheng, Wei-Chieh Huang, Yi Cao, Mingdong Ou, Philip S. Yu, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Alibaba Cloud Computing(阿里云计算) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 VLM训练与架构 :multimodal large language model(abstract)

AI总结 本文提出CausalEmbed方法,通过对比训练中的迭代边际损失生成紧凑且结构良好的多向量嵌入,实现高效的视觉文档检索,减少30-155倍的token数量同时保持高性能。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12179 2026-04-15 cs.CL cs.IR 50%

AgenticAI-DialogGen: Topic-Guided Conversation Generation for Fine-Tuning and Evaluating Short- and Long-Term Memories of LLMs

AgenticAI-DialogGen:基于主题引导的对话生成用于微调和评估LLM的短期和长期记忆

Manoj Madushanka Perera, Adnan Mahmood, Kasun Eranda Wijethilake, Quan Z. Sheng

机构 * School of Computing, Macquarie University(麦考瑞大学计算机学院)

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 本文提出AgenticAI-DialogGen框架,通过生成基于角色和主题的对话来微调和评估LLM的短期和长期记忆,引入了TopicGuidedChat数据集以提升对话质量和模型性能。

Comments 13 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01512 2026-04-14 cs.CL 50%

MCAT: Scaling Many-to-Many Speech-to-Text Translation with MLLMs to 70 Languages

MCAT: 通过MLLMs扩展多对多语音到文本翻译至70种语言

Yexing Du, Kaiyuan Liu, Youcheng Pan, Bo Yang, Keqi Deng, Xie Chen, Yang Xiang, Ming Liu, Bing Qin, YaoWei Wang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Pengcheng Laboratory(鹏城实验室) Harbin Institute of Technology, Harbin(哈尔滨工业大学(哈尔滨)) University of Cambridge(剑桥大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract)

AI总结 MCAT框架通过课程学习和数据平衡策略扩展MLLMs支持70种语言并实现互译,同时优化语音适配模块将语音序列长度缩减至30个token,提升翻译效率。

Comments Accepted in IEEE TASLP

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14493 2026-04-14 cs.CL cs.CR 50%

LingoLoop Attack: Trapping MLLMs via Linguistic Context and State Entrapment into Endless Loops

LingoLoop攻击:通过语言上下文和状态陷阱使大语言模型陷入无限循环

Jiyuan Fu, Kaixun Jiang, Lingyi Hong, Jinglun Li, Haijing Guo, Dingkang Yang, Zhaoyu Chen, Wenqiang Zhang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与技术学院) College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) Jiiov Technology(极奥科技)

专题命中 VLM训练与架构 :multimodal large language model(abstract)

AI总结 本文提出LingoLoop攻击,通过调整词性标注和隐藏状态限制,使多模态大语言模型生成冗长重复内容,导致资源耗尽和服务降级。

Comments Accepted to ICLR 2026. Code is available at: https://github.com/fuhaha824/LingoLoop-Attack

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10587 2026-04-14 cs.HC 50%

CogInstrument: Modeling Cognitive Processes for Bidirectional Human-LLM Alignment in Planning Tasks

CogInstrument: 为规划任务中的双向人-大语言模型对齐建模认知过程

Anqi Wang, Dongyijie Pan, Xin Tong, Pan Hui

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 CogInstrument通过认知动机建模实现人与大语言模型在规划任务中的双向对齐,通过可编辑的图形结构揭示隐含推理过程,提升用户对协作的控制力和信任度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08644 2026-04-13 cs.CL 50%

EXAONE 4.5 Technical Report

EXAONE 4.5 技术报告

Eunbi Choi, Kibong Choi, Sehyun Chun, Seokhee Hong, Junwon Hwang, Hyojin Jeon, Ahra Jo, Hyunjik Jo, Yeonsik Jo, Joonkee Kim, Seonghwan Kim, Soyeon Kim, Sunkyoung Kim, Yireun Kim, Yongil Kim, Changhun Lee, Haeju Lee, Jinsik Lee, Kyungmin Lee, Sangha Park, Kwangrok Ryoo, Minju Seo, Sejong Yang, Heuiyeen Yeen, Hwan Chang, Stanley Jungkyu Choi, Yejin Choi, Kyubeen Han, Joonwon Jang, Kijeong Jeon, Geunyeong Jeong, Gerrard Jeongwon Jo, Jiyeon Jung, Daeseong Kim, Dohoon Kim, Dohyun Kim, Hyunseo Kim, Minu Kim, Myoungshin Kim, Youchul Kim, Byungoh Ko, Christopher Lee, Edward Hwayoung Lee, Honglak Lee, Jiyoung Lee, Sangeun Lee, Seungwon Lim, Woohyung Lim, Jueun Mun, Jaewoo Park, Jimin Park, Jinho Park, Yongmin Park, Wooseok Seo, Yongwoo Song, Sihyuk Yi, Kyungjae Yoo, Sangyeon Yoon

机构 * LG AI Research(LG AI 研究院)

专题命中 VLM训练与架构 :vision language model(abstract)

AI总结 EXAONE 4.5通过集成专用视觉编码器扩展EXAONE 4.0框架,实现多模态预训练,提升文档理解和语言能力,支持256K tokens上下文长度,优于同类模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05650 2026-04-10 cs.CL 50%

See the Forest for the Trees: Loosely Speculative Decoding via Visual-Semantic Guidance for Efficient Inference of Video LLMs

见林木而非树木:通过视觉-语义引导实现松散推测解码以提高视频大语言模型的推理效率

Yicheng Ji, Jun Zhang, Jinpeng Chen, Cong Wang, Lidan Shou, Gang Chen, Huan Li

机构 * ZJU(浙江大学) BUPT(北京邮电大学)

专题命中 VLM训练与架构 :LLaVA(abstract)

AI总结 本文提出LVSpec,一种无需训练的松散推测解码框架,通过视觉相关锚点识别和位置移位容忍机制,提升视频大语言模型的推理速度和精度。

Comments ACL'2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12710 2026-04-10 cs.RO 50%

Reflection-Based Task Adaptation for Self-Improving VLA

基于反射的任务适应用于自我改进的VLA

Baicheng Li, Dong Wu, Zike Yan, Xinchen Liu, Lusong Li, Zecui Zeng, Hongbin Zha

机构 * School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) JD Explore Academy(京东探索研究院) AIR, Tsinghua University(清华大学智能产业研究院)

专题命中 VLM训练与架构 :VLM(abstract)

AI总结 本文提出反射式自我适应框架,通过双路径架构实现快速自主任务适应,结合失败驱动的强化学习与成功驱动的质量引导微调,提升机器人在复杂任务中的适应效率和成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09746 2026-04-08 cs.MA 50%

Multi-Agent Cooperative Learning for Robust Vision-Language Alignment under OOD Concepts

多智能体协作学习用于应对异常概念下的鲁棒视觉语言对齐

Philip Xu

专题命中 VLM训练与架构 :vision-language model(abstract)

AI总结 本文提出多智能体协作学习框架,通过结构化信息传递缓解模态不平衡,提升视觉语言模型在异常概念下的对齐性能,实验表明在少样本和零样本设置中精度提升1-5%。

Comments arXiv admin note: This submission has been withdrawn by arXiv administrators due to incorrect authorship. Author list truncated

详情

展开后加载摘要…

URL PDF HTML 收藏