Large-scale Pretraining for Visual Dialog: A Simple State-of-the-Art Baseline
专题命中 VLM训练与架构 :visual question answering(abstract);分类 cs.CV、cs.LG
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 VLM训练与架构 :visual question answering(abstract);分类 cs.CV、cs.LG
专题命中 VLM训练与架构 :visual question answering(abstract);分类 cs.CV、cs.LG
Comments EMNLP 2019 (14 pages; with new attention visualizations)
说什么和何时说:Live Fitness Coaching作为情境交互的测试平台
机构 * TwentyBN GmbH(TwentyBN公司) ; Qualcomm AI Research(高通人工智能研究) ; Aignostics GmbH(Aignostics公司) ; UC San Diego(加州大学圣地亚哥分校)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV;VLM(comments)
AI总结 本文提出QEVD基准和数据集,研究人类与AI在健身指导中的情境交互,测试视觉语言模型在实时反馈中的能力,揭示现有模型的局限并提出异步流式基线方法。
Comments Accepted to the 2024 NeurIPS Datasets and Benchmarks track; Data: https://www.qualcomm.com/developer/software/qevd-dataset Dataset quick start guide: https://github.com/varworkshop/ai_coach_fitness_2026 and Stream-VLM code: https://github.com/Qualcomm-AI-research/FitCoach
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV;MLLM(comments)
Comments Long Video MLLM; work in progress
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV;VLM(comments)
Comments The project page is available at https://vlm-driver.github.io/
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV;VLM(comments)
Comments Add results on 1) EventCLIP with another VLM FLIP 2) inference speed analysis
专题命中 VLM训练与架构 :LLaVA(abstract,comments);分类 cs.CV
Comments Released at LLaVA Model Zoo: https://github.com/haotian-liu/LLaVA/blob/main/docs/MODEL_ZOO.md
潜在有序证据与未对齐输出:多模态大语言模型的推理时有序视角对齐
机构 * Monash University(莫纳什大学) ; Faculty of Information Technology, Monash University(莫纳什大学信息技术学院)
专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.CV
AI总结 针对多模态大语言模型有序输出未对齐问题,本文提出推理时的Ordinal Lens Alignment方法,提升有序回归任务性能且优于现有基线。
Comments EMNLP 2026 (Main Conference)
多模态推测解码是否适用于基于扩散的并行草稿生成?一项调查与实证诊断
机构 * Data Science & Artificial Intelligence Research Institute, China Unicom(中国联通数据科学与人工智能研究院) ; Unicom Data Intelligence, China Unicom(中国联通数据智能)
专题命中 VLM训练与架构 :visual reasoning(abstract);分类 cs.AI
AI总结 本文通过调查多模态模型并开展跨架构实证研究,探究多模态推测解码是否适用于基于扩散的并行草稿生成,提出统一分类法并分析现有方法的局限性与未来方向。
Ansari:基于检索的伊斯兰AI助手——架构、部署及14万次对话的经验教训
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI
AI总结 本研究推出基于检索的伊斯兰AI助手Ansari,其经多平台部署后处理14万次跨语言对话,在IslamicMMLU等基准中表现优异,为信仰敏感型LLM部署提供了经验。
Comments 10 pages, 1 figure, 3 tables. Live system: this https URL (https://askansari.ai). Code: this https URL (https://github.com/ansari-project)
Prompt2Effect: 通过LoRA生成实现免训练图像到视频模型特化
机构 * Northeastern University(东北大学) ; Snap Inc.(Snap公司)
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV
AI总结 提出Prompt2Effect,一种权重驱动超网络,通过单次前向传播直接合成效果特定的LoRA权重,无需训练,在保持视频质量的同时将计算成本从56 GPU小时降至3.3秒。
Comments Accepted to ECCV 2026, project page: this https URL (https://xiaomeng-yang.github.io/Prompt2Effect)
完全循环子任务图用于工具使用LLM代理:多代理工作流程中的灵活性、成本和瓶颈
机构 * Lebanese American University(黎巴嫩美国大学)
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI
AI总结 本文研究了完全循环子任务图,通过分析不同基准测试发现,多代理工作流程中灵活性可能带来协调成本和推理成本,而外部任务瓶颈可能主导性能。
Comments 37 pages, 8 figures. Published in Transactions on Machine Learning Research (TMLR), 2026. Supplementary material included as ancillary material
DIFFCZSL:基于扩散表示正则化的组合零样本学习
机构 * The Hong Kong University of Science and Technology(香港科技大学)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
AI总结 DIFFCZSL将预训练扩散模型的生成先验注入基于CLIP的组合零样本学习流程,通过对比对齐提升性能,在两类设置下均优于强基线,凸显了扩散表示与视觉-语言模型的互补优势。
基于增强型视觉-语言对齐的临床可信医学图像描述生成研究
机构 * Chung-Ang University(中央大学)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
AI总结 本研究针对医学图像描述生成的临床可信性问题,提出分离训练与推理对齐的框架,结合多编码器、辅助学习及MedPAIR-SCST方法,通过选择与强化学习对齐提升临床一致性,在数据受限场景下改善医学图像描述的可信度。
Comments 10 pages, 2 figures, 7 tables. Preprint submitted to IEEE for possible publication
Holtercare-Bench:用于评估长期动态心电图分析的多模态基准
机构 * Zhejiang University(浙江大学) ; Beijing Institute of Technology(北京理工大学) ; University of Electronic Science and Technology of China(电子科技大学)
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.LG
AI总结 该研究针对现有多模态大语言模型在长期动态心电图分析中的不足,构建了含22980个问答对的Holtercare-23K数据集及Holtercare-Bench基准,评估发现零样本模型处理超长病理序列性能差,微调后提升显著,为长期医疗多模态大语言模型提供基础基准。
幻觉作为特征而非缺陷:评估一种将推测性语言模型输出转化为可检验科学假说的多智能体架构
机构 * IES Parquesol(帕尔奎索尔学院)
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI
AI总结 该研究提出基于Rust的多智能体架构,通过生成与评估智能体的认识论摩擦循环将LLM的推测性输出转化为可检验假说,实验显示该架构在需经受严格约束时更具优势,且各架构在原创性等维度的平衡表现不同。
Comments 25 pages. Bilingual: full English version followed by the complete Spanish version. Includes an exploratory paired baseline and ablation study (6 conditions). Code and data: https://doi.org/10.5281/zenodo.20649714
FACET:在终端任务合成中保留源意图与可执行状态
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Fudan University(复旦大学)
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI
AI总结 FACET是保留源意图与可执行状态的终端任务合成框架,可生成高质量任务并提升Terminal-Bench 2.1上的智能体微调性能,为任务合成提供关键原则。
SE-MoLoRA:用于特定领域摄影评估的共享专家LoRA适配器
机构 * Faculty of Information Technology(信息技术学院) ; University of Jyväskylä(于韦斯屈莱大学) ; Adobe Research(奥多比研究院) ; University of Helsinki(赫尔辛基大学)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
AI总结 本文提出SE-MoLoRA框架,通过共享LoRA专家与路由适配器解耦通用摄影知识和专业判断,在摄影评论生成任务上显著提升BERTScore-F1,且更受偏好、参数更少。
面向资源受限农村地区多模态临床筛查的云边协同系统
机构 * University of Michigan(密歇根大学) ; Massachusetts Institute of Technology(麻省理工学院) ; Harvard Medical School(哈佛医学院)
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.LG
AI总结 该研究针对资源受限农村地区的多模态临床筛查问题,提出云边协同架构,经实验验证其诊断性能优异且成本更低,可适配部署约束。
Comments 31 pages, 3 figures. In Proceedings of Machine Learning Research, Volume 340, 2026 (Machine Learning for Healthcare Conference)
MoE-ViE:用于高效图像与视频理解的混合专家视觉编码器
机构 * Meta
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
AI总结 本研究提出MoE-ViE,通过细粒度MoE拓扑、无辅助损失平衡变体、专用MoE内核及帧级蒸馏等设计,实现高效图像与视频理解,性能优于对应密集模型及更大规模SOTA编码器。
Comments Accepted to ECCV 2026
多模态对比学习中的表达能力
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.LG
AI总结 该研究针对多模态对比学习的表达能力展开分析,明确CLIP架构的表达能力随模态数量变化,提出Hadamard-CLIP模型,实现任意数量模态联合分布的通用近似且保留CLIP的检索优势。
RecurrentGPT:通过Transformer中的循环调制实现表达性深度
机构 * The German University in Cairo(开罗德国大学) ; Technical University of Munich(慕尼黑工业大学) ; Cerebras Systems Inc.(赛布拉斯系统公司)
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.LG
AI总结 本文提出RecurrentGPT,通过循环调制解决Transformer语言模型表达性与内存效率的矛盾,在多约束下优于基线模型,实现参数与内存的高效利用。
迈向AI历史学家:从原始资料中进行代理信息提取
机构 * Torr Vision Group, Department of Engineering Science, University of Oxford(牛津大学工程科学系托尔视觉组) ; Oxford Centre for Economic and Social History, University of Oxford(牛津大学牛津经济与社会史中心) ; Faculty of Music, University of Oxford(牛津大学音乐学院) ; Fraunhofer HHI(弗劳恩霍夫海因里希·赫兹研究所)
专题命中 VLM训练与架构 :VLM(abstract_cn);分类 cs.AI
AI总结 本文介绍Chronos项目首个模块,通过自然语言交互将历史文献图像转化为数据,允许历史学家自定义流程、评估模型性能并迭代优化。
SEER:基于选择性视觉-文本压缩的长上下文推理
机构 * The University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; University of Cambridge(剑桥大学) ; University of Technology Sydney(悉尼科技大学) ; The University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
AI总结 SEER是结合视觉压缩效率与文本推理精度的框架,经监督微调后在LongBench等长上下文基准测试中,准确率优于Glyph-9B、Qwen3-8B等基线模型,可提升提取精度并保留提示token节省量。
Comments COLM 2026, Third Conference on Language Modeling
Gaussian-JEPA:面向3D高斯溅射的联合嵌入预测学习
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV
AI总结 提出Gaussian-JEPA,通过预测高斯令牌块潜在表示实现自监督学习,在多类任务上优于重构预训练,为3D高斯表示提供有效学习目标
Comments Joint-embedding predictive representation learning for 3D Gaussian Splatting
MEDR:基于多信号事件建模与动态重评分的查询无关帧选择
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV
AI总结 该研究提出无需训练的MEDR帧选择方法,通过多信号事件建模与动态重评分实现查询无关,在Video-MME等基准上提升了多模态大语言模型的长视频处理准确率,且帧集可跨问题复用。
Comments 9 pages, 2 figures, 3 tables
SMA:谁说的?半黑盒RAG控制中的成员泄露审计
机构 * Sun Yat-Sen University(孙中山大学) ; Nanyang Technological University(南洋理工大学) ; University of Chinese Academy of Science(中国科学院大学) ; Zhongguancun Academy(中关村学院) ; Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)
专题命中 VLM训练与架构 :MLLM(abstract_cn);分类 cs.AI
AI总结 本研究针对半黑盒RAG控制中的成员泄露问题,提出首个源感知成员审计SMA,通过零阶优化归因估计机制与跨模态归因技术,实现生成内容的细粒度来源归因,为复杂生成系统的数据来源审计提供新视角。
基于分布式联合隐空间构建的多视图表示学习
机构 * Huawei Paris Research Center, France(华为巴黎研究中心,法国)
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.LG
AI总结 该研究针对分布式多视图表示学习的客户端协调问题,推导了基于MDL的泛化界,提出分布式高斯乘积混合先验方法,经多组实验验证了其有效性。
当API“说错”语言:重新审视多语言工具使用的后训练
机构 * Amazon(亚马逊)
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI
AI总结 针对多语言API调用中存在的参数语言不匹配问题,研究发现监督微调可实现接近或优于复杂强化学习方法的性能,强化学习仅能提供渐进式改进。
XBridge:面向异构大语言模型通信的实体锚定隐空间桥接器
机构 * Hankuk University of Foreign Studies(韩国外国语大学) ; Noah’s Farm(诺亚农场) ; University of Illinois Chicago(伊利诺伊大学芝加哥分校) ; Capital One AI Foundations(Capital One AI 基金会)
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI
AI总结 XBridge是免解码的异构大语言模型通信协议,通过词汇锚定映射和隐空间丰富桥接器解决跨架构通信的实体身份丢失问题,在多模型、多基准测试中表现优于现有方法,参数开销低。
Comments 18 pages, 4 figures