arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5067 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5067 篇

1912.02379 2020-04-01 cs.LG cs.CL cs.CV stat.ML 62%

Large-scale Pretraining for Visual Dialog: A Simple State-of-the-Art Baseline

Vishvak Murahari, Dhruv Batra, Devi Parikh, Abhishek Das

专题命中 VLM训练与架构 :visual question answering(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1908.07490 2019-12-05 cs.CL cs.CV cs.LG 62%

LXMERT: Learning Cross-Modality Encoder Representations from Transformers

Hao Tan, Mohit Bansal

专题命中 VLM训练与架构 :visual question answering(abstract);分类 cs.CV、cs.LG

Comments EMNLP 2019 (14 pages; with new attention visualizations)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08101 2026-04-16 cs.CV 61%

What to Say and When to Say it: Live Fitness Coaching as a Testbed for Situated Interaction

说什么和何时说:Live Fitness Coaching作为情境交互的测试平台

Sunny Panchal, Apratim Bhattacharyya, Guillaume Berger, Antoine Mercier, Cornelius Bohm, Florian Dietrichkeit, Reza Pourreza, Xuanlin Li, Pulkit Madan, Mingu Lee, Mark Todorovich, Ingo Bax, Roland Memisevic

机构 * TwentyBN GmbH(TwentyBN公司) Qualcomm AI Research(高通人工智能研究) Aignostics GmbH(Aignostics公司) UC San Diego(加州大学圣地亚哥分校)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV;VLM(comments)

AI总结 本文提出QEVD基准和数据集,研究人类与AI在健身指导中的情境交互,测试视觉语言模型在实时反馈中的能力,揭示现有模型的局限并提出异步流式基线方法。

Comments Accepted to the 2024 NeurIPS Datasets and Benchmarks track; Data: https://www.qualcomm.com/developer/software/qevd-dataset Dataset quick start guide: https://github.com/varworkshop/ai_coach_fitness_2026 and Stream-VLM code: https://github.com/Qualcomm-AI-research/FitCoach

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13694 2024-10-18 cs.CV cs.CL 61%

Exploring the Design Space of Visual Context Representation in Video MLLMs

Yifan Du, Yuqi Huo, Kun Zhou, Zijia Zhao, Haoyu Lu, Han Huang, Wayne Xin Zhao, Bingning Wang, Weipeng Chen, Ji-Rong Wen

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV;MLLM(comments)

Comments Long Video MLLM; work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.00438 2023-12-04 cs.CV 61%

Dolphins: Multimodal Language Model for Driving

Yingzi Ma, Yulong Cao, Jiachen Sun, Marco Pavone, Chaowei Xiao

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV;VLM(comments)

Comments The project page is available at https://vlm-driver.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.06354 2023-11-20 cs.CV 61%

EventCLIP: Adapting CLIP for Event-based Object Recognition

Ziyi Wu, Xudong Liu, Igor Gilitschenski

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV;VLM(comments)

Comments Add results on 1) EventCLIP with another VLM FLIP 2) inference speed analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.09958 2023-09-19 cs.CV cs.CL 61%

An Empirical Study of Scaling Instruct-Tuned Large Multimodal Models

Yadong Lu, Chunyuan Li, Haotian Liu, Jianwei Yang, Jianfeng Gao, Yelong Shen

专题命中 VLM训练与架构 :LLaVA(abstract,comments);分类 cs.CV

Comments Released at LLaVA Model Zoo: https://github.com/haotian-liu/LLaVA/blob/main/docs/MODEL_ZOO.md

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20999 2026-08-24 cs.CV 新提交 57%

Latent Ordinal Evidence, Misaligned Outputs: Inference-Time Ordinal Lens Alignment for Multimodal LLMs

潜在有序证据与未对齐输出:多模态大语言模型的推理时有序视角对齐

Haiming Li, Yingsheng Liu, Jingmin Zhu, Siyuan Yan, Xieji Li, Jiajun Sun, Zhen Yu, Zongyuan Ge

机构 * Monash University(莫纳什大学) Faculty of Information Technology, Monash University(莫纳什大学信息技术学院)

专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.CV

AI总结 针对多模态大语言模型有序输出未对齐问题,本文提出推理时的Ordinal Lens Alignment方法,提升有序回归任务性能且优于现有基线。

Comments EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20743 2026-08-24 cs.AI 新提交 57%

Is Multimodal Speculative Decoding Ready for Diffusion-Based Parallel Drafting? A Survey and Empirical Diagnosis

多模态推测解码是否适用于基于扩散的并行草稿生成?一项调查与实证诊断

Yantao Li, Huanlin Gao, Fang Zhao, Chao Tan, Qiang Hui, Shuting Liu, Fuyuan Shi, Ting Lu, Shaoan Zhao, Xueqiang Guo, Xinpei Su, Jianbing Zhang, Xinyu Dai, Kai Wang, Shiguo Lian

机构 * Data Science & Artificial Intelligence Research Institute, China Unicom(中国联通数据科学与人工智能研究院) Unicom Data Intelligence, China Unicom(中国联通数据智能)

专题命中 VLM训练与架构 :visual reasoning(abstract);分类 cs.AI

AI总结 本文通过调查多模态模型并开展跨架构实证研究,探究多模态推测解码是否适用于基于扩散的并行草稿生成,提出统一分类法并分析现有方法的局限性与未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20390 2026-08-24 cs.CL cs.AI cs.CY 新提交 57%

Ansari: A Retrieval-Grounded Islamic AI Assistant -- Architecture, Deployment, and Lessons from 140,000 Conversations

Ansari:基于检索的伊斯兰AI助手——架构、部署及14万次对话的经验教训

M Waleed Kadous, Amr Elsayed, Abdullah Al Nahas, Ashraf Haress

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 本研究推出基于检索的伊斯兰AI助手Ansari,其经多平台部署后处理14万次跨语言对话,在IslamicMMLU等基准中表现优异,为信仰敏感型LLM部署提供了经验。

Comments 10 pages, 1 figure, 3 tables. Live system: this https URL (https://askansari.ai). Code: this https URL (https://github.com/ansari-project)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13971 2026-08-24 cs.CV 版本更新 57%

Prompt2Effect: Training-Free Image-to-Video Model Specialization via LoRA Generation

Prompt2Effect: 通过LoRA生成实现免训练图像到视频模型特化

Xiaomeng Yang, Yanyu Li, Gordon Guocheng Qian, Ivan Skorokhodov, Viacheslav Ivanov, Avalon Vinella, Xuan Zhang, Yanzhi Wang, Sergey Tulyakov, Anil Kag

机构 * Northeastern University(东北大学) Snap Inc.(Snap公司)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV

AI总结 提出Prompt2Effect,一种权重驱动超网络,通过单次前向传播直接合成效果特定的LoRA权重,无需训练,在保持视频质量的同时将计算成本从56 GPU小时降至3.3秒。

Comments Accepted to ECCV 2026, project page: this https URL (https://xiaomeng-yang.github.io/Prompt2Effect)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22820 2026-08-24 cs.MA cs.AI 版本更新 57%

Complete Cyclic Subtask Graphs for Tool-Using LLM Agents: Flexibility, Cost, and Bottlenecks in Long-Horizon Workflows

完全循环子任务图用于工具使用LLM代理:多代理工作流程中的灵活性、成本和瓶颈

Luay Gharzeddine, Samer Saab Jr

机构 * Lebanese American University(黎巴嫩美国大学)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 本文研究了完全循环子任务图,通过分析不同基准测试发现,多代理工作流程中灵活性可能带来协调成本和推理成本,而外部任务瓶颈可能主导性能。

Comments 37 pages, 8 figures. Published in Transactions on Machine Learning Research (TMLR), 2026. Supplementary material included as ancillary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19871 2026-08-21 cs.CV 新提交 57%

DIFFCZSL: Compositional Zero-Shot Learning Regularized by Diffusion Representations

DIFFCZSL:基于扩散表示正则化的组合零样本学习

Hangyu Tian, Zhenqi He, Yanghao Wang, Long Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 DIFFCZSL将预训练扩散模型的生成先验注入基于CLIP的组合零样本学习流程,通过对比对齐提升性能,在两类设置下均优于强基线,凸显了扩散表示与视觉-语言模型的互补优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19825 2026-08-21 cs.CV cs.CL 新提交 57%

Towards Clinically Faithful Medical Image Captioning via Enhanced Vision-Language Alignment

基于增强型视觉-语言对齐的临床可信医学图像描述生成研究

Yunseo Lee, Hyun Jun Kim, Heeseung Shin, Changwon Lim

机构 * Chung-Ang University(中央大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本研究针对医学图像描述生成的临床可信性问题,提出分离训练与推理对齐的框架,结合多编码器、辅助学习及MedPAIR-SCST方法,通过选择与强化学习对齐提升临床一致性,在数据受限场景下改善医学图像描述的可信度。

Comments 10 pages, 2 figures, 7 tables. Preprint submitted to IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19297 2026-08-21 cs.LG 新提交 57%

Holtercare-Bench: A Multimodal Benchmark for Evaluating Long-Term Dynamic ECG Analysis

Holtercare-Bench:用于评估长期动态心电图分析的多模态基准

Yihan Xie, Hanwen Cui, Runze Ye, Juekai Lin, Haoyang Wang, Jinhao Mao, Bo Zhang, Wenqiao Zhang, Xiaogang Guo, Jun Xiao, Lei Zhang

机构 * Zhejiang University(浙江大学) Beijing Institute of Technology(北京理工大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.LG

AI总结 该研究针对现有多模态大语言模型在长期动态心电图分析中的不足,构建了含22980个问答对的Holtercare-23K数据集及Holtercare-Bench基准,评估发现零样本模型处理超长病理序列性能差,微调后提升显著,为长期医疗多模态大语言模型提供基础基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19206 2026-08-21 cs.CL cs.AI cs.MA 新提交 57%

Hallucination as a Feature, not a Defect: Evaluating a multi-agent architecture to transform speculative language-model outputs into testable scientific hypotheses

幻觉作为特征而非缺陷:评估一种将推测性语言模型输出转化为可检验科学假说的多智能体架构

Nicolas Rodriguez-Alvarez

机构 * IES Parquesol(帕尔奎索尔学院)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 该研究提出基于Rust的多智能体架构,通过生成与评估智能体的认识论摩擦循环将LLM的推测性输出转化为可检验假说,实验显示该架构在需经受严格约束时更具优势,且各架构在原创性等维度的平衡表现不同。

Comments 25 pages. Bilingual: full English version followed by the complete Spanish version. Includes an exploratory paired baseline and ablation study (6 conditions). Code and data: https://doi.org/10.5281/zenodo.20649714

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18580 2026-08-20 cs.AI cs.PL 新提交 57%

FACET: Preserving Source Intent and Executable State in Terminal Task Synthesis

FACET:在终端任务合成中保留源意图与可执行状态

Kou Shi, Zun Wang, Qisheng Su, Shiting Huang, Ziao Zhang, Zhen Fang, Qingnan Ren, Jin Liu, Yu Zeng, Yiming Zhao, Lin Chen, Zehui Chen, Feng Zhao

机构 * Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 FACET是保留源意图与可执行状态的终端任务合成框架,可生成高质量任务并提升Terminal-Bench 2.1上的智能体微调性能,为任务合成提供关键原则。

Comments https://stokou.github.io/FACET-Terminal/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17514 2026-08-20 cs.CV cs.MM 版本更新 57%

SE-MoLoRA: Shared-Expert LoRA Adapters for Domain-Specific Photographic Assessment

SE-MoLoRA:用于特定领域摄影评估的共享专家LoRA适配器

Bishwash Khanal, Anlan Zhang, Sasu Tarkoma, Tommi Mikkonen, Abhishek Kumar

机构 * Faculty of Information Technology(信息技术学院) University of Jyväskylä(于韦斯屈莱大学) Adobe Research(奥多比研究院) University of Helsinki(赫尔辛基大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出SE-MoLoRA框架,通过共享LoRA专家与路由适配器解耦通用摄影知识和专业判断,在摄影评论生成任务上显著提升BERTScore-F1,且更受偏好、参数更少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12745 2026-08-20 cs.LG cs.DC 版本更新 57%

A Cloud-Edge System for Multimodal Clinical Screening in Resource-Constrained Rural Settings

面向资源受限农村地区多模态临床筛查的云边协同系统

Hei Ting, Chan, Chenwei Wu, Xueshen Liu, Zesen Zhao, Boyuan Zheng, Luis Filipe Nakayama, Michael G. Morley, Liyue Shen, Jiasi Chen, Z. Morley Mao

机构 * University of Michigan(密歇根大学) Massachusetts Institute of Technology(麻省理工学院) Harvard Medical School(哈佛医学院)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.LG

AI总结 该研究针对资源受限农村地区的多模态临床筛查问题,提出云边协同架构,经实验验证其诊断性能优异且成本更低,可适配部署约束。

Comments 31 pages, 3 figures. In Proceedings of Machine Learning Research, Volume 340, 2026 (Machine Learning for Healthcare Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17402 2026-08-19 cs.CV 新提交 57%

MoE-ViE: Mixture of Experts Vision Encoder for Efficient Image and Video Understanding

MoE-ViE:用于高效图像与视频理解的混合专家视觉编码器

Bonan Zhang, Shiyu Dong, Quan Hung Tran, Katharina Gschwind, Shuqi Yang, Sijia Chen, Adel Ahmadyan, Seungwhan Moon, Lu Zhang, Ahmed Kirmani, Babak Damavandi, Anuj Kumar

机构 * Meta

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本研究提出MoE-ViE,通过细粒度MoE拓扑、无辅助损失平衡变体、专用MoE内核及帧级蒸馏等设计,实现高效图像与视频理解,性能优于对应密集模型及更大规模SOTA编码器。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17203 2026-08-19 stat.ML cs.LG math.ST stat.TH 新提交 57%

Expressivity In Multimodal Contrastive Learning

多模态对比学习中的表达能力

Andrew Stuart, Florian Wolf

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.LG

AI总结 该研究针对多模态对比学习的表达能力展开分析,明确CLIP架构的表达能力随模态数量变化,提出Hadamard-CLIP模型,实现任意数量模态联合分布的通用近似且保留CLIP的检索优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15062 2026-08-19 cs.CL cs.LG 版本更新 57%

RecurrentGPT: Expressive Depth through Recurrent Modulation in Transformers

RecurrentGPT:通过Transformer中的循环调制实现表达性深度

Amr Hegazy, Amr Alanwar, Mostafa Elhoushi

机构 * The German University in Cairo(开罗德国大学) Technical University of Munich(慕尼黑工业大学) Cerebras Systems Inc.(赛布拉斯系统公司)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.LG

AI总结 本文提出RecurrentGPT,通过循环调制解决Transformer语言模型表达性与内存效率的矛盾,在多约束下优于基线模型,实现参数与内存的高效利用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03553 2026-08-19 cs.AI cs.CL cs.DL 版本更新 57%

Chronos: The AI Co-Historian

迈向AI历史学家:从原始资料中进行代理信息提取

Lorenz Hufe, Niclas Griesshaber, Gavin Greif, Sebastian Oliver Eck, Pieter Francois, Wojciech Samek, Christian Schroeder de Witt, Philip Torr

机构 * Torr Vision Group, Department of Engineering Science, University of Oxford(牛津大学工程科学系托尔视觉组) Oxford Centre for Economic and Social History, University of Oxford(牛津大学牛津经济与社会史中心) Faculty of Music, University of Oxford(牛津大学音乐学院) Fraunhofer HHI(弗劳恩霍夫海因里希·赫兹研究所)

专题命中 VLM训练与架构 :VLM(abstract_cn);分类 cs.AI

AI总结 本文介绍Chronos项目首个模块,通过自然语言交互将历史文献图像转化为数据,允许历史学家自定义流程、评估模型性能并迭代优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15962 2026-08-18 cs.CL cs.CV 新提交 57%

SEER: Long-Context Reasoning via Selective Visual-Text Compression

SEER:基于选择性视觉-文本压缩的长上下文推理

Jiawei Xu, Zhilin Zhai, Jinrui Fang, Ruohan Xu, Mingfei Lu, Yi Zhang, Guanchu Wang, Tianlong Chen, Ying Ding

机构 * The University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Cambridge(剑桥大学) University of Technology Sydney(悉尼科技大学) The University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 SEER是结合视觉压缩效率与文本推理精度的框架,经监督微调后在LongBench等长上下文基准测试中,准确率优于Glyph-9B、Qwen3-8B等基线模型,可提升提取精度并保留提示token节省量。

Comments COLM 2026, Third Conference on Language Modeling

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15651 2026-08-18 cs.CV 新提交 57%

Gaussian-JEPA: Joint-Embedding Predictive Learning for 3D Gaussian Splats

Gaussian-JEPA:面向3D高斯溅射的联合嵌入预测学习

Bin Ren, Qi Ma, Yue Li, Zongyan Han, Yidi Li, Yuqian Fu, Rao Muhammad Anwer, Theo Gevers, Fahad Shahbaz Khan, Salman Khan

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV

AI总结 提出Gaussian-JEPA,通过预测高斯令牌块潜在表示实现自监督学习,在多类任务上优于重构预训练,为3D高斯表示提供有效学习目标

Comments Joint-embedding predictive representation learning for 3D Gaussian Splatting

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15058 2026-08-18 cs.CV 新提交 57%

MEDR: Query-Independent Frame Selection via Multi-Signal Event Modeling and Dynamic Rescoring

MEDR:基于多信号事件建模与动态重评分的查询无关帧选择

Xinlei Pu, Weijie Shi, Wen Yang, Yi Cao, Hao Chen, Yuanjun Liu, Wenwei Ding, Jia Zhu, Jiajie Xu

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 该研究提出无需训练的MEDR帧选择方法,通过多信号事件建模与动态重评分实现查询无关,在Video-MME等基准上提升了多模态大语言模型的长视频处理准确率,且帧集可跨问题复用。

Comments 9 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09105 2026-08-18 cs.AI 版本更新 57%

SMA: Who Said That? Auditing Membership Leakage in Semi-Black-box RAG Controlling

SMA:谁说的?半黑盒RAG控制中的成员泄露审计

Shixuan Sun, Siyuan Liang, Jianjie Huang, Jingzhi Li, Xiaochun Cao

机构 * Sun Yat-Sen University(孙中山大学) Nanyang Technological University(南洋理工大学) University of Chinese Academy of Science(中国科学院大学) Zhongguancun Academy(中关村学院) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)

专题命中 VLM训练与架构 :MLLM(abstract_cn);分类 cs.AI

AI总结 本研究针对半黑盒RAG控制中的成员泄露问题,提出首个源感知成员审计SMA,通过零阶优化归因估计机制与跨模态归因技术,实现生成内容的细粒度来源归因,为复杂生成系统的数据来源审计提供新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18455 2026-08-14 stat.ML cs.IT cs.LG math.IT 版本更新 57%

Multiview Representation Learning via Distributed Joint Latent Space Structuring

基于分布式联合隐空间构建的多视图表示学习

Milad Sefidgaran, Piotr Krasnowski, Abdellatif Zaidi

机构 * Huawei Paris Research Center, France(华为巴黎研究中心,法国)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.LG

AI总结 该研究针对分布式多视图表示学习的客户端协调问题,推导了基于MDL的泛化界,提出分布式高斯乘积混合先验方法,经多组实验验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11715 2026-08-13 cs.CL cs.AI 新提交 57%

When the API Speaks the Wrong Language: Revisiting Post-Training for Multilingual Tool Use

当API“说错”语言:重新审视多语言工具使用的后训练

Siddharth Chauhan, Thomas Butler, Abhishek Singhania, Pankaj Porwal, Honey Gupta

机构 * Amazon(亚马逊)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 针对多语言API调用中存在的参数语言不匹配问题,研究发现监督微调可实现接近或优于复杂强化学习方法的性能,强化学习仅能提供渐进式改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11676 2026-08-13 cs.AI 新提交 57%

XBridge: Entity-Grounded Latent Bridge for Heterogeneous LLM Communication

XBridge:面向异构大语言模型通信的实体锚定隐空间桥接器

Wooseong Yang, Wei-Chieh Huang, Weizhi Zhang, Yu Wang, Philip S. Yu, Junhyun Lee

机构 * Hankuk University of Foreign Studies(韩国外国语大学) Noah’s Farm(诺亚农场) University of Illinois Chicago(伊利诺伊大学芝加哥分校) Capital One AI Foundations(Capital One AI 基金会)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 XBridge是免解码的异构大语言模型通信协议,通过词汇锚定映射和隐空间丰富桥接器解决跨架构通信的实体身份丢失问题,在多模型、多基准测试中表现优于现有方法,参数开销低。

Comments 18 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏