arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5058 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5058 篇

2506.11538 2026-04-06 cs.IR 50%

Dual-Perspective Disentangled Multi-Intent Alignment for Enhanced Collaborative Filtering

双视角解耦多意图对齐用于增强协同过滤

Shanfan Zhang, Yongyi Lin, Yuan Rao, Bingcan Xia, Tingting Xin, Chenlong Zhang

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 本文提出DMICF框架,通过双视角解耦多意图对齐方法,提升协同过滤的推荐效果,解决异构交互信号纠缠导致的语义模糊、鲁棒性差和可解释性不足问题。

Comments 11 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01155 2026-04-02 cs.SD 50%

FineLAP: Taming Heterogeneous Supervision for Fine-grained Language-Audio Pretraining

FineLAP: 通过异质监督驯化细粒度语言-音频预训练

Xiquan Li, Xuenan Xu, Ziyang Ma, Wenxi Chen, Haolin He, Qiuqiang Kong, Xie Chen

机构 * X-LANCE Lab, Shanghai Jiao Tong University(上海交通大学X-LANCE实验室) SJTU Paris Elite Institute of Technology, Shanghai Jiao Tong University(上海交通大学巴黎卓越工程师学院) Shanghai Innovation Institute(上海创新研究院) The Chinese University of Hong Kong(香港中文大学)

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 本文提出FineLAP,一种新型预训练范式,通过异质数据提升CLAP在clip和frame级对齐能力,引入双流sigmoid损失和聚类采样策略,结合大规模合成SED数据集,实现多任务SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04822 2026-04-02 cs.CL 50%

Evaluating Vision-Language and Large Language Models for Automated Student Assessment in Indonesian Classrooms

评估视觉语言和大语言模型用于印度尼西亚课堂自动学生评估

Nurul Aisyah, Muhammad Dehan Al Kautsar, Arif Hidayat, Raqib Chowdhury, Fajri Koto

机构 * Quantic School of Business and Technology(Quantic商业与技术学院) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Indonesia University of Education(印度尼西亚教育大学) Monash University(莫纳什大学)

专题命中 VLM训练与架构 :VLM(abstract)

AI总结 研究评估了视觉语言和大语言模型在印尼课堂中的自动学生评估效果,发现VLM在手写识别上存在困难,但LLM反馈仍具教学价值。

Comments Accepted at AIED 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28058 2026-03-31 cs.MM 50%

Is One-Shot In-Context Learning Helpful for Data Selection in Task-Specific Fine-Tuning of Multimodal LLMs?

在情境学习中选择数据是否有助于多模态大语言模型任务特定微调中的数据选择?

Xiao An, Jiaxing Sun, Ting Hu, Wei He

专题命中 VLM训练与架构 :multimodal large language model(abstract)

AI总结 本文提出CLIPPER方法,通过情境学习选择数据,提高多模态大语言模型任务特定微调的效率,实验表明其在数据效率和计算成本上优于现有方法。

Comments Accepted by ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16212 2026-03-26 cs.RO 50%

Point Bridge: 3D Representations for Cross Domain Policy Learning

点桥:跨领域策略学习的3D表示

Siddhant Haldar, Lars Johannsmeier, Lerrel Pinto, Abhishek Gupta, Dieter Fox, Yashraj Narang, Ajay Mandlekar

机构 * NVIDIA New York University(纽约大学) University of Washington(华盛顿大学)

专题命中 VLM训练与架构 :vision-language model(abstract)

AI总结 点桥通过统一的点表示实现跨领域策略学习,利用视觉语言模型提取点表示,结合Transformer策略学习,无需显式视觉或物体对齐,提升仿真到现实的零样本迁移性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19771 2026-03-23 cs.CL 50%

Neither Here Nor There: Cross-Lingual Representation Dynamics of Code-Mixed Text in Multilingual Encoders

既非此处亦非彼处:多语言编码器中混合语言文本的跨语言表示动态

Debajyoti Mazumder, Divyansh Pathak, Prashant Kodali, Jasabanta Patro

机构 * Indian Institute of Science Education and Research(印度科学教育与研究学院) Microsoft Corporation(微软公司)

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 研究探讨多语言编码器对混合语言文本的内部表示,发现标准模型在英语和印地语间表现良好,但混合文本与任一语言连接松散。通过训练混合数据可提升英语混合文本对齐,但损害英语-印地语对齐。引入三语后训练目标,使混合文本表示更接近构成语言,提升跨语言理解。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11397 2026-03-13 cs.SD 50%

Edge-Cloud Collaborative Speech Emotion Captioning via Token-Level Speculative Decoding in Audio-Language Models

边缘-云协同语音情绪描述 via 令牌级推测解码在音频-语言模型中

Xiangyuan Xue, Jiajun Lu, Yan Gao, Gongping Huang, Ting Dang, Hong Jia

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 本文提出基于不确定性引导推测解码的边缘-云协同框架,通过轻量级边缘模型和云验证器的协同,提升语音情绪描述的准确率和效率,同时降低延迟和隐私风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10877 2026-03-12 cs.CL 50%

From Images to Words: Efficient Cross-Modal Knowledge Distillation to Language Models from Black-box Teachers

从图像到词语:高效的跨模态知识蒸馏用于从黑盒教师模型向语言模型转移

Ayan Sengupta, Shantanu Dixit, Md Shad Akhtar, Tanmoy Chakraborty

机构 * Indian Institute of Technology Delhi, India(印度德里印度理工学院) Indraprastha Institute of Information Technology Delhi, India(印度德里印度信息科技学院)

专题命中 VLM训练与架构 :vision-language model(abstract)

AI总结 本文提出ARMADA框架,通过高效的跨模态知识蒸馏方法,从黑盒视觉-语言模型向语言模型转移知识,实现性能提升且无需昂贵预训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08303 2026-03-10 cs.HC 50%

Do Models See in Line with Human Vision? Probing the Correspondence Between LVLM Representations and EEG Signals

模型的视觉感知是否与人类视觉一致?探测LVLM表示与EEG信号之间的对应关系

Xin Xiao, Yang Lei, Haoyang Zeng, Xiao Sun, Xinyi Jiang, Yu Tian, Hao Wu, Kaiwen Wei, Jiang Zhong

专题命中 VLM训练与架构 :vision language model(abstract)

AI总结 本文通过EEG信号分析,揭示了LVLM的视觉表示与人类大脑的对应关系,发现中间层与EEG活动对齐,多模态架构提升大脑对齐性,且视觉表现强的模型EEG相似性更高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14106 2026-03-10 cs.CL 50%

Stealth Fine-Tuning: Efficiently Breaking Alignment in RVLMs Using Self-Generated CoT

隐形微调:通过自动生成的CoT打破RVLMs的对齐

Le Yu, Zhengyue Zhao, Yawen Zheng, Yunhao Liu

机构 * Machine Intelligence Laboratory, Sichuan University(四川大学人工智能实验室) University of Wisconsin--Madison(威斯康星大学麦迪逊分校) Department of Automation, Tsinghua University(清华大学自动化系) Global Innovation Exchange, Tsinghua University(清华大学全球创新交流中心)

专题命中 VLM训练与架构 :vision-language model(abstract)

AI总结 本文提出隐形微调方法,通过分段干扰和自动生成输出,有效绕过RVLMs的安全对齐防御,实现更高的ASR性能同时保持推理能力。

Comments 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03957 2026-03-05 cs.RO 50%

ArthroCut: Autonomous Policy Learning for Robotic Bone Resection in Knee Arthroplasty

ArthroCut:膝关节置换术中机器人骨切除的自主策略学习

Xu Lu, Yiling Zhang, Wenquan Cheng, Longfei Ma, Fang Chen, Hongen Liao

机构 * School of Biomedical Engineering, Tsinghua University(清华大学生物医学工程学院) School of Biomedical Engineering, Shanghai Jiao Tong University(上海交通大学生物医学工程学院) Longwood Valley MedTech

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 ArthroCut通过结合术前和术中数据,实现膝关节置换术中骨切除的自主策略学习,提升机器人手术的自主性和可解释性。

Comments Accepted for publication at the 2026 IEEE International Conference on Robotics and Automation (ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23648 2026-03-02 cs.RO 50%

FAVLA: A Force-Adaptive Fast-Slow VLA model for Contact-Rich Robotic Manipulation

FAVLA:一种力适应的快速-慢速VLA模型用于接触丰富的机械臂操作

Yao Li, Peiyuan Tang, Wuyang Zhang, Chengyang Zhu, Yifan Duan, Weikai Shi, Xiaodong Zhang, Zijiang Yang, Jianmin Ji, Yanyong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Xi'an Jiaotong University(西安交通大学) Central South University(中南大学)

专题命中 VLM训练与架构 :VLM(abstract)

AI总结 FAVLA通过解耦慢感知规划与快速接触感知控制,提升接触丰富任务中的反应性和成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.15226 2026-02-27 cs.MM cs.CL 50%

Not All Attention is Needed: Parameter and Computation Efficient Transfer Learning for Multi-modal Large Language Models

并非所有注意力都是必需的:面向多模态大语言模型的参数和计算高效迁移学习

Qiong Wu, Weihao Ye, Yiyi Zhou, Xiaoshuai Sun, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China(教育部多媒体可信感知与高效计算重点实验室) Institute of Artificial Intelligence, Xiamen University(厦门大学人工智能研究院)

专题命中 VLM训练与架构 :MLLM(abstract)

AI总结 本文提出高效注意力跳过方法,通过减少冗余注意力计算提升多模态大语言模型的推理效率与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06063 2026-02-25 cs.DC 50%

Mapping Gemma3 onto an Edge Dataflow Architecture

将Gemma3映射到边缘数据流架构上

Shouyu Du, Miaoxiang Yu, Zhenyu Xu, Zhiheng Ni, Jillian Cai, Qing Yang, Tao Wei

专题命中 VLM训练与架构 :VLM(abstract)

AI总结 本文提出将Gemma3模型高效部署到边缘数据流架构上,通过硬件感知技术提升推理速度和能效,实现低功耗的LLM和VLM边缘推理。

Comments Original Version, data shall be updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19058 2026-02-24 cs.CL 50%

Do LLMs and VLMs Share Neurons for Inference? Evidence and Mechanisms of Cross-Modal Transfer

大型语言模型和视觉语言模型是否共享神经元进行推理?证据和跨模态转移的机制

Chenhang Cui, An Zhang, Yuxin Chen, Gelei Deng, Jingnan Zheng, Zhenkai Liang, Xiang Wang, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学) Nanyang Technological University(南洋理工大学)

专题命中 VLM训练与架构 :vision-language model(abstract)

AI总结 本文研究了大型语言模型和视觉语言模型在推理过程中共享神经元的现象,提出SNRF框架实现低秩融合,提升多模态推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23575 2026-02-24 cs.RO 50%

Generalizable Coarse-to-Fine Robot Manipulation via Language-Aligned 3D Keypoints

可泛化的粗到细机器人操作 via 语言对齐的3D关键点

Jianshu Hu, Lidi Wang, Shujia Li, Yunpeng Jiang, Xiao Li, Paul Weng, Yutong Ban

专题命中 VLM训练与架构 :VLM(abstract)

AI总结 CLAP通过任务分解、VLM微调和3D感知表示,提升机器人操作在新指令和环境下的泛化能力,实现更高的样本效率和操作精度。

Comments Published in ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16584 2026-02-19 q-bio.NC 50%

The Representational Alignment Hypothesis: Evidence for and Consequences of Invariant Semantic Structure Across Embedding Modalities

表征对齐假说:跨嵌入模态的不变语义结构的证据及其后果

Akhil Ramidi, Kevin Scharp

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 该研究提出表征对齐假说,探讨跨模态嵌入的不变语义结构,质疑其根本性,并提出新的哲学视角和区分方法。

Comments 23 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14438 2026-02-17 cs.RO cs.MA 50%

RoboSolver: A Multi-Agent Large Language Model Framework for Solving Robotic Arm Problems

RoboSolver: 一种基于多智能体大语言模型的机器人臂问题求解框架

Hamid Khabazi, Ali F. Meghdari, Alireza Taheri

专题命中 VLM训练与架构 :VLM(abstract)

AI总结 RoboSolver通过多智能体框架结合LLM和VLM,实现机器人臂问题的自动求解,准确率达0.97。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13591 2026-02-17 cs.RO 50%

AgentRob: From Virtual Forum Agents to Hijacked Physical Robots

AgentRob: 从虚拟论坛代理到被劫持的物理机器人

Wenrui Liu, Yaxuan Wang, Xun Zhang, Yanshu Wang, Jiashen Wei, Yifan Xiang, Yuhang Wang, Mingshen Ye, Elsie Dai, Zhiqi Liu, Yingjie Xu, Xinyang Chen, Hengzhe Sun, Jiyu Shen, Jingjing He, Tong Yang

机构 * Peking University(北京大学)

专题命中 VLM训练与架构 :VLM(abstract)

AI总结 AgentRob通过模型上下文协议连接虚拟论坛与物理机器人,实现多代理协作控制,展示了论坛驱动的多机器人协调可行性。

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10740 2026-02-12 cs.CL 50%

Reinforced Curriculum Pre-Alignment for Domain-Adaptive VLMs

强化课程预对齐用于领域自适应视觉-语言模型

Yuming Yan, Shuo Yang, Kai Tang, Sihong Chen, Yang Zhang, Ke Xu, Dan Hu, Qun Yu, Pengfei Hu, Edith C. H. Ngai

机构 * Tencent(腾讯)

专题命中 VLM训练与架构 :vision-language model(abstract)

AI总结 本文提出RCPA方法,通过课程意识的渐进调节机制,在领域自适应中平衡领域知识获取与通用能力保持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04482 2026-02-11 cs.HC 50%

ProAgentBench: Evaluating LLM Agents for Proactive Assistance with Real-World Data

ProAgentBench:基于真实数据评估LLM代理的前瞻性帮助

Yuanbo Tang, Huaze Tang, Tingyu Cao, Lam Nguyen, Anping Zhang, Xinwen Cao, Chunkang Liu, Wenbo Ding, Yang Li

专题命中 VLM训练与架构 :VLM(abstract)

AI总结 ProAgentBench通过真实用户数据构建基准,评估LLM代理在连续工作流程中的前瞻性帮助能力,揭示真实数据对预测准确性的提升作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25682 2026-02-10 cs.CL 50%

PairUni: Pairwise Training for Unified Multimodal Language Models

PairUni: 用于统一多模态语言模型的成对训练

Jiani Zheng, Zhiyang Teng, Kunpeng Qiu, Xiangtai Li, Anran Wang, Yu Tian, Ye Tian, Haochen Wang, Zhuochen Wang

机构 * ByteDance(字节跳动)

专题命中 VLM训练与架构 :vision-language model(abstract)

AI总结 PairUni通过成对训练提升统一多模态语言模型的理解与生成能力,采用配对数据集和PairGRPO算法实现更有效的策略学习。

Comments 22 pages, 11 figures, and 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04617 2026-02-05 cs.CL 50%

LEAD: Layer-wise Expert-aligned Decoding for Faithful Radiology Report Generation

LEAD:逐层专家对齐解码以生成准确的放射学报告

Ruixiao Yang, Yuanhe Tian, Xu Yang, Huiqi Li, Yan Song

专题命中 VLM训练与架构 :vision language model(abstract)

AI总结 LEAD通过逐层专家对齐解码方法,提升放射学报告生成的准确性并减少幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01640 2026-02-03 cs.CL 50%

A2Eval: Agentic and Automated Evaluation for Embodied Brain

A2Eval: 基于代理的自动评估用于具身脑

Shuai Zhang, Jiayu Hu, Zijie Chen, Zeyuan Ding, Yi Zhang, Yingji Zhang, Ziyi Zhou, Junwei Liao, Shengjie Zhou, Yong Dai, Zhenzhong Lan, Xiaozhu Ju

机构 * Zhejiang University, China(浙江大学) Westlake University, China(西湖大学) Beijing Innovation Center of Humanoid Robotics, China(北京人形机器人创新中心) University of Manchester, UK(曼彻斯特大学) Southern University of Science(南方科技大学) Xiamen University Malaysia, Malaysia(厦门大学马来西亚分校)

专题命中 VLM训练与架构 :VLM(abstract)

AI总结 A2Eval提出首个基于代理的自动评估框架,通过两个协作代理自动化基准编纂和评估,显著提升评估效率并减少成本,同时保持高保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01067 2026-02-03 cs.RO 50%

A Systematic Study of Data Modalities and Strategies for Co-training Large Behavior Models for Robot Manipulation

对大型行为模型在机器人操作中协同训练数据模态和策略的系统研究

Fanqi Lin, Kushal Arora, Jean Mercat, Haruki Nishimura, Paarth Shah, Chen Xu, Mengchao Zhang, Mark Zolotas, Maya Angeles, Owen Pfannenstiehl, Andrew Beaulieu, Jose Barreiros

机构 * Toyota Research Institute, Cambridge MA(丰田研究院) Tsinghua University, Beijing, China(清华大学)

专题命中 VLM训练与架构 :vision-language model(abstract)

AI总结 本文研究了机器人操作中协同训练不同数据模态和策略对行为模型性能的影响,发现视觉语言和跨身体数据显著提升泛化能力,而离散动作令牌无明显优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20262 2026-01-29 cs.RO 50%

Shallow-π: Knowledge Distillation for Flow-based VLAs

Shallow-π:基于流的视觉-语言-动作模型的知识蒸馏

Boseong Jeon, Yunho Choi, Taehan Kim

机构 * Samsung Research South Korea(三星韩国研究)

专题命中 VLM训练与架构 :VLM(abstract)

AI总结 Shallow-π通过知识蒸馏显著减少基于流的VLA模型的transformer深度,实现更快的推理速度和更高的性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09852 2026-01-27 cs.CL 50%

Bears, all bears, and some bears. Language Constraints on Language Models' Inductive Inferences

熊、所有熊,以及一些熊。语言模型归纳推理中的语言约束

Sriram Padmanabhan, Siyuan Song, Kanishka Misra

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 VLM训练与架构 :vision language model(abstract)

AI总结 该研究探讨了视觉语言模型在区分不同归纳推理类型时的语言约束,通过实验发现模型与人类在行为上具有一致性,差异源于归纳约束而非表层形式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16615 2026-01-26 cs.CL 50%

AuroraEdge-V-2B: A Faster And Stronger Edge Visual Large Language Model

AuroraEdge-V-2B: 一种更快更强大的边缘视觉大语言模型

Xiang Chen

机构 * Independent Researcher(独立研究者)

专题命中 VLM训练与架构 :InternVL(abstract)

AI总结 AuroraEdge-V-2B是一种为边缘部署设计的高性能视觉大语言模型,具有紧凑参数、高速推理和强大性能的特点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14714 2026-01-22 cs.IR 50%

Unified Multimodal and Multilingual Retrieval via Multi-Task Learning with NLU Integration

通过多任务学习与NLU集成实现统一的多模态和多语言检索

Xinyuan Zhang, Lina Zhang, Lisung Chen, Guangyao Liu, Shuai Nie, Jiaming Xu, Runyu Shi, Ying Huang, Guoquan Zhang

专题命中 VLM训练与架构 :vision language model(abstract)

AI总结 本文提出通过多任务学习与NLU集成实现统一的多模态和多语言检索,提升跨语言和跨模态的检索效率与准确性。

Comments 4 pages, 2 figures, submitted to IEEE ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14121 2026-01-21 cs.CL 50%

NewsRECON: News article REtrieval for image CONtextualization

NewsRECON: 用于图像上下文化的新闻文章检索

Jonathan Tonglet, Iryna Gurevych, Tinne Tuytelaars, Marie-Francine Moens

机构 * Ubiquitous Knowledge Processing Lab (UKP Lab), Department of Computer Science, TU Darmstadt and National Research Center for Applied Cybersecurity ATHENE(通用知识处理实验室(UKP实验室)、计算机科学系、图恩大学(TU Darmstadt)和应用网络安全国家研究中心ATHENE) Department of Electrical Engineering, KU Leuven(电气工程系、鲁汶大学) Department of Computer Science, KU Leuven(计算机科学系、鲁汶大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract)

AI总结 NewsRECON通过链接图像与相关新闻文章,利用元数据推断图像日期和位置,优于现有方法并结合多模态大语言模型实现新的SOTA结果。

Comments Preprint under review. Code available at https://github.com/jtonglet/arxiv2025-newsrecon

详情

展开后加载摘要…

URL PDF HTML 收藏