arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5084 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5084 篇

2604.24921 2026-04-29 cs.RO cs.AI cs.CL cs.CV 62%

Libra-VLA: Achieving Learning Equilibrium via Asynchronous Coarse-to-Fine Dual-System

Libra-VLA:通过异步粗到细双系统实现学习平衡

Yifei Wei, Linqing Zhong, Yi Liu, Yuxiang Lu, Xindong He, Maoqing Yao, Guanghui Ren

机构 * Beihang University(北航) AgiBot

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 Libra-VLA通过粗到细双系统架构,解决视觉-语言-动作模型在机器人操作中语义与动作间的鸿沟问题,实现训练平衡与高效执行。

Comments Accepted to the Main Conference of ACL 2026. Project page: https://libra-vla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23701 2026-04-28 cs.CL cs.AI cs.CV 62%

Agri-CPJ: A Training-Free Explainable Framework for Agricultural Pest Diagnosis Using Caption-Prompt-Judge and LLM-as-a-Judge

Agri-CPJ:一种无需训练的可解释框架,用于利用Caption-Prompt-Judge和LLM-as-a-Judge进行农业害虫诊断

Wentao Zhang, Qi Zhang, Mingkun Xu, Mu You, Henghua Shen, Zhongzhi He, Keyan Jin, Derek F. Wong, Tao Fang

机构 * Business School, Shandong University of Technology(山东理工大学商学院) Faculty of Data Science, City University of Macau(澳门城市大学数据科学学院) Guangdong Institute of Intelligent Science and Technology(广东智能科学与技术研究院) Macau Millennium College(澳门 millennium 学院) Department of Computer and Information Science, University of Macau(澳门大学计算机与信息科学系)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Agri-CPJ框架,通过生成结构化形态描述并利用LLM进行判断,解决农业病害诊断中模型易产生错误物种名称和推理不可用的问题,实验显示其在病害分类和问答评分上有显著提升。

Comments This work is an expanded version of our prior paper published in the IEEE ICASSP 2026 conference arXiv:2512.24947, from 4 to 20+ pages, presenting a well-structured and principled framework, extensive experiments, and deeper insights. Tao Fang is the corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20409 2026-04-22 cs.CV cs.LG 62%

CLIPoint3D: Language-Grounded Few-Shot Unsupervised 3D Point Cloud Domain Adaptation

CLIPoint3D: 基于语言的少样本无监督3D点云领域适应

Mainak Singha, Sarthak Mehrotra, Paolo Casari, Subhasis Chaudhuri, Elisa Ricci, Biplab Banerjee

机构 * University of Trento(特伦托大学) MDSR Labs Adobe(Adobe MDSR实验室) IIT Bombay(印度理工学院班加罗尔分校) Fondazione Bruno Kessler(布鲁诺·科斯勒基金会)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本文提出CLIPoint3D,首个基于CLIP的3D点云无监督领域适应框架,通过知识驱动的提示调优和熵引导视图采样策略,实现跨领域3D点云适应,实验表明在PointDA-10和GraspNetPC-10基准上性能提升3-16%。

Comments Accepted in CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18757 2026-04-22 cs.CV cs.AI 62%

REVEAL: Multimodal Vision-Language Alignment of Retinal Morphometry and Clinical Risks for Incident AD and Dementia Prediction

REVEAL:多模态视图-语言对齐的视网膜形态学与临床风险预测

Seowung Leem, Lin Gu, Chenyu You, Kuang Gong, Ruogu Fang

机构 * J. Crayton Pruitt Family Department of Biomedical Engineering, University of Florida(佛罗里达大学J. Crayton Pruitt家族生物医学工程系) Research Institute of Electrical Communication, Tohoku University(东北大学电气通信研究所) Department of Applied Mathematics & Statistics, Stony Brook University(石溪大学应用数学与统计学系) Department of Computer Science, Stony Brook University(石溪大学计算机科学系)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 REVEAL通过多模态对齐视网膜形态学与临床风险因素,提前8年预测阿尔茨海默病和痴呆症,优于现有模型。

Comments Accepted for publication a MIDL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17274 2026-04-21 cs.CV cs.AI 62%

Instinct vs. Reflection: Unifying Token and Verbalized Confidence in Multimodal Large Models

本能与反思:统一令牌和 verbalized 自信在多模态大模型中

Yunkai Dang, Yifan Jiang, Yizhu Jiang, Anqi Chen, Wenbin Li, Yang Gao

机构 * School of Artificial Intelligence, Nanjing University(南京大学人工智能学院)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文研究多模态大模型响应自信估计的本能-反思不一致问题,提出融合框架和均值对齐方法,提升校准和失败预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17209 2026-04-21 cs.CV cs.AI eess.SP 62%

DREAM: Dynamic Retinal Enhancement with Adaptive Multi-modal Fusion for Expert Precision Medical Report Generation

DREAM:动态视网膜增强与自适应多模态融合用于专家精准医疗报告生成

Nagur Shareef Shaik, Teja Krishna Cherukuri, Dong Hye Ye

机构 * Department of Computer Science, Georgia State University(佐治亚州立大学计算机科学系)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 DREAM通过动态多模态融合提升视网膜图像医疗报告生成精度,在数据有限时仍能生成高质量报告,实现BLEU-4 0.241的SOTA表现。

Comments Accepted at the IEEE Engineering in Medicine and Biology Society Annual International Conference (Proceedings of the 48th International Conference), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16883 2026-04-21 cs.LG cs.AI 62%

SinkRouter: Sink-Aware Routing for Efficient Long-Context Decoding in Large Language and Multimodal Models

SinkRouter: 为大语言和多模态模型高效长上下文解码的感知路由

Junnan Liu, Xinyan Liu, Peifeng Gao, Zhaobo Qi, Beichen Zhang, Weigang Zhang, Antoni Bert Chen

机构 * Harbin Institute of Technology (Weihai)(哈尔滨工业大学(威海)) University of Hong Kong(香港大学) City University of Hong Kong(城市大学)

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SinkRouter,通过感知路由机制提升长上下文解码效率,减少计算冗余,实现在512K上下文下的2.03倍加速,保持高精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03295 2026-04-17 cs.CL cs.AI cs.CV 62%

POP: Prefill-Only Pruning for Efficient Large Model Inference

POP:仅预填充剪枝用于高效大模型推理

Junhui He, Zhihui Fu, Jun Wang, Qingan Li

机构 * Wuhan University(武汉大学) OPPO Research Institute(OPPO研究院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出POP剪枝方法,通过区分预填充和解码阶段,仅剪枝深度层以提升预填充效率,保留完整模型用于解码,实现1.37倍的预填充延迟提升且性能损失小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14016 2026-04-16 cs.LG cs.AI 62%

MAny: Merge Anything for Multimodal Continual Instruction Tuning

MAny:为多模态连续指令微调合并任何内容

Zijian Gao, Wangwang Jia, Xingxing Zhang, Pengfei Qian, Tao Sun, Bo Ding, Yong Dou, Huaimin Wang, Kele Xu

机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院) National Key Laboratory of Parallel and Distributed Computing, National University of Defense Technology(国防科技大学并行与分布式计算国家重点实验室) State Key Laboratory of Complex & Critical Software Environment(复杂与关键软件环境国家重点实验室) School of Computer Science, Tsinghua University(清华大学计算机科学与技术系)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.AI、cs.LG

AI总结 针对多模态连续指令微调中感知漂移和推理崩溃问题,提出MAny框架,通过跨模态投影合并和低秩参数合并实现任务知识融合,提升模型鲁棒性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13561 2026-04-16 cs.CV cs.AI 62%

CLIP Architecture for Abdominal CT Image-Text Alignment and Zero-Shot Learning: Investigating Batch Composition and Data Scaling

CLIP架构用于腹部CT图像-文本对齐和零样本学习:研究批量组成和数据缩放

Shivika, Kartik Bose, Pankaj Gupta

机构 * Department of Radiodiagnosis(放射诊断部门)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文研究了CLIP架构在腹部CT图像-文本对齐和零样本学习中的效果,探讨了训练批量组成和数据缩放的影响,发现随机采样和交替批次比人工类平衡更有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11122 2026-04-14 cs.CV cs.AI 62%

Semantic-Geometric Dual Compression: Training-Free Visual Token Reduction for Ultra-High-Resolution Remote Sensing Understanding

语义-几何双压缩:无训练视觉令牌减少用于超高清遥感理解

Yueying Li, Fengxiang Wang, Yan Li, Mingshuo Chen, Mengying Zhao, Long Lan

机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院) School of Computer Science, Beijing University of Posts and Telecommunications(北京邮电大学计算机学院)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出DualComp框架,通过任务自适应双流令牌压缩方法,有效解决超高清遥感图像处理中视觉令牌过多导致的计算开销问题,提升处理效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11095 2026-04-14 cs.LG cs.AI 62%

Bottleneck Tokens for Unified Multimodal Retrieval

瓶颈令牌用于统一多模态检索

Siyu Sun, Jing Ren, Zhaohe Liao, Dongxiao Mao, Xiangyuan Ren, Yiyi Zhang, Haohua Zhao, Weixiong Lin, Jiang Shaohua, Liqing Zhang, Yuchao Zheng

机构 * Shanghai Jiao Tong University(上海交通大学) ByteDance(字节跳动)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出瓶颈令牌和生成信息压缩方法,解决多模态大语言模型在统一检索中的隐式池化和对比微调问题,提升语义压缩效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16333 2026-04-14 cs.CV cs.LG 62%

RL makes MLLMs see better than SFT

强化学习使多模态大语言模型比监督微调看得更清楚

Junha Song, Sangdoo Yun, Dongyoon Han, Jaegul Choo, Byeongho Heo

机构 * NAVER AI Lab(NAVER AI实验室)

专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.CV、cs.LG

AI总结 本文研究了强化学习在多模态大语言模型中的视觉编码器影响,发现RL能产生更精确的视觉表示,提出PIVOT方法提升视觉编码性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17574 2026-04-14 cs.CV cs.AI 62%

HumanVBench: Probing Human-Centric Video Understanding in MLLMs with Automatically Synthesized Benchmarks

HumanVBench: 通过自动合成基准测试探测多模态大语言模型中的以人为本的视频理解

Ting Zhou, Daoyuan Chen, Qirui Jiao, Bolin Ding, Yaliang Li, Ying Shen

机构 * Sun Yat-Sen University(中山大学) Alibaba Group(阿里巴巴集团) Peng Cheng Laboratory(鹏城实验室) Guangdong Provincial Key Laboratory of Fire Science and Intelligent Emergency Technology(广东省消防科学与智能应急技术重点实验室)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出HumanVBench,一个针对多模态大语言模型(MLLMs)中以人为本的视频理解能力的综合基准测试,通过自动化流程生成高质量视频注释和挑战性问题,揭示30个领先MLLMs在感知细微情绪和对齐语音与视觉线索方面的不足。

Comments Accepted as a conference paper at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07516 2026-04-14 cs.CL cs.AI cs.LG 62%

Controlling Multimodal Conversational Agents with Coverage-Enhanced Latent Actions

通过增强覆盖的潜在动作控制多模态对话代理

Yongqi Li, Hao Lang, Tieyun Qian, Yongbin Li

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Tongyi Lab(通义实验室) Zhongguancun Academy(中关村学院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过增强覆盖的潜在动作空间改进多模态对话代理的强化学习微调,利用跨模态投影器提升鲁棒性,在两个对话任务中优于基线方法。

Comments Accepted to ACL 2026 (Main), camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10297 2026-04-14 cs.CV cs.AI 62%

FashionMV: Product-Level Composed Image Retrieval with Multi-View Fashion Data

FashionMV:基于多视角时尚数据的产品级复合图像检索

Peng Yuan, Bingyin Mei, Hui Zhang

机构 * Tsinghua University(清华大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出FashionMV,首个大规模多视角时尚数据集,用于产品级复合图像检索。通过构建包含127K产品、472K多视角图像和220K三元组的数据集,结合ProCIR框架,采用多阶段对话、标题对齐和思维链引导等机制,提升了检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04563 2026-04-09 cs.CV cs.AI 62%

Temporal Inversion for Learning Interval Change in Chest X-Rays

时间倒置用于学习胸部X光片的区间变化

Hanbin Ko, Kyungmin Jeon, Doowoong Choi, Chang Min Park

机构 * Interdisciplinary Program in Bioengineering, Seoul National University Graduate School(首尔大学研究生院生物工程跨学科项目) Integrated Major in Innovative Medical Science, Seoul National University Graduate School(首尔大学研究生院创新医学科学综合专业) Dept. of Radiology, Seoul National University Hospital(首尔大学医院放射科) Seoul National University College of Medicine(首尔大学医学院) Inst. of Medical and Biological Engineering, Seoul National University Medical Research Center(首尔大学医学研究中心医学与生物工程研究所)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出TILA框架,通过时间倒置增强模型对时间变化的敏感性,改进了胸部X光片的区间变化检测与分类。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06079 2026-04-08 cs.CV cs.AI 62%

Scientific Graphics Program Synthesis via Dual Self-Consistency Reinforcement Learning

通过双自一致性强化学习实现科学图形程序合成

Juekai Lin, Yun Zhu, Honglin Lin, Sijing Li, Tianwei Lin, Zheng Liu, Xiaoyang Wang, Wenqiao Zhang, Lijun Wu

机构 * Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory, OpenDataLab(上海人工智能实验室,OpenDataLab) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出双自一致性强化学习框架,结合高质量数据集和多维基准,提升科学图形到可编辑TikZ代码的转换能力,实现视觉与结构的高精度优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10075 2026-04-08 cs.CV cs.GR cs.LG 62%

Thinking Like Van Gogh: Structure-Aware Style Transfer via Flow-Guided 3D Gaussian Splatting

像梵高一样思考:通过流引导的3D高斯点划法实现结构感知的风格迁移

Lebin Zhou, Jingchuan Xiao, Zhendong Wang, Jinhao Wang, Rongduo Han, Nam Ling, Cihan Ruan

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV、cs.LG

AI总结 本文提出一种流引导的3D高斯点划法框架,通过将二维艺术运动转换为三维高斯几何,实现结构感知的风格迁移,同时采用亮度-结构解耦策略和VLM-as-a-Judge评估框架,提升艺术真实感。

Comments 7 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05445 2026-04-08 cs.CL cs.AI cs.CV 62%

Learning What Matters: Dynamic Dimension Selection and Aggregation for Interpretable Vision-Language Reward Modeling

学习什么重要:可解释视觉语言奖励建模的动态维度选择与聚合

Qiyuan Chen, Hongsen Huang, Jiahe Chen, Qian Shao, Jintai Chen, Hongxia Xu, Renjie Hua, Chuan Ren, Jian Wu

机构 * Zhejiang University(浙江大学) Soochow Securities Co.,Ltd.(东吴证券股份有限公司) HKUST(GZ)(香港科技大学(广州)) Nanjing University(南京大学)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VL-MDR框架,通过动态分解评价为细粒度可解释维度,提升视觉语言奖励建模的可解释性与效率,实验显示其在基准测试中优于现有模型,并有效缓解视觉幻觉。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05831 2026-04-08 cs.LG cs.AI 62%

HeartcareGPT: A Unified Multimodal ECG Suite for Dual Signal-Image Modeling and Understanding

HeartcareGPT:一种统一的多模态ECG套件,用于双信号-图像建模与理解

Yihan Xie, Sijing Li, Tianwei Lin, Zhuonan Wang, Chenglin Yang, Yu Zhong, Wenjie Yan, Wenqiao Zhang, Xiaogang Guo, Jun Xiao, Yueting Zhuang, Beng Chin Ooi

机构 * Zhejiang University(浙江大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出HeartcareGPT,通过Dual Stream Projection Alignment机制,实现ECG信号与图像的统一建模,提升多视角ECG理解能力,并建立医学多模态大语言模型向生理信号领域扩展的方法论基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00727 2026-04-08 cs.LG cs.CR cs.CV 62%

Perturb and Recover: Fine-tuning for Effective Backdoor Removal from CLIP

扰动与恢复:用于从CLIP中有效移除后门的微调

Naman Deep Singh, Francesco Croce, Matthias Hein

机构 * University of Tübingen & Tübingen AI Center(蒂宾根大学 & 蒂宾根人工智能中心) EPFL(瑞士联邦理工学院洛桑)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本文提出PAR机制,通过微调有效移除CLIP中的后门,实验表明其在不同编码器和攻击类型上均能保持良好性能,且无需真实训练数据。

Comments CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03114 2026-04-06 cs.CV cs.AI 62%

Can VLMs Truly Forget? Benchmarking Training-Free Visual Concept Unlearning

VLMs真的能忘记吗?基于免训练的视觉概念反向学习基准测试

Zhangyun Tan, Zeliang Zhang, Susan Liang, Yolo Yunlong Tang, Lisha Chen, Chenliang Xu

机构 * University of Rochester(罗切斯特大学)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VLM-UnBench,首个评估VLM免训练视觉概念反向学习的基准,通过四层遗忘等级、七源数据集和十一概念轴,验证提示对概念抑制的真实效果,发现对象和场景概念最难抑制,提示级抑制与真实视觉概念擦除存在明显差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02689 2026-04-06 cs.CV cs.AI 62%

Efficient3D: A Unified Framework for Adaptive and Debiased Token Reduction in 3D MLLMs

Efficient3D: 一种用于3D多模态大语言模型中自适应和去偏token减少的统一框架

Yuhui Lin, Siyue Yu, Yuxing Yang, Guangliang Cheng, Jimin Xiao

机构 * Xi’an Jiaotong-Liverpool University(西交利物浦大学) University of Liverpool(利物浦大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Efficient3D框架,通过去偏视觉token重要性估计器和自适应token再平衡策略,实现3D MLLMs的高效推理,提升性能并降低计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02477 2026-04-06 cs.CV cs.LG 62%

Guideline2Graph: Profile-Aware Multimodal Parsing for Executable Clinical Decision Graphs

Guideline2Graph:面向可执行临床决策图的多模态解析

Onur Selim Kilic, Yeti Z. Gurbuz, Cem O. Yaldiz, Afra Nawar, Etrit Haxholli, Ogul Can, Eli Waxman

机构 * Georgia Institute of Technology(佐治亚理工学院) MetaDialog Infuse Inc(Infuse公司)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV、cs.LG

AI总结 本文提出一种多模态解析方法,通过拓扑感知分块、接口约束分块生成和溯源保留的全局聚合,将完整指南证据转换为可执行临床决策支持图。实验表明,该方法在前列腺指南基准上显著提升了精度和召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08980 2026-04-06 cs.CV cs.AI 62%

Training Multi-Image Vision Agents via End2End Reinforcement Learning

通过端到端强化学习训练多图像视觉代理

Chengqi Dong, Chuhuai Yue, Hang He, Rongge Mao, Fenghe Tang, S Kevin Zhou, Zekun Xu, Xiaohan Wang, Jiajun Chai, Guojun Yin

机构 * MeiTuan(美团) University of Science and Technology of China(中国科学技术大学)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出IMAgent,通过端到端强化学习训练视觉代理,解决多图像问答任务中的输入限制问题,通过设计视觉反思和验证工具提升模型注意力,首次从注意力角度揭示工具使用对性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02324 2026-04-03 cs.CL cs.AI cs.LG 62%

Grounded Token Initialization for New Vocabulary in LMs for Generative Recommendation

为生成推荐系统中的新词汇提供基础性词 token 初始化

Daiwei Chen, Zhoutong Fu, Chengming Jiang, Haichao Zhang, Ran Zhou, Tan Wang, Chunnan Yao, Guoyao Li, Rui Cai, Yihan Cao, Ruijie Jiang, Fedor Borisyuk, Jianqiang Shen, Jingwei Wu, Ramya Korlakai Vinayak

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) LinkedIn Corporation(领英公司) Northeastern University(东北大学) University of California, Davis(加州大学戴维斯分校)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出GTI方法,通过在预训练嵌入空间中语义地初始化新词汇,提升生成推荐系统性能,优于传统均值初始化和辅助任务适应方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02289 2026-04-03 cs.CV cs.AI 62%

Omni123: Exploring 3D Native Foundation Models with Limited 3D Data by Unifying Text to 2D and 3D Generation

Omni123:通过统一文本到2D和3D生成探索有限3D数据的3D原生基础模型

Chongjie Ye, Cheng Cao, Chuanyu Pan, Yiming Hao, Yihao Zhi, Yuanming Hu, Xiaoguang Han

机构 * FNii-Shenzhen(FNii-深圳) SSE, CUHK(SZ)(香港中文大学(深圳)理工学院) Meshy AI

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 Omni123通过统一文本到2D和3D生成,利用文本-图像-3D的跨模态一致性作为隐式约束,提升3D生成的几何一致性与语义对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01941 2026-04-03 cs.CV cs.AI 62%

Captioning Daily Activity Images in Early Childhood Education: Benchmark and Algorithm

在早期教育中的日常活动图像描述:基准和算法

Sixing Li, Zhibin Gu, Ziqi Zhang, Weiguo Pan, Bing Li, Ying Wang, Hongzhe Liu

机构 * School of Robotics, Beijing Union University(北京联合大学机器人学院) College of Computer and Cyber Security, Hebei Normal University(河北师范大学计算机与网络安全学院) Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所) National Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所模式识别国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences (UCAS)(中国科学院大学人工智能学院) PeopleAI, Inc.(人民人工智能公司) People Youhe Education Technology Co., Ltd.(人民优和教育科技有限公司)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出ECAC基准和RSRS算法,通过专家标注和细粒度标签提升早期教育图像描述的专业性,实验显示KinderMM-Cap-3B在TTS上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22294 2026-04-03 cs.CV cs.LG 62%

Structure is Supervision: Multiview Masked Autoencoders for Radiology

结构是监督:用于放射学的多视图掩码自编码器

Sonia Laguna, Andrea Agostini, Alain Ryser, Samuel Ruiperez-Campillo, Irene Cannistraci, Moritz Vandenhirtz, Stephan Mandt, Nicolas Deperrois, Farhad Nooralahzadeh, Michael Krauthammer, Thomas M. Sutter, Julia E. Vogt

机构 * Department of Computer Science, ETH Zurich(苏黎世联邦理工学院计算机科学系) Department of Computer Science, UC Irvine(加州大学尔湾分校计算机科学系) Department of Quantitative Biomedicine, University of Zurich(苏黎世大学定量生物医学系)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV、cs.LG

AI总结 本文提出多视图掩码自编码器(MVMAE),通过利用放射学研究的多视图结构学习视图不变和疾病相关表征,并在三个公开数据集上验证了其在疾病分类任务中的优越性能。

Journal ref Transactions on Machine Learning Research (TMLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏