arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46122 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4657 篇

2603.05754 2026-07-17 cs.RO 版本更新 50%

Safe-Night VLA: Seeing the Unseen via Thermal-Perceptive Vision-Language-Action Models for Safety-Critical Manipulation

Safe-Night VLA: 通过热感知视觉-语言-动作模型看见未见事物以实现安全关键操作

Dian Yu, Qingchuan Zhou, Bingkun Huang, Majid Khadiv, Zewen Yang

机构 * Munich Institute of Robotics and Machine Intelligence (MIRMI), Technical University of Munich (TUM)(慕尼黑机器人与机器智能研究所(MIRMI),技术大学慕尼黑(TUM))

专题命中 图文多模态 :multimodal(abstract)

AI总结 Safe-Night VLA通过整合热感知技术,实现了安全关键操作中的非可见领域感知与稳健执行。

Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13660 2026-07-16 cs.LG 新提交 50%

The Hyperspherical Geometry of CLIP Latent Space: A Semantic Mixture Model

CLIP 潜在空间的超球面几何:一种语义混合模型

Zijie Yu, Gaowen Liu, Ramana Rao Kompella, Philip S. Yu, Yue Song

机构 * Tsinghua University(清华大学) Cisco Research(思科研究院) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 图文多模态 :multimodal(abstract)

AI总结 研究 CLIP 潜在空间,提出基于冯·米塞斯-费舍尔分布混合的密度模型,用期望最大化算法学习,实现准确可解释的密度估计,改善长尾和分布外检测,建立几何一致的概率框架。

Comments 23 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10269 2026-07-14 cs.CR 新提交 50%

Devil in the Lens: Analyzing and Defending Physical Prompt Injection Against Vision-Language Models on Wearable Devices

镜头中的恶魔:分析并防御可穿戴设备上针对视觉语言模型的物理提示注入

Yaxin Li, Hao Wang, Yanda Shao, Shuhao Zhang, Yan Long

专题命中 图文多模态 :multimodal(abstract)

AI总结 研究针对可穿戴设备上视觉语言模型的物理提示注入攻击,利用真实环境照片分析出6种威胁向量及对12个模型的影响,攻击成功率高,还提出基于掩码的外部过滤器和基于语义向量的内部检测器两种防御策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04364 2026-07-14 cs.LG 版本更新 50%

RL Forgets! Towards Continual Policy Optimization

强化学习会遗忘!迈向持续策略优化

Mao-Lin Luo, Zhe-Xu Wang, Zi-Hao Zhou, Bo Ye, Jian Zhao, Min-Ling Zhang, Tong Wei

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Key Laboratory of Computer Network and Information Integration (Southeast University), Ministry of Education(教育部计算机网络和信息集成重点实验室(东南大学)) Zhongguancun Academy(中关村科学城公司) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院)

专题命中 图文多模态 :multimodal(abstract)

AI总结 研究持续训练中强化学习易遗忘问题,引入MRCL基准测试,提出持续策略优化框架CPO,通过参数移动正则化减少遗忘,多模型规模实验验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.09016 2026-07-10 cs.RO 版本更新 50%

Open-Vocabulary Object-Goal Navigation by Generalizing Semantic Mapping with Dense CLIP

通过用密集CLIP泛化语义映射实现开放词汇目标导航

Meng Wei, Chenyang Wan, Tai Wang, Yuqiang Yang, Wenzhe Cai, Yilun Chen, Hanqing Wang, Jiangmiao Pang, Xihui Liu

机构 * Shanghai AI Lab(上海人工智能实验室) The University of Hong Kong(香港大学) Zhejiang University(浙江大学)

专题命中 图文多模态 :cross-modal(abstract)

AI总结 研究面向对象的实体导航任务,提出OVExp框架,利用密集CLIP模型展示基于语义地图的目标预测网络泛化能力,设计跨模态转移策略解决训练成本高问题,在ObjectNav基准上对未知目标有强大泛化能力。

Comments Accepted by ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06987 2026-07-09 cs.LG 新提交 50%

UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma

UP:用于打破探索-稳定性困境的无界正不对称优化

Chongyu Fan, Pengfei Liu, Jingjia Huang, Sijia Liu, Yi Lin

机构 * ByteDance Seed(字节跳动种子) Michigan State University(密歇根州立大学)

专题命中 图文多模态 :multimodal(abstract)

AI总结 研究针对强化学习探索-稳定性困境,提出无界正不对称优化(UP)方法,通过特殊设计重组优化过程,在多种算法、模型架构及训练模式下增强探索能力,实现卓越推理精度,是通用即插即用的强化学习训练增强方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04816 2026-07-07 cs.RO 新提交 50%

CAC-VLA: Context-Gated Action Conditioning for Vision-Language-Action Models

CAC-VLA:用于视觉-语言-动作模型的上下文门控动作条件调节

Yifu Xiong, Wenhao Yu, Jiaxuan Lin, Bojun Zou, Jiahao Li, Lu Zhang, Yanyong Zhang, Jianmin Ji

机构 * University of Science and Technology of China (USTC)(中国科学技术大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院)

专题命中 图文多模态 :multimodal(abstract)

AI总结 研究视觉-语言-动作模型,提出上下文门控动作条件调节框架CAC-VLA,在视觉语言模型中学习轻量级潜在动作接口,训练模型预测潜在动作并通过上下文门调节动作专家,实验验证其有效性。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04609 2026-07-07 cs.RO 新提交 50%

SEAM: Smooth Execution of Action-Chunked Motion for Vision-Language-Action Policies

SEAM:用于视觉-语言-动作策略的动作块运动平滑执行

Dijia Zhan, Xuemiao Xu, Jinyi Li, Jie Tang

机构 * South China University of Technology(南方科技大学)

专题命中 图文多模态 :multimodal(abstract)

AI总结 研究视觉-语言-动作策略中动作块执行的多模态分叉问题,提出无训练推理时的SEAM方法,利用同步执行见解,通过速度引导损失转向机制减少边界抖动和块过渡不连续性。

Comments 8 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04630 2026-07-07 cs.SE 版本更新 50%

Foundation Models for Software Engineering of Cyber-Physical Systems: the Road Ahead

网络物理系统软件工程的基础模型:未来之路

Chengjie Lu, Pablo Valle, Jiahui Wu, Erblin Isaku, Hassan Sartaj, Aitor Arrieta, Shaukat Ali

专题命中 图文多模态 :multimodal(abstract)

AI总结 探讨基础模型在网络物理系统软件工程中的应用,指出除语言模型外其他模型潜力大。通过文献等得出前瞻性研究路线图,突出挑战与机会,还讨论了应用模型的常见挑战,为研究和实践提供指导。

Comments 3 figures, 20 tables, 53 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27146 2026-06-26 cs.RO 新提交 50%

PhysReflect-VLA: Physical Feasibility and Self-Reflective Regulation for Reliable Vision-Language-Action Policies

PhysReflect-VLA:面向可靠视觉-语言-动作策略的物理可行性与自反思调节

Jiayu Yang, Tao Yang, Weijun Li, Xiang Chang, Fei Chao, Changjing Shang, Qiang Shen

机构 * Xiamen University(厦门大学) Aberystwyth University(阿伯里斯特威斯大学)

专题命中 图文多模态 :multimodal(abstract)

AI总结 提出PhysReflect-VLA框架,通过物理可行性评估和结构化自反思增强VLA策略,在闭环控制中实现稳定多阶段操作,平均成功率提升5.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27144 2026-06-26 cs.RO 新提交 50%

PAMAE: Phase-Aware-MoE Action Experts Towards Reliable Flow-Matching Vision-Language-Action Policies

PAMAE: 面向可靠流匹配视觉-语言-动作策略的相位感知MoE动作专家

Jiayu Yang, Tao Yang, Xiang Chang, Fei Chao, Changjing Shang, Qiang Shen

机构 * Department of Artificial Intelligence, School of Informatics, Xiamen University(厦门大学信息学院人工智能系) Department of Computer Science, Aberystwyth University(阿伯里斯特威斯大学计算机科学系)

专题命中 图文多模态 :multimodal(abstract)

AI总结 针对多阶段机器人操作中VLA模型动作生成不可靠的问题,提出即插即用的相位感知混合专家动作模块PAMAE,通过稀疏专家混合和相位感知路由提升阶段一致性,在模拟任务中成功率提升9.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25591 2026-06-25 cs.RO 新提交 50%

WOLF-VLA: Whole-Body Humanoid Optimal Locomotion Framework for Vision-Language-Action Learning

WOLF-VLA:面向视觉-语言-动作学习的全身人形最优运动框架

Melya Boukheddimi, Omar Adjali, Daniel Sontag, Frank Kirchner

机构 * Robotics Innovation Center, DFKI GmbH(德国人工智能研究中心机器人创新中心) University of Oldenburg(奥尔登堡大学) AG Robotik University of Bremen(不来梅大学机器人工作组)

专题命中 图文多模态 :multi-modal(abstract)

AI总结 提出WOLF-VLA框架,结合全身最优控制运动合成与大规模多模态数据集,训练VLA模型从自然语言指令生成人形运动策略,在多种任务中展现强鲁棒性和竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18667 2026-06-18 q-bio.NC q-bio.QM 新提交 50%

Can neurons speak? Semantic narration of vision at single-cell resolution

神经元能说话吗?单细胞分辨率的视觉语义叙述

Arnau Marin-Llobet, Richard Hakim, Sara Matias, Venkatesh N. Murthy, Na Li, Demba Ba

专题命中 图文多模态 :multimodal(abstract)

AI总结 提出NEURRATOR框架,通过将神经元活动解码为自然语言描述,实现单细胞分辨率的视觉语义叙述,并用于量化解码保真度及解析单个神经元和特定细胞类型的功能贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13435 2026-06-12 cs.RO 新提交 50%

GIVE: Grounding Human Gestures in Vision-Language-Action Models

GIVE:在视觉-语言-动作模型中接地人类手势

Pengfei Liu, Gen Li, Junqiao Fan, Boyu Ma, Jindou Jia, Yang Xiao, Jianfei Yang

机构 * MARS Lab, Nanyang Technological University(南洋理工大学MARS实验室)

专题命中 图文多模态 :multimodal(abstract)

AI总结 针对VLA模型忽略手势导致意图理解不准的问题,提出GIVE方法,通过视觉和语义双路径增强手势理解,在真实HRI实验中目标识别准确率提升40%,任务成功率提升80%。

Comments Project page: https://luis-cloud-sg.github.io/GIVE-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16013 2026-06-12 cs.RO cs.SE 版本更新 50%

Safety Case Patterns for VLA-based driving systems: Insights from SimLingo

基于VLA的驾驶系统的安全案例模式:来自SimLingo的见解

Gerhard Yu, Fuyuki Ishikawa, Oluwafemi Odu, Alvine Boaye Belle

机构 * York University(约克大学) National Institute of Informatics(国家信息研究所)

专题命中 图文多模态 :multimodal(abstract)

AI总结 针对VLA驾驶系统提出RAISE安全案例设计方法,通过扩展HARA和定制模式,结合SimLingo案例验证其构建基于证据的安全声明的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05497 2026-06-05 cs.LG 50%

LEVANTE-bench: Multi-Scale Comparison of VLMs to Children Using Cognitive Tasks (or, "Is Your VLM Smarter Than a 5th Grader?")

LEVANTE-bench: 使用认知任务对VLM与儿童进行多尺度比较(或者,“你的VLM比五年级学生聪明吗?”)

Alvin Wei Ming Tan, David Cardinal, Tania Lorido-Botran, Laura Bravo-Sanchez, Sunny Yu, Michael C. Frank

机构 * Stanford University(斯坦福大学)

专题命中 图文多模态 :multimodal(abstract)

AI总结 本文提出LEVANTE-bench基准,基于儿童认知任务数据,从多个尺度系统评估视觉语言模型与5-12岁儿童在六项任务上的对齐程度,发现模型与人类认知仅部分对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04610 2026-06-04 cs.DB 50%

Selectivity Estimation for Semantic Filters on Image Data

图像数据语义过滤器的选择性估计

Matthias Urban, Vu Huy Nguyen, Gabriele Sanmartino, Paolo Papotti, Carsten Binnig

专题命中 图文多模态 :multi-modal(abstract)

AI总结 针对图像数据上的语义过滤器,提出基于共享嵌入空间的语义直方图方法,通过估计查询特异性来绕过传统在线采样,实现高效选择性估计,将查询优化与执行的端到端运行时开销降低高达86%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03087 2026-06-03 cs.LG 50%

Learning to Solve, Forgetting to Retain: Correct-Set Turnover in RLVR

学会解决,忘记保留:RLVR中的正确集更替

Chuanyu Qin, Chenxu Yang, Qingyi Si, Naibin Gu, Peng Fu, Zheng Lin

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) JD.COM(京东)

专题命中 图文多模态 :image-text(abstract)

AI总结 针对强化学习可验证奖励(RLVR)中模型遗忘已解决问题的问题,提出正确集更替现象和修复窗口原则,并设计保留感知的回顾机制\method{},通过零额外开销的预部署批量替换提升多模态任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01873 2026-06-02 cs.LG 50%

G2LoRA: Gradient Orthogonal Low-Rank Adaptation Framework for Graph Continual Learning on Text-Attributed Graphs

G2LoRA: 面向文本属性图的梯度正交低秩自适应框架用于图持续学习

Yuhan Wang, Yibo Ding, Yutong Ye, Mufan Zhao, Wenbo Zhang, Ruijie Wang, Jianxin Li

机构 * School of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院) Department of Statistics, Columbia University(哥伦比亚大学统计系) College of Computer Science, Beijing University of Technology(北京理工大学计算机学院)

专题命中 图文多模态 :cross-modal(abstract)

AI总结 针对LLM-as-Aligner模型在文本属性图持续学习中的灾难性遗忘问题,提出G2LoRA框架,通过统一图-文本对齐目标、类别感知梯度投影和梯度幅度调制,实现任务间正向迁移并缓解模态漂移。

Comments Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00573 2026-06-02 cs.LG 50%

LASER: Loss-Aware Singular-value Decomposition and Rank Allocation for Efficient Low-Precision Vision-Language Models

LASER: 面向高效低精度视觉-语言模型的损失感知奇异值分解与秩分配

Haiyu Wang, Yutong Wang, Leshu Li, Yihui Ren, Sai Qian Zhang

机构 * Tandon School of Engineering, New York University(纽约大学工程学院) Courant Institute of Mathematical Sciences, New York University(纽约大学数学科学学院) Brookhaven National Laboratory(布鲁克海文国家实验室)

专题命中 图文多模态 :multimodal(abstract)

AI总结 提出LASER框架,通过损失感知的奇异值分解和跨层秩分配,结合混合量化方案,实现视觉-语言模型在低精度推理下的高效压缩与加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22322 2026-05-22 cs.RO 50%

How can reasoning capability empower the AI copilot robot in endoscopic surgery

推理能力如何赋能内窥手术中的AI助手机器人

Guankun Wang, Long Bai, Hongliang Ren

机构 * Department of Electronic Engineering(电子工程系)

专题命中 图文多模态 :multimodal(abstract)

AI总结 本文研究了推理能力在内窥手术中AI助手机器人中的应用,提出通过整合多模态线索、解读手术意图和推断隐藏组织动态来提高手术的精确性、安全性和可持续性。

Comments Accepted by npj digital medicine

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00756 2026-05-22 cs.CR 50%

LeakyCLIP: Extracting Training Data from CLIP

LeakyCLIP: 从CLIP中提取训练数据

Yunhao Chen, Shujie Wang, Xin Wang, Ran He, Xingjun Ma, Yu-Gang Jiang

专题命中 图文多模态 :multimodal(abstract)

AI总结 本文研究了CLIP中数据记忆和提取风险,提出LeakyCLIP攻击框架,通过改进的图像重建方法实现了高质量的语义准确重建,并揭示了训练数据泄露的可能性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15691 2026-05-21 cs.LG 50%

SEED: Targeted Data Selection by Weighted Independent Set

SEED:通过加权独立集实现目标数据选择

Yuan Zhang, Lifeng Guo, Junwen Pan, Wenzhao Zheng, Wen Zhou, Kuan Cheng, Kurt Keutzer, Shanghang Zhang

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) Beijing University of Posts and Telecommunications(北京邮电大学) Tianjin University(天津大学) EECS, UC Berkeley(伯克利大学电子工程与计算机科学系) Chinese Academy of Sciences(中国科学院)

专题命中 图文多模态 :multimodal(abstract)

AI总结 本文提出SEED方法,通过将数据选择问题建模为加权独立集(WIS)在相似性图上,解决样本质量与多样性之间的平衡问题,并引入节点价值校准和局部尺度归一化来提升数据选择的鲁棒性和可扩展性。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02171 2026-05-19 cs.DB 50%

QuIVer: Rethinking ANN Graph Topology via Training-Free Binary Quantization

QuIVer:通过无训练二进制量化重新思考ANN图拓扑

Wenxuan Xiao, Zhiyou Wang, Chengcheng Li

专题命中 图文多模态 :multimodal(abstract)

AI总结 本文研究了二进制量化能否定义图拓扑本身,并提出了QuIVer,一个无需训练的ANN图索引,在2位Sign-Magnitude二进制量化度量空间中完成边选择、多样性剪枝和束搜索导航,揭示了二进制量化拓扑在不同数据集上的适用边界,提出了可验证的工业向量搜索系统在压缩、吞吐量和通用数据兼容性之间的不可能三角。

Comments 16 pages, 3 figures, 14 tables, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02812 2026-05-18 cs.RO 50%

Learning Structured Robot Policies from Vision-Language Models via Synthetic Neuro-Symbolic Supervision

通过合成神经符号监督学习结构化机器人策略

Alessandro Adami, Tommaso Tubaldo, Marco Todescato, Ruggero Carli, Pietro Falco

机构 * University of Padova, Dept. of Information Engineering(帕多瓦大学信息工程系) Fraunhofer Italia Research(弗劳恩霍夫意大利研究所) Polytechnic of Bari Dept. of Electrical and Information Engineering(巴里理工学院电气与信息工程系)

专题命中 图文多模态 :multimodal(abstract)

AI总结 本文提出通过合成神经符号监督方法,利用视觉语言模型生成结构化机器人策略,结合多模态感知与符号控制,实现高维学习与符号控制的结合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11405 2026-05-14 cs.LG 50%

20/20 Vision Language Models: A Prescription for Better VLMs through Data Curation Alone

20/20 Vision Language Models: 通过数据整理单独提升VLMs的方案

DatologyAI, :, Siddharth Joshi, Haoli Yin, Rishabh Adiga, Haakon Mongstad, Alvin Deng, Aldo Carranza, Alex Fang, Amro Abbas, Anshuman Suri, Brett Larsen, Daniel Zayas, Darren Teh, David Schwab, Diego Kiner, Fan Pan, Jack Urbanek, Jason Lee, Jason Telanoff, Josh Wills, Kaleigh Mentzer, Luke Merrick, Maximilian Böther, Parth Doshi, Paul Burstein, Pratyush Maini, Ties Robroek, Tony Jiang, Vidhi Jain, Vineeth Dorna, Zhengping Wang, Bogdan Gaza, Ari Morcos, Matthew Leavitt

机构 * DatologyAI

专题命中 图文多模态 :image-text(abstract)

AI总结 本文通过数据整理提升VLMs性能,展示在20个公开基准和DatBench九个能力轴上均取得显著提升,同时提升可靠性、OOD泛化和推理效率。

Comments 33 pages, 15 figures. DatalogyAI website for more details: https://www.datologyai.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13670 2026-05-08 cs.LG 50%

Advancing Analytic Class-Incremental Learning through Vision-Language Calibration

通过视觉-语言校准推进分析类增量学习

Binyu Zhao, Wei Zhang, Xingrui Yu, Zhaonian Zou, Ivor Tsang

机构 * School of Computer Science and Technology, Harbin Institute of Technology, China(哈尔滨工业大学计算机科学与技术学院) CFAR and IHPC, Agency for Science, Technology and Research (A*STAR), Singapore(新加坡科技研究局(A*STAR)的CFAR和IHPC) College of Computing and Data Science, Nanyang Technological University, Singapore(新加坡南洋理工大学计算与数据科学学院)

专题命中 图文多模态 :cross-modal(abstract)

AI总结 本文提出VILA框架,通过双级视觉语言校准策略解决预训练模型分析类增量学习中的表示刚性问题,提升学习效率与稳定性,在多个基准测试中表现优异。

Comments 20 pages, 11 figures, 9 tables. Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23934 2026-04-28 eess.SY cs.SY 50%

VLM-VPI: A Vision-Language Reasoning Framework for Improving Automated Vehicle-Pedestrian Interactions

VLM-VPI:一种用于改进自动驾驶车辆-行人交互的视觉语言推理框架

Qingwen Pu, Kun Xie, Yuxiang Liu

专题命中 图文多模态 :multimodal(abstract)

AI总结 本文提出VLM-VPI框架,结合多模态感知、视觉场景理解和意图推理,提升自动驾驶中行人意图识别和安全控制,实验证明其在安全性和效率上的提升。

Comments 40 pages, 7 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23272 2026-04-28 cs.RO 50%

Modular Sensory Stream for Integrating Physical Feedback in Vision-Language-Action Models

模块化感觉流:整合物理反馈在视觉-语言-动作模型中

Jimin Lee, Huiwon Jang, Myungkyu Koo, Jungwoo Park, Jinwoo Shin

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) Seoul National University(首尔国立大学)

专题命中 图文多模态 :cross-modal(abstract)

AI总结 本文提出MoSS框架,通过模块化感觉流整合多种物理信号,提升视觉-语言-动作模型的行动预测能力。

Comments 14 pages, 8 figures, Project page: https://jiminlx.github.io/MoSS

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14474 2026-04-17 cs.LG 50%

Scouting By Reward: VLM-TO-IRL-Driven Player Selection For Esports

通过奖励进行 scouting:由 VLM-TO-IRL 驱动的电子竞技玩家选拔

Qing Yan, Wenyu Yang, Yufei Wang, Wenhao Ma, Linchong Hu, Yifei Jin, Anton Dahbura

机构 * Johns Hopkins University(约翰霍普金斯大学) University of Pennsylvania(宾夕法尼亚大学) Cornell University(康奈尔大学)

专题命中 图文多模态 :multimodal(abstract)

AI总结 本文提出一种基于逆强化学习的电子竞技玩家选拔框架,通过学习专业选手的奖励函数,利用多模态双分支架构和 GAIL 目标实现玩家风格匹配评估,提升人才发现效率。

详情

展开后加载摘要…

URL PDF HTML 收藏