arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-09 至 2026-01-09 共收录 56 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 13 篇

2510.17722 2026-01-09 cs.CV cs.AI 81%

MT-Video-Bench: A Holistic Video Understanding Benchmark for Evaluating Multimodal LLMs in Multi-Turn Dialogues

MT-Video-Bench: 一个多轮对话中评估多模态大语言模型的综合视频理解基准

Yaning Pan, Qianqian Xie, Guohui Zhang, Zekun Wang, Yongqian Wen, Yuanxing Zhang, Haoxuan Hu, Zhiyu Pan, Yibing Huang, Zhidong Gan, Yonghong Lin, An Ping, Shihao Li, Yanghai Wang, Tianhao Peng, Jiaheng Liu

机构 * Fudan University(复旦大学) NJU-LINK Team, Nanjing University(南京大学NJU-LINK团队) University of Science and Technology of China(中国科学技术大学) Kuaishou Technology(快手科技)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 MT-Video-Bench通过评估多轮对话中多模态大语言模型的6项核心能力,揭示其在处理多轮视频对话任务中的性能差异和局限性。

Comments Project Website: https://github.com/NJU-LINK/MT-Video-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04819 2026-01-09 cs.AI 79%

AECV-Bench: Benchmarking Multimodal Models on Architectural and Engineering Drawings Understanding

AECV-Bench:在建筑和工程图纸理解上的多模态模型评估基准

Aleksei Kondratenko, Mussie Birhane, Houssame E. Hsain, Guido Maciocci

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 AECV-Bench评估多模态模型在建筑图纸理解上的能力,发现OCR和文本问答表现最佳,但符号理解尤其是门窗计数仍存在较大误差,需改进领域特定表示和人机协作流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04715 2026-01-09 cs.CV 70%

On the Holistic Approach for Detecting Human Image Forgery

对人类图像伪造的总体方法

Xiao Guo, Jie Zhu, Anil Jain, Xiaoming Liu

机构 * Michigan State University(密歇根州立大学)

专题命中 多模态评测 :multi-modal(abstract);MLLM(abstract);分类 cs.CV

AI总结 HuForDet通过双分支架构,结合异构专家和多模态大语言模型,实现了对人类图像伪造的全面检测,提升了对各类伪造的检测性能和鲁棒性。

Comments 6 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14749 2026-01-09 cs.CL 70%

On the robustness of modeling grounded word learning through a child's egocentric input

基于儿童自体输入的建模 grounded 词学习的鲁棒性研究

Wai Keen Vong, Brenden M. Lake

机构 * Center for Data Science, New York University(纽约大学数据科学中心) Department of Psychology, New York University(纽约大学心理学系)

专题命中 多模态评测 :multimodal(abstract);multi-modal(abstract);分类 cs.CL

AI总结 本文通过分析儿童自体输入数据,验证了多模态神经网络在 grounded 词学习中的鲁棒性,并揭示了不同儿童经验对学习模式的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18951 2026-01-09 cs.CV 70%

TopoBDA: Towards Bezier Deformable Attention for Road Topology Understanding

TopoBDA: 向贝塞尔可变形注意力迈进:道路拓扑理解

Muhammet Esat Kalfaoglu, Halil Ibrahim Ozturk, Ozsel Kilinc, Alptekin Temizel

机构 * Graduate School of Informatics, Middle East Technical University(信息学院,中东部技术大学) Togg/Trutek AI Team(Togg/Trutek人工智能团队)

专题命中 多模态评测 :multimodal(abstract);multi-modal(abstract);分类 cs.CV

AI总结 TopoBDA通过贝塞尔可变形注意力提升道路拓扑理解,结合多模态数据增强性能。

Comments Project page: https://artest08.github.io/TopoBDA.github.io/

Journal ref Neurocomputing, Vol. 670, 132360 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04897 2026-01-09 cs.CL cs.CV cs.LG cs.MM 67%

V-FAT: Benchmarking Visual Fidelity Against Text-bias

V-FAT:基于文本偏见的视觉真实性基准测试

Ziteng Wang, Yujie He, Guanliang Li, Siqi Yang, Jiaqi Xiong, Songxiang Liu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Meituan(美团) University of Oxford(牛津大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.MM

AI总结 V-FAT通过三级评估框架量化文本偏见对视觉真实性的干扰,揭示多模态大语言模型在高语言主导性下的视觉崩溃问题。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04202 2026-01-09 cs.CL cs.AI cs.LG 62%

TeleTables: A Benchmark for Large Language Models in Telecom Table Interpretation

TeleTables: 电信表格解释中的大语言模型基准

Anas Ezzakri, Nicola Piovesan, Mohamed Sana, Antonio De Domenico, Fadhel Ayed, Haozhe Zhang

机构 * Paris Research Center, Huawei Technologies(巴黎研究中心,华为技术)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 TeleTables 是一个用于评估大语言模型在电信表格解释能力的基准,揭示了在电信标准上进行领域微调的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04199 2026-01-09 cs.LG cs.AI cs.CL 62%

The Forgotten Shield: Safety Grafting in Parameter-Space for Medical MLLMs

被遗忘的盾牌:参数空间中的医疗大语言模型安全性移植

Jiale Zhao, Xing Mou, Jinlin Wu, Hongyuan Yu, Mingrui Sun, Yang Shi, Xuanwu Yin, Zhen Chen, Zhen Lei, Yaohua Wang

机构 * National University of Defense Technology(国防科技大学) Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统(MAIS)) Multimedia Department, Xiaomi Inc(小米公司多媒体部门) Centre for Artificial Intelligence and Robotics, Hong Kong Institute of Science and Innovation, Chinese Academy of Sciences, Hong Kong(香港科学院人工智能与机器人中心) School of Artificial Intelligence, University of Chinese Academy of Sciences, UCAS(中国科学院大学人工智能学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出参数空间干预方法,通过提取原始模型的安全知识并注入目标模型,提升医疗大语言模型的安全性,同时保持医疗性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.17297 2026-01-09 cs.CV 57%

BOP-Distrib: Revisiting 6D Pose Estimation Benchmarks for Better Evaluation under Visual Ambiguities

BOP-Distrib: 重新审视6D位姿估计基准测试以在视觉模糊情况下获得更好的评估

Boris Meden, Asma Brazi, Fabrice Mayran de Chamisso, Steve Bourgeois, Vincent Lepetit

机构 * Université Paris-Saclay, CEA, List(巴黎萨克雷大学、CEA、List) LIGM, Ecole des Ponts, Univ Gustave Eiffel, CNRS(LIGM、巴黎桥梁学院、冈斯-伊夫勒大学、CNRS)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 BOP-Distrib重新审视6D位姿估计基准测试,通过自动生成图像级位姿分布来改进评估,在视觉模糊情况下提升方法评估的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04732 2026-01-09 quant-ph cs.AI cs.LG 57%

The Role of Quantum in Hybrid Quantum-Classical Neural Networks: A Realistic Assessment

量子在混合量子经典神经网络中的作用:一种现实评估

Dominik Freinberger, Philipp Moser

机构 * Research Unit Medical Informatics(医学信息学研究单元) RISC Software GmbH(RISC软件公司)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.AI

AI总结 本文通过系统评估混合量子经典神经网络,探讨量子组件对性能的实际影响,发现量子组件在多数情况下会降低性能,呼吁在近期应用中谨慎使用。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04219 2026-01-09 cs.CY cs.AI cs.MA 57%

AgentTutor: Empowering Personalized Learning with Multi-Turn Interactive Teaching in Intelligent Education Systems

AgentTutor: 通过多轮互动教学赋能个性化学习在智能教育系统中

Yuxin Liu, Zeqing Song, Jiong Lou, Chentao Wu, Jie Li

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 AgentTutor通过多轮互动教学系统提升个性化学习效果,结合多代理系统和学习者档案实现动态优化的教学策略。

Comments AAAI2026 Workshop AI4EDU

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05073 2026-01-09 cs.LG 50%

Milestones over Outcome: Unlocking Geometric Reasoning with Sub-Goal Verifiable Reward

几何推理的里程碑:通过子目标可验证奖励解锁几何推理

Jianlong Chen, Daocheng Fu, Shengze Xu, Jiawei Chen, Yuan Feng, Yue Yang, Junchi Yan, Hongyuan Zha, Renqiu Xia

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学) University of Science and Technology Beijing(北京科技大学)

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出SGVR框架,通过子目标可验证奖励提升多模态大语言模型在几何推理及泛化能力上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05014 2026-01-09 cs.RO 50%

The RoboSense Challenge: Sense Anything, Navigate Anywhere, Adapt Across Platforms

RoboSense挑战:感知一切,导航任何地方,跨平台适应

Lingdong Kong, Shaoyuan Xie, Zeying Gong, Ye Li, Meng Chu, Ao Liang, Yuhao Dong, Tianshuai Hu, Ronghe Qiu, Rong Li, Hanjiang Hu, Dongyue Lu, Wei Yin, Wenhao Ding, Linfeng Li, Hang Song, Wenwei Zhang, Yuexin Ma, Junwei Liang, Zhedong Zheng, Lai Xing Ng, Benoit R. Cottereau, Wei Tsang Ooi, Ziwei Liu, Zhanpeng Zhang, Weichao Qiu, Wei Zhang, Ji Ao, Jiangpeng Zheng, Siyu Wang, Guang Yang, Zihao Zhang, Yu Zhong, Enzhu Gao, Xinhan Zheng, Xueting Wang, Shouming Li, Yunkai Gao, Siming Lan, Mingfei Han, Xing Hu, Dusan Malic, Christian Fruhwirth-Reisinger, Alexander Prutsch, Wei Lin, Samuel Schulter, Horst Possegger, Linfeng Li, Jian Zhao, Zepeng Yang, Yuhang Song, Bojun Lin, Tianle Zhang, Yuchen Yuan, Chi Zhang, Xuelong Li, Youngseok Kim, Sihwan Hwang, Hyeonjun Jeong, Aodi Wu, Xubo Luo, Erjia Xiao, Lingfeng Zhang, Yingbo Tang, Hao Cheng, Renjing Xu, Wenbo Ding, Lei Zhou, Long Chen, Hangjun Ye, Xiaoshuai Hao, Shuangzhi Li, Junlong Shen, Xingyu Li, Hao Ruan, Jinliang Lin, Zhiming Luo, Yu Zang, Cheng Wang, Hanshi Wang, Xijie Gong, Yixiang Yang, Qianli Ma, Zhipeng Zhang, Wenxiang Shi, Jingmeng Zhou, Weijun Zeng, Kexin Xu, Yuchen Zhang, Haoxiang Fu, Ruibin Hu, Yanbiao Ma, Xiyan Feng, Wenbo Zhang, Lu Zhang, Yunzhi Zhuge, Huchuan Lu, You He, Seungjun Yu, Junsung Park, Youngsun Lim, Hyunjung Shim, Faduo Liang, Zihang Wang, Yiming Peng, Guanyu Zong, Xu Li, Binghao Wang, Hao Wei, Yongxin Ma, Yunke Shi, Shuaipeng Liu, Dong Kong, Yongchun Lin, Huitong Yang, Liang Lei, Haoang Li, Xinliang Zhang, Zhiyong Wang, Xiaofeng Wang, Yuxia Fu, Yadan Luo, Djamahl Etchegaray, Yang Li, Congfei Li, Yuxiang Sun, Wenkai Zhu, Wang Xu, Linru Li, Longjie Liao, Jun Yan, Benwu Wang, Xueliang Ren, Xiaoyu Yue, Jixian Zheng, Jinfeng Wu, Shurui Qin, Wei Cong, Yao He

机构 * Technical Committee(技术委员会) Challenge & Workshop Organizers(挑战与研讨会组织者)

专题命中 多模态评测 :cross-modal(abstract)

AI总结 RoboSense 2025挑战通过统一五个研究领域,推动机器人感知在多样化场景下的鲁棒性和适应性,提升真实环境中的感知可靠性与行动稳健性。

Comments Official IROS 2025 RoboSense Challenge Report; 51 pages, 37 figures, 5 tables; Competition Website at https://robosense2025.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态Agent 5 篇

2601.04554 2026-01-09 cs.IR 82%

Exploring Recommender System Evaluation: A Multi-Modal User Agent Framework for A/B Testing

探索推荐系统评估:一种用于A/B测试的多模态用户代理框架

Wenlin Zhang, Xiangyang Li, Qiyuan Ge, Kuicai Dong, Pengyue Jia, Xiaopeng Li, Zijian Zhang, Maolin Wang, Yichao Wang, Huifeng Guo, Ruiming Tang, Xiangyu Zhao

专题命中 多模态Agent :multi-modal(title,abstract);multimodal(abstract)

AI总结 本文提出一种多模态用户代理框架,用于替代传统A/B测试,通过模拟真实用户行为提升推荐系统性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04692 2026-01-09 cs.CL cs.CV 81%

See, Explain, and Intervene: A Few-Shot Multimodal Agent Framework for Hateful Meme Moderation

见、解释与干预:一种少样本多模态代理框架用于仇恨表情包审查

Naquee Rizwan, Subhankar Swain, Paramananda Bhaskar, Gagan Aryan, Shehryaar Shah Khan, Animesh Mukherjee

机构 * Indian Institute of Technology (IIT), Kharagpur(印度理工学院(IIT)Khargpur分校) Simbian

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本文提出了一种少样本多模态代理框架,用于在有限数据条件下实现通用仇恨表情包审查,通过检测、解释和干预三方面提升审查效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24385 2026-01-09 cs.CV cs.RO 79%

Forging Spatial Intelligence: A Roadmap of Multi-Modal Data Pre-Training for Autonomous Systems

锻造空间智能:面向自主系统多模态数据预训练的路线图

Song Wang, Lingdong Kong, Xiaolu Liu, Hao Shi, Wentong Li, Jianke Zhu, Steven C. H. Hoi

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Alibaba Group(阿里巴巴集团) Singapore Management University(新加坡管理学院)

专题命中 多模态Agent :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出多模态数据预训练框架,旨在通过整合多传感器数据提升自主系统空间智能,解决单模态模型整合难题,并提出统一的预训练范式分类及未来发展方向。

Comments Survey; 40 pages, 7 figures, 9 tables; GitHub Repo at https://github.com/worldbench/awesome-spatial-intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04500 2026-01-09 cs.AI 70%

GUITester: Enabling GUI Agents for Exploratory Defect Discovery

GUITester: 使GUI代理用于探索性缺陷发现

Yifei Gao, Jiang Wu, Xiaoyi Chen, Yifan Yang, Zhe Cui, Tianyi Ma, Jiaming Zhang, Jitao Sang

机构 * Beijing Jiaotong University(北京交通大学) Hithink Research(慧思科技) Nanyang Technological University(南洋理工大学)

专题命中 多模态Agent :multi-modal(abstract);MLLM(abstract);分类 cs.AI

AI总结 GUITester通过解耦导航与验证的多代理框架,有效解决了探索性GUI测试中目标导向遮蔽和执行偏差归因的问题,实现了48.90%的F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05243 2026-01-09 cs.RO cs.CV 57%

Generate, Transfer, Adapt: Learning Functional Dexterous Grasping from a Single Human Demonstration

生成、迁移、适应:从单个人示范学习功能性灵巧抓取

Xingyi He, Adhitya Polavaram, Yunhao Cao, Om Deshmukh, Tianrui Wang, Xiaowei Zhou, Kuan Fang

机构 * Cornell University(康奈尔大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 CorDex通过单个人示范生成合成数据,结合多模态预测网络和局部-全局融合模块,实现对新型物体的灵巧抓取学习。

Comments Project Page: https://cordex-manipulation.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态训练与对齐 4 篇

2601.04736 2026-01-09 cs.CL 79%

AM$^3$Safety: Towards Data Efficient Alignment of Multi-modal Multi-turn Safety for MLLMs

AM$^3$Safety: 向多模态多轮安全对齐的数据高效方法

Han Zhu, Jiale Chen, Chengkun Cai, Shengjie Sun, Haoran Li, Yujin Zhou, Chi-Min Chan, Pengcheng Wen, Lei Li, Sirui Han, Yike Guo

机构 * Hong Kong University of Science and Technology(香港科技大学) Zhongshan School of Medicine, SUN YAT-SEN UNIVERSITY(中山医学院,孙中山大学) University of Edinburgh(爱丁堡大学) University of Washington(华盛顿大学)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CL

AI总结 AM$^3$Safety通过结合冷启动拒绝阶段和组相对策略优化,有效提升多模态多轮对话的安全性,降低攻击成功率并增强模型的无害与帮助维度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03296 2026-01-09 cs.CL cs.LG 79%

Towards Trustworthy Multimodal Moderation via Policy-Aligned Reasoning and Hierarchical Labeling

通过政策对齐推理和分层标注实现可信的多模态审核

Anqi Li, Wenwei Jin, Jintao Tong, Pengda Qin, Weijia Li, Guo Lu

机构 * Shanghai Jiao Tong University(上海交通大学) Xiaohongshu Inc.(小红书公司) Huazhong University of Science and Technology(华中科技大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL

AI总结 Hi-Guard通过政策对齐推理和分层标注提升多模态审核的准确性、泛化性和可解释性。

Comments Accepted by KDD 2026. Code is available at https://github.com/lianqi1008/Hi-Guard

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04582 2026-01-09 cs.CL 57%

Aligning Text, Code, and Vision: A Multi-Objective Reinforcement Learning Framework for Text-to-Visualization

对齐文本、代码和视觉:一种多目标强化学习框架用于文本到可视化

Mizanur Rahman, Mohammed Saidul Islam, Md Tahmid Rahman Laskar, Shafiq Joty, Enamul Hoque

机构 * York University(约克大学) Salesforce AI Research(Salesforce人工智能研究) Nanyang Technological University(南洋理工大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL

AI总结 本文提出RL-Text2Vis框架,通过多目标强化学习提升文本到可视化的准确性和代码执行率。

Comments Accepted to EACL Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06282 2026-01-09 cs.CV 57%

From Dataset to Real-world: General 3D Object Detection via Generalized Cross-domain Few-shot Learning

从数据集到现实世界:通过通用跨领域少样本学习实现通用3D目标检测

Shuangzhi Li, Junlong Shen, Lei Ma, Xingyu Li

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出通用跨领域少样本学习方法,通过融合2D语义与3D空间推理,实现对现实世界中常见和新类目标的高效检测。

Comments The latest version refines the few-shot setting on common classes, enforcing a stricter object-level definition

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他多模态 4 篇

2601.05179 2026-01-09 cond-mat.mtrl-sci cond-mat.soft physics.app-ph 78%

Local Multimodal Dynamics in Mixed Ionic-Electronic Conductors and Their Fingerprints in Organic Electrochemical Transistor Operation

混合离子-电子导体中的局部多模态动力学及其在有机电化学晶体管操作中的指纹

Shubham Tanwar, Han-Yan Wu, Chi-Yuan Yang, Ruben Millan-Solsona, Simone Fabiano, Adrica Kyndiah, Gabriel Gomila

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 研究揭示混合离子-电子导体中局部多模态动力学及其在OECT操作中的指纹,通过电化学阈值和静电力机制提供新的理解框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04801 2026-01-09 cs.AR cs.LG 78%

MPM-LLM4DSE: Reaching the Pareto Frontier in HLS with Multimodal Learning and LLM-Driven Exploration

MPM-LLM4DSE: 在HLS中通过多模态学习和LLM驱动探索达到帕累托前沿

Lei Xu, Shanshan Wang, Chenglong Xiao

机构 * Department of Computer Science, Shantou University, China(计算机科学系,汕头大学,中国)

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 本文提出 MPM-LLM4DSE 框架,结合多模态学习与大语言模型驱动探索,提升 HLS 设计空间探索的性能和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07989 2026-01-09 cs.RO 78%

Bio-Skin: A Cost-Effective Thermostatic Tactile Sensor with Multi-Modal Force and Temperature Detection

Bio-Skin:一种成本效益高的热感触觉传感器,具备多模态力和温度检测

Haoran Guo, Haoyang Wang, Zhengxiong Li, Lingfeng Tao

专题命中 其他多模态 :multi-modal(title,abstract)

AI总结 Bio-Skin是一种低成本多模态触觉传感器,通过单轴霍尔效应传感器和条形压阻电阻器实现力和温度检测,具有与商用产品相当的性能和十倍更低的成本。

Comments This work has been published by IROS2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22836 2026-01-09 cs.AI 57%

Rethinking the Text-Vision Reasoning Imbalance in MLLMs through the Lens of Training Recipes

通过训练食谱的视角重新思考MLLMs中的文本-视觉推理不平衡

Guanyu Yao, Qiucheng Wu, Yang Zhang, Zhaowen Wang, Handong Zhao, Shiyu Chang

机构 * UC Santa Barbara(加州大学圣芭芭拉分校) MIT-IBM Watson AI Lab(麻省理工-IBM Watson人工智能实验室) Adobe Research(Adobe研究院)

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文通过分析训练食谱,提出减少多模态大语言模型中文本与视觉推理不平衡的方法,旨在提升视觉推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏