arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-09 至 2025-12-09 共收录 102 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 17 篇

2512.07738 2025-12-09 cs.CV 57%

HLTCOE Evaluation Team at TREC 2025: VQA Track

TREC 2025 VQA 轨道中 HLTCOE 评估团队:视觉问答任务

Dengjia Zhang, Charles Weng, Katherine Guerrerio, Yi Lu, Kenton Murray, Alexander Martin, Reno Kriz, Benjamin Van Durme

机构 * Johns Hopkins University(约翰霍普金斯大学) Human Language Technology Center of Excellence(人文语言技术卓越中心)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 HLTCOE 评估团队在 TREC 2025 VQA 轨道中提出了一种列表学习框架,通过结合生成模型与判别排名,提升答案生成的语义精度和排名一致性。

Comments 7 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07666 2025-12-09 cs.CL cs.SE 57%

Bridging Code Graphs and Large Language Models for Better Code Understanding

连接代码图与大型语言模型以实现更好的代码理解

Zeqi Chen, Zhaoyang Chu, Yi Gui, Feng Guo, Yao Wan, Chuan Shi

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CL

AI总结 CGBridge通过引入外部Bridge模块,提升LLMs对代码结构语义的理解,显著提高代码生成和翻译任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06862 2025-12-09 cs.CV 57%

Omni-Referring Image Segmentation

多模态指引用图像分割

Qiancheng Zheng, Yunhang Shen, Gen Luo, Baiyang Song, Xing Sun, Xiaoshuai Sun, Yiyi Zhou, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学) Youtu Lab, Tencent, P.R. China(腾讯视频实验室,中国) OpenGVLab, Shanghai AI Laboratory(上海AI实验室)

专题命中 多模态评测 :omni-modal(abstract);分类 cs.CV

AI总结 本文提出多模态指引用图像分割任务,通过OmniRIS框架实现高度通用的图像分割,结合文本和视觉模态,构建了OmniRef数据集和OmniSegNet基线模型,验证了其在多模态提示下的分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06134 2025-12-09 cs.LG cs.AI q-bio.NC q-bio.QM 57%

Physics-Informed Neural Koopman Machine for Interpretable Longitudinal Personalized Alzheimer's Disease Forecasting

具有物理信息的神经Koopman机用于可解释的纵向个性化阿尔茨海默病预测

Georgi Hrusanov, Duy-Thanh Vu, Duy-Cat Can, Sophie Tascedda, Margaret Ryan, Julien Bodelet, Katarzyna Koscielska, Carsten Magnus, Oliver Y. Chén

机构 * Platform of Bioinformatics (PBI), University Lausanne Hospital (CHUV) and Faculty of Biology and Medicine (FBM), University of Lausanne (UNIL)(生物信息平台(PBI)、日内瓦大学医院(CHUV)和生物医学学院(FBM)、日内瓦大学(UNIL)) PBI, CHUV and FBM, UNIL(PBI、CHUV和FBM、UNIL) Department of Biomedical Engineering, University of Basel(生物医学工程系、巴塞尔大学) Roche Diagnostics International Ltd.(罗氏诊断国际有限公司) F. Hoffmann - La Roche Ltd., Roche Information Solutions(F. Hoffmann-La Roche有限公司、罗氏信息解决方案)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出神经Koopman机,通过整合多模态数据和生物学知识,实现阿尔茨海默病认知下降的可解释性预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06014 2025-12-09 cs.CV 57%

Benchmarking CXR Foundation Models With Publicly Available MIMIC-CXR and NIH-CXR14 Datasets

基于公开的MIMIC-CXR和NIH-CXR14数据集评估CXR基础模型

Jiho Shin, Dominic Marshall, Matthieu Komorowski

机构 * Imperial College London(帝国理工学院伦敦分校)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文评估了两种CXR基础模型在不同数据集上的性能,发现MedImageInsight在多数任务表现更优,而CXR-Foundation具有良好的跨数据集稳定性,强调了标准化评估的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20745 2025-12-09 cs.CV 57%

Math Blind: Failures in Diagram Understanding Undermine Reasoning in MLLMs

数学视觉盲:图示理解的失败削弱了多模态大语言模型的推理能力

Yanpeng Sun, Shan Zhang, Wei Tang, Aotian Chen, Piotr Koniusz, Kai Zou, Yuan Xue, Anton van den Hengel

机构 * Ohio State University(俄亥俄州立大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本研究发现多模态大语言模型在图示理解上的缺陷导致推理能力下降,通过改进图示感知可显著提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22920 2025-12-09 q-bio.QM 50%

Beyond the Clinic: A Large-Scale Evaluation of Augmenting EHR with Wearable Data for Diverse Health Prediction

超越临床:一种大规模评估EHR与可穿戴数据融合用于多样化健康预测的框架

Will Ke Wang, Rui Yang, Chao Pang, Karthik Natarajan, Nan Liu, Daniel McDuff, David J Slotwiner, Fei Wang, Matthew B. A. McDermott, Xuhai "Orson" Xu

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出了一种整合EHR和可穿戴数据的多模态预测框架,通过大规模评估发现可穿戴数据显著提升了健康预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06099 2025-12-09 eess.SP 50%

Why Nonlinear Models Matter: Unified Analysis of Cognitive Load, Stress, and Exercise Using Wearable Physiological Signals

非线性模型的重要性:利用可穿戴生理信号统一分析认知负荷、压力和运动

Khondakar Ashik Shahriar

专题命中 多模态评测 :multimodal(abstract)

AI总结 本研究通过非线性模型统一分析认知负荷、压力和运动,证明生理状态识别的本质非线性,并建立了统一的基准以指导更稳健的可穿戴健康监测系统发展。

Comments 28 pages, 8 tables, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态Agent 10 篇

2512.06396 2025-12-09 cs.CR cs.AI 83%

AgenticCyber: A GenAI-Powered Multi-Agent System for Multimodal Threat Detection and Adaptive Response in Cybersecurity

AgenticCyber: 一种基于生成式AI的多智能体系统,用于多模态威胁检测与自适应响应在网络安全中

Shovan Roy

机构 * TNTech

专题命中 多模态Agent :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 AgenticCyber通过生成式AI驱动的多智能体系统,实现多模态威胁检测与自适应响应,提升网络安全性能和态势感知能力。

Comments 6 pages for IEEE conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07351 2025-12-09 cs.CV cs.AI cs.SD 81%

DeepAgent: A Dual Stream Multi Agent Fusion for Robust Multimodal Deepfake Detection

DeepAgent: 一种双流多智能体融合用于鲁棒多模态深度伪造检测

Sayeem Been Zaman, Wasimul Karim, Arefin Ittesafun Abian, Reem E. Mohamed, Md Rafiqul Islam, Asif Karim, Sami Azam

机构 * Applied Artificial Intelligence and Intelligent Systems (AAIINS) Laboratory(应用人工智能与智能系统实验室) Department of Computer Science and Engineering(计算机科学与工程系) University of Scholars(学者大学) Faculty of Science and Information Technology(科学与信息技术学院) Faculty of Science and Technology(科学与技术学院)

专题命中 多模态Agent :multimodal(title);audio-visual(abstract);分类 cs.CV、cs.AI

AI总结 DeepAgent通过双流多智能体融合方法,提升多模态深度伪造检测的鲁棒性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02395 2025-12-09 cs.CV 79%

Skywork-R1V4: Toward Agentic Multimodal Intelligence through Interleaved Thinking with Images and DeepResearch

Skywork-R1V4:通过图像与深度研究交织思考实现代理多模态智能

Yifan Zhang, Liang Hu, Haofeng Sun, Peiyu Wang, Yichen Wei, Shukang Yin, Jiangbo Pei, Wei Shen, Peng Xia, Yi Peng, Tianyidan Xie, Eric Li, Yang Liu, Xuchen Song, Yahui Zhou

机构 * Skywork AI

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV

AI总结 Skywork-R1V4通过交织推理实现多模态代理智能,仅用监督学习在少数据上训练,超越现有模型在多个基准测试中的表现。

Comments 21 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07132 2025-12-09 cs.CL cs.AI cs.CV 78%

DART: Leveraging Multi-Agent Disagreement for Tool Recruitment in Multimodal Reasoning

利用多智能体分歧进行多模态推理中的工具招募

Nithin Sivakumaran, Justin Chih-Yao Chen, David Wan, Yue Zhang, Jaehong Yoon, Elias Stengel-Eskin, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) Nanyang Technological University(南洋理工大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 多模态Agent :multimodal(title);分类 cs.CV、cs.CL、cs.AI

AI总结 DART通过多智能体分歧识别有用视觉工具,提升多模态推理中的工具调用效果。

Comments Code: https://github.com/nsivaku/dart

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05731 2025-12-09 cs.AI cs.CL 62%

InfiGUI-G1: Advancing GUI Grounding with Adaptive Exploration Policy Optimization

InfiGUI-G1: 通过自适应探索策略优化推进GUI接地

Yuhang Liu, Zeyu Liu, Shuanghe Zhu, Pengxiang Li, Congkai Xie, Jiasheng Wang, Xavier Hu, Xiaotian Han, Jianbo Yuan, Xinyao Wang, Shengyu Zhang, Hongxia Yang, Fei Wu

机构 * Amazon(亚马逊)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 InfiGUI-G1通过自适应探索策略优化改进GUI接地,实现显著的语义对齐和性能提升。

Comments Accepted to AAAI 2026 (Oral Presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02292 2025-12-09 cs.AI cs.LG 57%

FinWorld: An All-in-One Open-Source Platform for End-to-End Financial AI Research and Deployment

FinWorld: 一个全方位的开源平台,用于端到端的金融AI研究与部署

Wentao Zhang, Yilei Zhao, Chuqiao Zong, Xinrun Wang, Bo An

机构 * Nanyang Technological University Skywork AI(南洋理工大学Skywork AI) Nanyang Technological University(南洋理工大学) Singapore Management University(新加坡管理学院)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 FinWorld是一个全方位的开源平台,提供端到端的金融AI研究与部署支持,通过整合异构金融数据和强化学习技术,提升可重复性和部署效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06373 2025-12-09 cs.CV 57%

VG-Refiner: Towards Tool-Refined Referring Grounded Reasoning via Agentic Reinforcement Learning

VG-Refiner: 通过代理强化学习实现工具精细化的指称 grounded 推理

Yuji Wang, Wenlong Liu, Jingxuan Niu, Haoji Zhang, Yansong Tang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) International Digital Economy Academy (IDEA)(国际数字经济学院)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 VG-Refiner通过代理强化学习实现工具精细化的指称 grounded 推理,引入两阶段思考-重新思考机制和细化奖励,提升指称和推理接地任务的准确性和修正能力。

Comments The project page is [this url](https://github.com/VoyageWang/VG-Refiner)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07452 2025-12-09 cs.IR 50%

From Show Programmes to Data: Designing a Workflow to Make Performing Arts Ephemera Accessible Through Language Models

从节目到数据:设计一种工作流,通过语言模型使表演艺术的临时性资料可访问

Clarisse Bardiot, Pierre-Carl Langlais, Bernard Jacquemin, Jacob Hart, Antonios Lagarias, Nicolas Foucault, Aurélie Lemaître-Legargeant, Jeanne Fras

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出利用多模态语言模型和本体推理模型,将戏剧节目转化为结构化数据,以提升文化遗产资料的可访问性和分析能力。

Comments 19 pages, 8 figures, 5 tables, 17 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07032 2025-12-09 cs.RO 50%

A Hetero-Associative Sequential Memory Model Utilizing Neuromorphic Signals: Validated on a Mobile Manipulator

一种利用神经形态信号的异关联序列记忆模型:在移动机械臂上的验证

Runcong Wang, Fengyi Wang, Gordon Cheng

机构 * Institute for Cognitive Systems, Technical University of Munich(认知系统研究所,慕尼黑技术大学)

专题命中 多模态Agent :multi-modal(abstract)

AI总结 本文提出一种利用神经形态信号的异关联序列记忆模型,用于移动机械臂的触觉与动作决策,实现低计算成本的伪柔顺控制与多关节抓取序列检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06558 2025-12-09 cs.RO 50%

Embodied Referring Expression Comprehension in Human-Robot Interaction

具身指称表达理解在人机交互中的应用

Md Mofijul Islam, Alexi Gladstone, Sujan Sarker, Ganesh Nanduru, Md Fahim, Keyan Du, Aman Chadha, Tariq Iqbal

机构 * University of Virginia(弗吉尼亚大学) Stanford University(斯坦福大学) University of Dhaka(达卡大学) Amazon GenAI(亚马逊生成人工智能)

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出Refer360数据集和MuRes模块,用于提升机器人在人机交互中对具身指称表达的理解能力。

Comments 14 pages, 7 figures, accepted at the ACM/IEEE International Conference on Human-Robot Interaction (HRI) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态训练与对齐 18 篇

2507.14997 2025-12-09 cs.CV cs.LG 85%

Language Integration in Fine-Tuning Multimodal Large Language Models for Image-Based Regression

基于图像回归的多模态大语言模型微调中的语言整合

Roy H. Jennings, Genady Paikin, Roy Shaul, Evgeny Soloveichik

机构 * Samsung Israel R&D Center(三星以色列研发中心)

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出RvTC方法,通过灵活的区间法替代传统词汇受限分类,提升多模态大语言模型在图像回归任务中的性能。

Comments WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07568 2025-12-09 cs.CV cs.AI eess.IV 84%

Dual-Stream Cross-Modal Representation Learning via Residual Semantic Decorrelation

通过残差语义去相关实现双流跨模态表示学习

Xuecheng Li, Weikuan Jia, Alisher Kurbonaliev, Qurbonaliev Alisher, Khudzhamkulov Rustam, Ismoilov Shuhratjon, Eshmatov Javhariddin, Yuanjie Zheng

机构 * School of Information Science & Engineering, Shandong Normal University(信息科学与工程学院,山东师范大学) Tajikistan State University of Law, Business Sughd(塔吉克斯坦法律、商业大学,苏赫德) Tajik State University of Law, Business and Politics Sughd(塔吉克斯坦法律、商业与政治大学,苏赫德)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 DSRSD-Net通过残差分解和语义去相关解决跨模态学习中的模态主导和冗余问题,提升预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07430 2025-12-09 cs.LG cs.AI 83%

MIDG: Mixture of Invariant Experts with knowledge injection for Domain Generalization in Multimodal Sentiment Analysis

MIDG:基于知识注入的混合不变专家用于多模态情感分析中的领域泛化

Yangle Li, Danli Luo, Haifeng Hu

机构 * School of Electronics and Information Technology(电子信息学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 MIDG通过混合不变专家和跨模态适配器,提升多模态情感分析中领域泛化的性能与语义表达能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22410 2025-12-09 stat.AP 82%

Multimodal Fusion and Interpretability in Human Activity Recognition: A Reproducible Framework for Sensor-Based Modeling

多模态融合与可解释性在人体活动识别中的应用:一种可复现的基于传感器建模框架

Yiyao Yang, Yasemin Gulbahar

专题命中 多模态训练与对齐 :multimodal(title,abstract);multi-modal(abstract)

AI总结 本文提出了一种可复现的多模态融合框架,通过统一预处理和融合策略提升人体活动识别的准确性和可解释性。

Comments 33 pages, 12 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06281 2025-12-09 cs.CV cs.AI 81%

Unleashing the Intrinsic Visual Representation Capability of Multimodal Large Language Models

释放多模态大语言模型的内在视觉表示能力

Hengzhuang Li, Xinsong Zhang, Qiming Peng, Bin Luo, Han Hu, Dengyang Jiang, Han-Jia Ye, Teng Zhang, Hai Jin

机构 * HUST(华中科技大学) Tencent Hunyuan Research(腾讯混元研究) HKUST(香港科技大学) NJU(南京大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出LaVer框架,通过掩码图像建模提升多模态大语言模型的视觉表示能力,实验表明其在需要密集视觉能力的场景中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05996 2025-12-09 cs.CV cs.CY cs.RO eess.IV 79%

FishDetector-R1: Unified MLLM-Based Framework with Reinforcement Fine-Tuning for Weakly Supervised Fish Detection, Segmentation, and Counting

FishDetector-R1: 基于统一MLLM框架的弱监督鱼类检测、分割与计数强化微调方法

Yi Liu, Jingyu Song, Vedanth Kallakuri, Katherine A. Skinner

机构 * University of Michigan(密歇根大学)

专题命中 多模态训练与对齐 :MLLM(title,abstract);分类 cs.CV

AI总结 FishDetector-R1通过统一MLLM框架和强化学习微调,实现了弱监督下的鱼类检测、分割与计数的高效准确提升。

Comments 18 pages, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10573 2025-12-09 cs.CV 79%

Improving Medical Visual Representation Learning with Pathological-level Cross-Modal Alignment and Correlation Exploration

通过病理级跨模态对齐和相关性探索提升医学视觉表示学习

Jun Wang, Lixing Zhu, Xiaohan Yu, Abhir Bhalerao, Yulan He

机构 * Department of Computer Science, University of Warwick(沃里克大学计算机科学系) Department of Informatics, King’s College London(伦敦国王学院信息学系) School of Computing, Macquarie University(麦考瑞大学计算机科学学院) Alan Turing Institute, UK(英国艾伦·图灵研究所)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文提出PLACE框架,通过病理级跨模态对齐和相关性探索提升医学视觉表示学习,实现多下游任务的性能提升。

Comments Accepted to IEEE Journal of Biomedical and Health Informatics (JBHI).Code: https://github.com/Markin-Wang/PLACE

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07687 2025-12-09 cs.CL cs.CV 73%

HalluShift++: Bridging Language and Vision through Internal Representation Shifts for Hierarchical Hallucinations in MLLMs

HalluShift++: 通过内部表示转移弥合语言与视觉,解决多模态大语言模型中的层级幻觉

Sujoy Nath, Arkaprabha Basu, Sharanya Dasgupta, Swagatam Das

机构 * Netaji Subhash Engineering College (NSEC)(奈尔贾伊·萨布哈工程学院) TCG Crest Electronics and Communication Sciences Unit (ECSU)(电子与通信科学单位) Indian Statistical Institute(印度统计研究所)

专题命中 多模态训练与对齐 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.CL

AI总结 HalluShift++通过分析MLLM内部表示转移,解决多模态大语言模型中的层级幻觉问题,提升幻觉检测的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07170 2025-12-09 cs.CV cs.AI 73%

Towards Unified Semantic and Controllable Image Fusion: A Diffusion Transformer Approach

迈向统一的语义和可控图像融合:一种扩散变换器方法

Jiayang Li, Chengjie Jiang, Junjun Jiang, Pengwei Liang, Jiayi Ma, Liqiang Nie

机构 * Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算机学院) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Electronic Information School, Wuhan University(武汉大学电子信息学院)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 DiTFuse通过融合图像与自然语言指令,实现端到端、语义感知的图像融合,统一了多种融合任务并在多个基准测试中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06447 2025-12-09 cs.CV 70%

Towards Stable Cross-Domain Depression Recognition under Missing Modalities

迈向稳定跨领域抑郁识别下的缺失模态

Jiuyi Chen, Mingkui Tan, Haifeng Lu, Qiuna Xu, Zhihua Wang, Runhao Zeng, Xiping Hu

机构 * School of Future Technology, South China University of Technology(未来技术学院,华南理工大学) PengCheng Laboratory(鹏城实验室) School of Software Engineering, South China University of Technology(软件工程学院,华南理工大学) Artificial Intelligence Research Institute, Shenzhen MSU-BIT University(人工智能研究院,深圳MSU-BIT大学) Guangdong-Hong Kong-Macao Joint Laboratory for Emotional Intelligence and Pervasive Computing(粤港澳大湾区情感智能与泛在计算联合实验室) School of Computer Science and Technology, Guangdong University of Technology(计算机科学与技术学院,广东工业大学) Department of Computer Science, City University of Hong Kong(计算机科学系,香港城市大学)

专题命中 多模态训练与对齐 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出SCD-MLLM框架,通过多源数据适配器和模态感知自适应融合模块,实现稳定跨领域抑郁症识别,提升多模态数据处理的鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01946 2025-12-09 cs.CV 70%

3DRS: MLLMs Need 3D-Aware Representation Supervision for Scene Understanding

3DRS: MLLMs 需要 3D 意识表示监督以实现场景理解

Xiaohu Huang, Jingjing Wu, Qunyi Xie, Kai Han

机构 * Visual AI Lab, The University of Hong Kong(香港大学视觉人工智能实验室) Department of Computer Vision Technology (VIS), Baidu Inc.(百度公司计算机视觉技术部)

专题命中 多模态训练与对齐 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 3DRS 通过引入预训练 3D 基础模型的监督,提升 MLLM 的 3D 表示能力,从而增强场景理解性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06726 2025-12-09 cs.CV cs.AI cs.CL 67%

The Role of Entropy in Visual Grounding: Analysis and Optimization

熵在视觉定位中的作用:分析与优化

Shuo Li, Jiajun Sun, Zhihao Zhang, Xiaoran Fan, Senjie Jin, Hui Li, Yuming Yang, Junjie Ye, Lixing Shen, Tao Ji, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * Fudan University(复旦大学) Hikvision Research Institute(海康威视研究院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出ECVGPO算法,通过熵控制优化视觉定位任务,提升探索与利用的平衡,实现多基准的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏