arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-11-27 至 2025-11-27 共收录 54 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 5 篇

2511.21002 2025-11-27 cs.CV cs.AI 84%

Knowledge Completes the Vision: A Multimodal Entity-aware Retrieval-Augmented Generation Framework for News Image Captioning

知识完善视觉:一种多模态实体感知检索增强生成框架用于新闻图像描述

Xiaoxing You, Qiang Huang, Lingyu Li, Chi Zhang, Xiaopeng Liu, Min Zhang, Jun Yu

专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 MERGE提出了一种多模态实体感知检索增强生成框架,通过构建实体中心知识库和改进跨模态对齐,提升新闻图像描述质量和命名实体识别性能。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00396 2025-11-27 cs.CV 83%

Saliency-R1: Incentivizing Unified Saliency Reasoning Capability in MLLM with Confidence-Guided Reinforcement Learning

Saliency-R1: 通过置信度引导的强化学习激励多模态大语言模型统一的显著性推理能力

Long Li, Shuichen Ji, Ziyang Luo, Zhihui Li, Dingwen Zhang, Junwei Han, Nian Liu

机构 * Northwestern Polytechnical University(西北工业大学) University of Science and Technology of China(中国科学技术大学)

专题命中 图文多模态 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 Saliency-R1通过置信度引导的强化学习,提升多模态大语言模型在显著性推理任务中的统一能力,实现显著物体检测、显著实例分割和共显著物体检测的高效处理。

Comments Main text (excluding references): 8 pages, 4 figures; Supplementary Materials (excluding references): 9 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21150 2025-11-27 cs.CV cs.AI 73%

LLaVA-UHD v3: Progressive Visual Compression for Efficient Native-Resolution Encoding in MLLMs

LLaVA-UHD v3:渐进式视觉压缩用于多模态大语言模型中的高效原分辨率编码

Shichu Sun, Yichen Zhang, Haolin Song, Zonghao Guo, Chi Chen, Yidan Zhang, Yuan Yao, Zhiyuan Liu, Maosong Sun

机构 * Tsinghua University(清华大学) University of Chinese Academy of Sciences(中国科学院大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航天信息研究所) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院)

专题命中 图文多模态 :multi-modal(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 LLaVA-UHD v3通过渐进式视觉压缩方法,实现高效原分辨率编码,减少TTFT并提升多模态大语言模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20994 2025-11-27 cs.CV cs.AI cs.CR 73%

GuardTrace-VL: Detecting Unsafe Multimodel Reasoning via Iterative Safety Supervision

GuardTrace-VL: 通过迭代安全监督检测不安全的多模型推理

Yuxiao Xiang, Junchi Chen, Zhenchao Jin, Changtao Miao, Haojie Yuan, Qi Chu, Tao Gong, Nenghai Yu

机构 * School of Cyber Science and Technology, University of Science and Technology of China(中国科学技术大学网络安全学院) Anhui Province Key Laboratory of Digital Security(安徽省数字安全重点实验室) The University of Hong Kong(香港大学)

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 GuardTrace-VL通过联合图像-文本分析监控多模态推理全过程,有效检测不安全推理内容,实现93.1%的F1分数提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19516 2025-11-27 cs.CV 70%

Connecting the Dots: Training-Free Visual Grounding via Agentic Reasoning

连接点:通过代理推理实现无需训练的视觉接地

Liqin Luo, Guangyao Chen, Xiawu Zheng, Yongxing Dai, Yixiong Zou, Yonghong Tian

专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 GroundingAgent通过代理推理实现无需微调的视觉接地,达到65.1%的零样本准确率,并在选择阶段实现90%的准确率,展示了LLM推理能力的重要性。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 4 篇

2511.21146 2025-11-27 cs.MM cs.CV cs.SD 90%

AV-Edit: Multimodal Generative Sound Effect Editing via Audio-Visual Semantic Joint Control

AV-Edit: 通过音频-视觉语义联合控制实现多模态生成式声音效果编辑

Xinyue Guo, Xiaoran Yang, Lipan Zhang, Jianxuan Yang, Zhao Wang, Jian Luan

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV、cs.MM

AI总结 AV-Edit通过联合利用视觉、音频和文本语义,实现多模态生成式声音效果编辑,提升音频编辑的精度和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01812 2025-11-27 cs.CY cs.AI cs.CL 73%

From Text to Multimodality: Exploring the Evolution and Impact of Large Language Models in Medical Practice

从文本到多模态:探索大型语言模型在医疗实践中的演变与影响

Qian Niu, Keyu Chen, Ming Li, Pohsun Feng, Ziqian Bi, Lawrence KQ Yan, Yichao Zhang, Caitlyn Heqi Yin, Cheng Fei, Junyu Liu, Tianyang Wang, Yunze Wang, Silin Chen, Ming Liu, Benji Peng, Xinyuan Song, Ziyuan Qin, Riyang Bao, Zekun Jiang

机构 * Kyoto University(京都大学) Georgia Institute of Technology(佐治亚理工学院) National Taiwan Normal University(台湾师范大学) Indiana University(印第安纳大学) Hong Kong University of Science(香港科学大学) The University of Texas at Dallas(德克萨斯大学达拉斯分校) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Cornell University(康奈尔大学) University of Liverpool(利物浦大学) University of Edinburgh(爱丁堡大学) Zhejiang University(浙江大学) Purdue University(Purdue 大学) Emory University, Atlanta, GA, USA(埃默里大学) West China Biomedical Big Data Center, West China Hospital, Sichuan University, Chengdu, China(西京生物大数据中心,四川大学西京医院,成都,中国)

专题命中 音频语音多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了多模态大型语言模型在医疗实践中的发展与影响,分析其在医疗影像、临床决策支持等领域的应用及面临的挑战。

Comments 12 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15848 2025-11-27 cs.AI cs.CL cs.SD 62%

Step-Audio-R1 Technical Report

Step-Audio-R1 技术报告

Fei Tian, Xiangyu Tony Zhang, Yuxin Zhang, Haoyang Zhang, Yuxin Li, Daijiao Liu, Yayue Deng, Donghang Wu, Jun Chen, Liang Zhao, Chengyuan Yao, Hexin Liu, Eng Siong Chng, Xuerui Yang, Xiangyu Zhang, Daxin Jiang, Gang Yu

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 Step-Audio-R1 是首个实现音频领域推理能力的模型,通过MGRD框架生成基于声音特征的推理链,超越Gemini 2.5 Pro并达到Gemini 3 Pro水平。

Comments 22 pages, 5 figures. Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20686 2025-11-27 cs.AI cs.CY cs.LG 57%

AssurAI: Experience with Constructing Korean Socio-cultural Datasets to Discover Potential Risks of Generative AI

AssurAI: 韩国社会文化数据集构建经验以发现生成式AI的潜在风险

Chae-Gyun Lim, Seung-Ho Han, EunYoung Byun, Jeongyun Han, Soohyun Cho, Eojin Joo, Heehyeon Kim, Sieun Kim, Juhoon Lee, Hyunsoo Lee, Dongkun Lee, Jonghwan Hyeon, Yechan Hwang, Young-Jun Lee, Kyeongryul Lee, Minhyeong An, Hyunjun Ahn, Jeongwoo Son, Junho Park, Donggyu Yoon, Taehyung Kim, Jeemin Kim, Dasom Choi, Kwangyoung Lee, Hyunseung Lim, Yeohyun Jung, Jongok Hong, Sooyohn Nam, Joonyoung Park, Sungmin Na, Yubin Choi, Jeanne Choi, Yoojin Hong, Sueun Jang, Youngseok Seo, Somin Park, Seoungung Jo, Wonhye Chae, Yeeun Jo, Eunyoung Kim, Joyce Jiyoung Whang, HwaJung Hong, Joseph Seering, Uichin Lee, Juho Kim, Sunna Choi, Seokyeon Ko, Taeho Kim, Kyunghoon Kim, Myungsik Ha, So Jung Lee, Jemin Hwang, JoonHo Kwak, Ho-Jin Choi

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 AssurAI通过构建高质量的韩语多模态数据集,评估生成式AI的安全性,发现潜在风险,促进更安全的AI发展。

Comments 16 pages, HuggingFace: https://huggingface.co/datasets/TTA01/AssurAI

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 8 篇

2506.12336 2025-11-27 cs.CV 83%

Benchmarking the Trustworthiness in Multimodal LLMs for Video Understanding

对多模态大语言模型在视频理解中的可信度进行基准测试

Youze Wang, Zijun Chen, Ruoyu Chen, Shishen Gu, Wenbo Hu, Jiayang Liu, Yinpeng Dong, Hang Su, Jun Zhu, Meng Wang, Richang Hong

机构 * Hefei University of Technology(合肥工业大学) Tsinghua University(清华大学) Institute of Science Tokyo(东京科学研究所)

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本研究提出Trust-videoLLMs基准,评估23种视频LLMs在真实性、鲁棒性、安全性和隐私等方面的表现,揭示其在动态场景理解及现实风险缓解中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21375 2025-11-27 cs.CV 70%

Thinking With Bounding Boxes: Enhancing Spatio-Temporal Video Grounding via Reinforcement Fine-Tuning

通过边界框思考:通过强化微调提升空间时间视频定位

Xin Gu, Haoji Zhang, Qihang Fan, Jingxuan Niu, Zhipeng Zhang, Libo Zhang, Guang Chen, Fan Chen, Longyin Wen, Sijie Zhu

机构 * ByteDance Intelligent Creation(字节跳动智能创作) Tsinghua University(清华大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Shanghai Jiao Tong University(上海交通大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 STVG-o1通过强化微调提升空间时间视频定位性能,实现无需架构修改的先进结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16595 2025-11-27 cs.CV cs.AI cs.CL 67%

TimeViper: A Hybrid Mamba-Transformer Vision-Language Model for Efficient Long Video Understanding

TimeViper: 一种用于高效长视频理解的混合Mamba-Transformer视觉语言模型

Boshen Xu, Zihan Xiao, Jiaze Li, Jianzhong Ju, Zhenbo Luo, Jian Luan, Qin Jin

机构 * AIM3 Lab, Renmin University of China(中国人民大学人工智能实验室) MiLM Plus, Xiaomi Inc.(小米公司)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 TimeViper是一种混合Mamba-Transformer模型,通过TransV模块实现高效长视频理解,提升多模态处理能力。

Comments Project page: https://xuboshen.github.io/TimeViper; Code: https://github.com/xiaomi-research/timeviper

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21439 2025-11-27 cs.CV cs.AI 62%

EvRainDrop: HyperGraph-guided Completion for Effective Frame and Event Stream Aggregation

EvRainDrop:基于超图的高效帧和事件流聚合

Futian Wang, Fan Zhang, Xiao Wang, Mengqi Wang, Dexing Huang, Jin Tang

机构 * School of Computer Science and Technology, Anhui University(计算机科学与技术学院,安徽大学)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 EvRainDrop通过超图引导的方法完成事件流,实现多模态特征的有效融合与学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17490 2025-11-27 cs.CV 57%

Video-R4: Reinforcing Text-Rich Video Reasoning with Visual Rumination

Video-R4:通过视觉沉思强化文本丰富的视频推理

Yolo Y. Tang, Daiki Shimada, Hang Hua, Chao Huang, Jing Bi, Rogerio Feris, Chenliang Xu

机构 * University of Rochester(罗切斯特大学) Sony Group Corporation(索尼集团) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 Video-R4通过视觉沉思机制提升文本丰富视频的推理能力,采用多阶段学习框架实现像素基础的多模态推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01533 2025-11-27 cs.CV 57%

ReasonAct: Progressive Training for Fine-Grained Video Reasoning in Small Models

ReasonAct: 为小模型在细粒度视频推理中的渐进训练

Jiaxin Liu, Zhaolu Kang

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 ReasonAct通过三阶段训练提升小模型细粒度视频推理性能,实现比基线更高的准确率和计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21500 2025-11-27 cs.LG 50%

Lost in Time? A Meta-Learning Framework for Time-Shift-Tolerant Physiological Signal Transformation

时光流逝?一种用于时间偏移容忍生理信号转换的元学习框架

Qian Hong, Cheng Bian, Xiao Zhou, Xiaoyu Li, Yelei Li, Zijing Zeng

专题命中 视频多模态 :multimodal(abstract)

AI总结 ShiftSyncNet通过元学习框架自动缓解时间偏移对生理信号转换的影响,提升转换精度和标签质量。

Comments The 40th Annual AAAI Conference on Artificial Intelligence (AAAI 26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.04749 2025-11-27 astro-ph.HE 50%

Bayesian Black Hole Photogrammetry

贝叶斯黑洞摄影测量

Dominic O. Chang, Michael D. Johnson, Paul Tiede, Daniel C. M. Palumbo

专题命中 视频多模态 :multi-modal(abstract)

AI总结 该研究提出了一种双锥吸积模型,用于分析EHT观测的黑洞图像,并通过贝叶斯推断确定质量-距离比和倾角的范围。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 3 篇

2511.19278 2025-11-27 cs.CV 83%

ReMatch: Boosting Representation through Matching for Multimodal Retrieval

ReMatch: 通过匹配提升表示以实现多模态检索

Qianying Liu, Xiao Liang, Zhiqiang Zhang, Zhongfei Qing, Fengfan Zhou, Yibo Chen, Xu Tang, Yao Hu, Paul Henderson

机构 * University of Glasgow(格拉斯哥大学) Xiaohongshu Inc.(小红书公司) Huazhong University of Science and Technology(华中科技大学)

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 ReMatch通过生成匹配阶段提升多模态检索的表示能力,利用端到端训练和细粒度嵌入生成,在MMEB基准上取得新突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20854 2025-11-27 cs.CV cs.AI cs.CL 67%

Unsupervised Memorability Modeling from Tip-of-the-Tongue Retrieval Queries

从舌尖上的遗忘检索查询中无监督建模可记忆性

Sree Bhattacharyya, Yaman Kumar Singla, Sudhir Yarram, Somesh Kumar Singh, Harini S, James Z. Wang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Adobe Media and Data Science Research(Adobe媒体与数据科学研究)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出首个大规模无监督数据集,通过舌尖上的遗忘检索查询建模视觉内容的可记忆性,并展示了其在回忆生成和ToT检索任务中的优越表现。

Comments Accepted at WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20783 2025-11-27 cs.CL 57%

On The Role of Pretrained Language Models in General-Purpose Text Embeddings: A Survey

在预训练语言模型中通用文本嵌入的作用:综述

Meishan Zhang, Xin Zhang, Xinping Zhao, Shouzheng Huang, Baotian Hu, Min Zhang

机构 * Institute for Clarity in Documentation(清晰文档研究所) Inria Paris-Rocquencourt(巴黎- Rocquencourt 国家信息与自动化研究所) Rajiv Gandhi University(拉贾·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒尔研究实验室) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL

AI总结 本文综述了预训练语言模型在通用文本嵌入中的作用,探讨了其架构、核心方法及未来研究方向。

Comments 45 pages, 4 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 5 篇

2511.18780 2025-11-27 cs.CV cs.AI 84%

ConceptGuard: Proactive Safety in Text-and-Image-to-Video Generation through Multimodal Risk Detection

ConceptGuard:通过多模态风险检测实现文本-图像到视频生成的主动安全

Ruize Ma, Minghong Cai, Yilei Jiang, Jiaming Han, Yi Feng, Yingshui Tan, Xiaoyong Zhu, Bo Zhang, Bo Zheng, Xiangyu Yue

机构 * CUHK MMLab(香港中文大学多模态实验室) Future Lab, Alibaba Group(阿里巴巴集团未来实验室) Nanjing University(南京大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 多模态生成 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 ConceptGuard通过多模态风险检测实现文本-图像到视频生成的主动安全,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21691 2025-11-27 cs.CV 79%

Canvas-to-Image: Compositional Image Generation with Multimodal Controls

画布到图像:利用多模态控制的组合图像生成

Yusuf Dalva, Guocheng Gordon Qian, Maya Goldenberg, Tsai-Shien Chen, Kfir Aberman, Sergey Tulyakov, Pinar Yanardag, Kuan-Chieh Jackson Wang

机构 * Snap Inc. UC Merced(加州大学默塞德分校) Virginia Tech(弗吉尼亚理工大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 Canvas-to-Image通过统一框架整合多模态控制,提升图像生成的组合性和控制精度。

Comments 24 pages; webpage: https://snap-research.github.io/canvas-to-image/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21129 2025-11-27 cs.CV cs.GR 79%

CtrlVDiff: Controllable Video Generation via Unified Multimodal Video Diffusion

通过统一多模态视频扩散实现可控视频生成

Dianbing Xi, Jiepeng Wang, Yuanzhi Liang, Xi Qiu, Jialun Liu, Hao Pan, Yuchi Huo, Rui Wang, Haibin Huang, Chi Zhang, Xuelong Li

机构 * State Key Laboratory of CAD&CG(计算机辅助设计与图形学国家重点实验室) Institute of Artificial Intelligence, China Telecom (TeleAI)(中国电信人工智能研究院) Tsinghua University(清华大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 CtrlVDiff通过统一多模态视频扩散模型,实现可控视频生成,支持多模态输入并提升生成的可控性和保真度。

Comments 27 pages, 18 figures, 9 tables. Project page: https://tele-ai.github.io/CtrlVDiff/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09298 2025-11-27 cs.CV cs.AI 62%

DensiCrafter: Physically-Constrained Generation and Fabrication of Self-Supporting Hollow Structures

DensiCrafter: 基于物理约束的自支撑空心结构生成与制造

Shengqi Dang, Fu Chai, Jiaxin Li, Chao Yuan, Wei Ye, Nan Cao

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 DensiCrafter通过优化密度场生成轻量自支撑空心结构,结合物理约束和预训练模型,提升3D打印稳定性与几何保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10382 2025-11-27 cs.CV 57%

Towards Spatially Consistent Image Generation: On Incorporating Intrinsic Scene Properties into Diffusion Models

迈向空间一致的图像生成:将内在场景属性纳入扩散模型

Hyundo Lee, Suhyung Choi, Inwoo Hwang, Byoung-Tak Zhang

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

AI总结 本文提出一种基于内在场景属性的图像生成方法,通过同时生成图像和其内在属性,提升生成图像的空间一致性和真实感。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态评测 9 篇

2501.12422 2025-11-27 cs.LG cs.AI cs.CV 90%

CroMe: Multimodal Fake News Detection using Cross-Modal Tri-Transformer and Metric Learning

CroMe:基于跨模态三变换器和度量学习的多模态假新闻检测

Eunjee Choi, Junhyun Ahn, XinYu Piao, Jong-Kook Kim

机构 * Department of Electrical and Computer Engineering, Korea University, Seoul 02841, Republic of Korea(电气与计算机工程系,韩国大学,首尔)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(title,abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 CroMe通过跨模态三变换器和度量学习方法,提升多模态假新闻检测的准确性和有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21339 2025-11-27 cs.CV cs.AI 81%

SurgMLLMBench: A Multimodal Large Language Model Benchmark Dataset for Surgical Scene Understanding

SurgMLLMBench: 一个用于手术场景理解的多模态大语言模型基准数据集

Tae-Min Choi, Tae Kyeong Jeong, Garam Kim, Jaemin Lee, Yeongyoon Koh, In Cheul Choi, Jae-Ho Chung, Jong Woong Park, Juyoun Park

机构 * Samsung Research(三星研究所) Center for Humanoid Research, Korea Institute of Science and Technology(人类研究学院,韩国科学技术院) Department of plastic surgery, College of medicine, Korea University(医学院整形外科部,韩国大学) Department of orthopedic surgery, College of medicine, Korea University(医学院骨科部,韩国大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 SurgMLLMBench是一个用于手术场景理解的多模态大语言模型基准数据集,整合了像素级分割和结构化VQA注释,支持跨领域的全面评估和更丰富的视觉-对话交互。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12307 2025-11-27 cs.CV cs.CL 81%

LogicOCR: Do Your Large Multimodal Models Excel at Logical Reasoning on Text-Rich Images?

LogicOCR: 大型多模态模型在文本丰富的图像上逻辑推理是否表现优异?

Maoyuan Ye, Haibin He, Qihuang Zhong, Jing Zhang, Juhua Liu, Bo Du

机构 * School of Computer Science, National Engineering Research Center for Multimedia Software, Institute of Artificial Intelligence, and Hubei Key Laboratory of Multimedia and Network Communication Engineering, Wuhan University(计算机学院、多媒体软件国家工程研究中心、人工智能研究院、多媒体与网络通信工程湖北省重点实验室、武汉大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 LogicOCR通过构建包含生成和现实图像问题的基准测试,评估大型多模态模型在文本丰富图像上的逻辑推理能力,并提出TextCue方法提升模型对关键文本区域的感知。

Comments GitHub: https://github.com/MiliLab/LogicOCR

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21364 2025-11-27 cs.LG cs.CV 80%

BanglaMM-Disaster: A Multimodal Transformer-Based Deep Learning Framework for Multiclass Disaster Classification in Bangla

BanglaMM-Disaster: 一种基于Transformer的多模态深度学习框架,用于孟加拉语多类灾害分类

Ariful Islam, Md Rifat Hossen, Md. Mahmudul Arif, Abdullah Al Noman, Md Arifur Rahman

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Chittagong University of Engineering and Technology(奇特格隆工程与技术大学) Department of Electronics and Telecommunication Engineering(电子与电信工程系) Wilmington University(维明顿大学) College of Graduate and Professional Studies(研究生与专业研究学院) Trine University(特林大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 BanglaMM-Disaster通过结合文本和视觉数据,提出了一种多模态深度学习框架,用于孟加拉语多类灾害分类,提升了灾害响应效率。

Comments Presented at the 2025 IEEE International Conference on Signal Processing, Information, Communication and Systems (SPICSCON), November 21-22, 2025, University of Rajshahi, Bangladesh. 6 pages, 9 disaster classes, multimodal dataset with 5,037 samples

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21422 2025-11-27 cs.CV 79%

E-M3RF: An Equivariant Multimodal 3D Re-assembly Framework

E-M3RF:一个等价多模态3D重装配框架

Adeela Islam, Stefano Fiorini, Manuel Lecha, Theodore Tsesmelis, Stuart James, Pietro Morerio, Alessio Del Bue

机构 * Fondazione Istituto Italiano di Tecnologia(意大利技术研究院) University of Genova(热那亚大学) Durham University(杜伦大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 E-M3RF通过多模态特征融合和SE(3)流匹配,有效提升3D碎片重装配的精度与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏