arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-24 至 2025-12-24 共收录 41 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 3 篇

2512.20257 2025-12-24 cs.CV 83%

LADLE-MM: Limited Annotation based Detector with Learned Ensembles for Multimodal Misinformation

LADLE-MM:基于有限标注的多模态虚假信息检测器

Daniele Cardullo, Simone Teglia, Irene Amerini

机构 * Sapienza University of Rome(罗马萨皮恩扎大学)

专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV

AI总结 LADLE-MM是一种基于有限标注的多模态虚假信息检测器,通过学习的集成方法在有限资源下实现高效检测,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20088 2025-12-24 cs.CV cs.AI 62%

Item Region-based Style Classification Network (IRSN): A Fashion Style Classifier Based on Domain Knowledge of Fashion Experts

基于物品区域的风格分类网络(IRSN):一种基于时尚专家领域知识的时尚风格分类器

Jinyoung Choi, Youngchae Kwon, Injung Kim

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

AI总结 IRSN通过分析物品区域特征和组合,结合双主干架构提升时尚风格分类准确率

Comments This is a pre-print of an article published in Applied Intelligence. The final authenticated version is available online at: https://doi.org/10.1007/s10489-024-05683-9

Journal ref Applied Intelligence, Vol. 54, pp. 6197-6209 (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17004 2025-12-24 cs.CV cs.CL 62%

Vision Language Models are Confused Tourists

视觉语言模型是困惑的游客

Patrick Amadeus Irawan, Ikhlasul Akmal Hanif, Muhammad Dehan Al Kautsar, Genta Indra Winata, Fajri Koto, Alham Fikri Aji

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本研究提出ConfusedTourist,通过文化对抗鲁棒性测试揭示视觉语言模型在文化线索干扰下的稳定性问题,发现其在简单扰动下表现显著下降,凸显了多文化环境下模型鲁棒性的关键挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 3 篇

2512.20296 2025-12-24 cs.CV cs.AI eess.AS eess.IV 87%

TAVID: Text-Driven Audio-Visual Interactive Dialogue Generation

TAVID:基于文本的音频视觉交互对话生成

Ji-Hoon Kim, Junseok Ahn, Doyeop Kwak, Joon Son Chung, Shinji Watanabe

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI、eess.AS

AI总结 TAVID通过统一框架同步生成交互面部和对话语音,实现音频视觉多模态对话生成。

Comments Project page: https://mm.kaist.ac.kr/projects/TAVID

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13507 2025-12-24 cs.CV 83%

Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model

Seedance 1.5 pro: 一种原生音频视频联合生成基础模型

Team Seedance, Heyi Chen, Siyan Chen, Xin Chen, Yanfei Chen, Ying Chen, Zhuo Chen, Feng Cheng, Tianheng Cheng, Xinqi Cheng, Xuyan Chi, Jian Cong, Jing Cui, Qinpeng Cui, Qide Dong, Junliang Fan, Jing Fang, Zetao Fang, Chengjian Feng, Han Feng, Mingyuan Gao, Yu Gao, Dong Guo, Qiushan Guo, Boyang Hao, Qingkai Hao, Bibo He, Qian He, Tuyen Hoang, Ruoqing Hu, Xi Hu, Weilin Huang, Zhaoyang Huang, Zhongyi Huang, Donglei Ji, Siqi Jiang, Wei Jiang, Yunpu Jiang, Zhuo Jiang, Ashley Kim, Jianan Kong, Zhichao Lai, Shanshan Lao, Yichong Leng, Ai Li, Feiya Li, Gen Li, Huixia Li, JiaShi Li, Liang Li, Ming Li, Shanshan Li, Tao Li, Xian Li, Xiaojie Li, Xiaoyang Li, Xingxing Li, Yameng Li, Yifu Li, Yiying Li, Chao Liang, Han Liang, Jianzhong Liang, Ying Liang, Zhiqiang Liang, Wang Liao, Yalin Liao, Heng Lin, Kengyu Lin, Shanchuan Lin, Xi Lin, Zhijie Lin, Feng Ling, Fangfang Liu, Gaohong Liu, Jiawei Liu, Jie Liu, Jihao Liu, Shouda Liu, Shu Liu, Sichao Liu, Songwei Liu, Xin Liu, Xue Liu, Yibo Liu, Zikun Liu, Zuxi Liu, Junlin Lyu, Lecheng Lyu, Qian Lyu, Han Mu, Xiaonan Nie, Jingzhe Ning, Xitong Pan, Yanghua Peng, Lianke Qin, Xueqiong Qu, Yuxi Ren, Kai Shen, Guang Shi, Lei Shi, Yan Song, Yinglong Song, Fan Sun, Li Sun, Renfei Sun, Yan Sun, Zeyu Sun, Wenjing Tang, Yaxue Tang, Zirui Tao, Feng Wang, Furui Wang, Jinran Wang, Junkai Wang, Ke Wang, Kexin Wang, Qingyi Wang, Rui Wang, Sen Wang, Shuai Wang, Tingru Wang, Weichen Wang, Xin Wang, Yanhui Wang, Yue Wang, Yuping Wang, Yuxuan Wang, Ziyu Wang, Guoqiang Wei, Wanru Wei, Di Wu, Guohong Wu, Hanjie Wu, Jian Wu, Jie Wu, Ruolan Wu, Xinglong Wu, Yonghui Wu, Ruiqi Xia, Liang Xiang, Fei Xiao, XueFeng Xiao, Pan Xie, Shuangyi Xie, Shuang Xu, Jinlan Xue, Shen Yan, Bangbang Yang, Ceyuan Yang, Jiaqi Yang, Runkai Yang, Tao Yang, Yang Yang, Yihang Yang, ZhiXian Yang, Ziyan Yang, Songting Yao, Yifan Yao, Zilyu Ye, Bowen Yu, Jian Yu, Chujie Yuan, Linxiao Yuan, Sichun Zeng, Weihong Zeng, Xuejiao Zeng, Yan Zeng, Chuntao Zhang, Heng Zhang, Jingjie Zhang, Kuo Zhang, Liang Zhang, Liying Zhang, Manlin Zhang, Ting Zhang, Weida Zhang, Xiaohe Zhang, Xinyan Zhang, Yan Zhang, Yuan Zhang, Zixiang Zhang, Fengxuan Zhao, Huating Zhao, Yang Zhao, Hao Zheng, Jianbin Zheng, Xiaozheng Zheng, Yangyang Zheng, Yijie Zheng, Jiexin Zhou, Jiahui Zhu, Kuan Zhu, Shenhan Zhu, Wenjia Zhu, Benhui Zou, Feilong Zuo

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 Seedance 1.5 pro是一款专为原生音频视频联合生成设计的基础模型,通过双分支扩散变压器架构实现高质量生成,支持多语言唇形同步和动态摄像机控制,提升专业内容创作效率。

Comments Seedance 1.5 pro Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18099 2025-12-24 eess.AS cs.CV 62%

SAM Audio: Segment Anything in Audio

SAM Audio:音频中的分段任何事物

Bowen Shi, Andros Tjandra, John Hoffman, Helin Wang, Yi-Chiao Wu, Luya Gao, Julius Richter, Matt Le, Apoorv Vyas, Sanyuan Chen, Christoph Feichtenhofer, Piotr Dollár, Wei-Ning Hsu, Ann Lee

机构 * Meta Superintelligence Labs(Meta超智能实验室)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、eess.AS

AI总结 SAM Audio提出了一种统一文本、视觉和时间跨度提示的通用音频分离基础模型,实现了在多种音频任务中优于现有系统的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 3 篇

2512.17601 2025-12-24 cs.CV 83%

HeadHunt-VAD: Hunting Robust Anomaly-Sensitive Heads in MLLM for Tuning-Free Video Anomaly Detection

HeadHunt-VAD: 在MLLM中寻找鲁棒的异常敏感头部以实现无调优视频异常检测

Zhaolin Cai, Fan Li, Ziwei Zheng, Haixia Bi, Lijun He

专题命中 视频多模态 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 HeadHunt-VAD通过直接在冻结的MLLM中寻找鲁棒的异常敏感头部,实现高效的无调优视频异常检测。

Comments AAAI 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20501 2025-12-24 cs.CV 79%

Bridging Modalities and Transferring Knowledge: Enhanced Multimodal Understanding and Recognition

弥合模态与知识转移:增强多模态理解和识别

Gorjan Radevski

机构 * University of Bristol(布里斯托大学) University of Würzburg(乌尔姆大学) Processing Speech and Images (PSI)(语音与图像处理组)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出多模态对齐、翻译、融合和转移方法,提升复杂输入的理解与识别能力,涵盖空间语言、医学文本、知识图谱和动作识别等多个领域。

Comments Ph.D. manuscript; Supervisors/Mentors: Marie-Francine Moens and Tinne Tuytelaars

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20538 2025-12-24 cs.RO 78%

Uni-Mapper: Unified Mapping Framework for Multi-modal LiDARs in Complex and Dynamic Environments

Uni-Mapper:多模态激光雷达在复杂动态环境中的统一映射框架

Gilhwan Kang, Hogyun Kim, Byunghee Choi, Seokhwan Jeong, Young-Sik Shin, Younggun Cho

机构 * Hyundai Motor Company(现代汽车公司) Inha University(inha大学) Korea Institute of Machinery and Materials(韩国机械材料研究院)

专题命中 视频多模态 :multi-modal(title,abstract)

AI总结 Uni-Mapper通过动态感知和多模态激光雷达融合技术,实现复杂动态环境下的统一地图构建与回环检测。

Comments 18 pages, 14 figures

Journal ref 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 4 篇

2512.20217 2025-12-24 cs.CV 83%

LiteFusion: Taming 3D Object Detectors from Vision-Based to Multi-Modal with Minimal Adaptation

LiteFusion: 从基于视觉到多模态的3D目标检测器的最小适应

Xiangxuan Ren, Zhongdao Wang, Pin Tang, Guoqing Wang, Jilai Zheng, Chao Ma

机构 * China Ministry of Education (MOE) Key Laboratory of Artificial Intelligence(中国教育部人工智能重点实验室) Artificial Intelligence Institute, Shanghai Jiao Tong University(上海交通大学人工智能学院) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 跨模态检索 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 LiteFusion通过将LiDAR数据作为补充几何信息源,无需专用LiDAR编码器,显著提升多模态3D目标检测性能。

Comments 13 pages, 9 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20145 2025-12-24 cs.CL cs.AI cs.CV cs.IR cs.LG 67%

Retrieval-augmented Prompt Learning for Pre-trained Foundation Models

基于检索的提示学习用于预训练基础模型

Xiang Chen, Yixin Ou, Quan Feng, Lei Li, Piji Li, Haibo Ye, Sheng-Jun Huang, Shuofei Qiao, Shumin Deng, Huajun Chen, Ningyu Zhang

机构 * MIIT Key Laboratory of Pattern Analysis and Machine Intelligence, College of Computer Science and Technology, Nanjing University of Aeronautics and Astronautics(信息产业部模式分析与机器智能重点实验室,计算机科学与技术学院,南京航空航天大学) Zhejiang University(浙江大学) Hunan Vanguard Group Corporation Limited(湖南先锋集团有限公司) National University of Singapore(新加坡国立大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 RetroPrompt通过整合检索机制和知识库,提升预训练基础模型在少样本和零样本场景下的泛化能力与记忆平衡。

Comments IEEE/ACM Transactions on Audio, Speech and Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20029 2025-12-24 cs.CV 57%

$\text{H}^2$em: Learning Hierarchical Hyperbolic Embeddings for Compositional Zero-Shot Learning

H²em:学习分层双曲嵌入用于组合零样本学习

Lin Li, Jiahui Li, Jiaming Lei, Jun Xiao, Feifei Shao, Long Chen

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

AI总结 H²em通过双曲几何学习分层嵌入,解决组合零样本学习中的层次结构建模问题,提升细粒度辨别能力和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19972 2025-12-24 cs.DC 50%

Rethinking Knowledge Distillation in Collaborative Machine Learning: Memory, Knowledge, and Their Interactions

重新思考协同机器学习中的知识蒸馏:记忆、知识及其交互

Pengchao Han, Xi Huang, Yi Fang, Guojun Han

专题命中 跨模态检索 :multi-modal(abstract)

AI总结 本文重新审视协同机器学习中的知识蒸馏,探讨记忆与知识的交互作用,分析不同学习模式下的挑战与未来方向。

Comments Published in IEEE TNSE

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 5 篇

2512.20436 2025-12-24 eess.IV cs.AI cs.CV 81%

Dual-Encoder Transformer-Based Multimodal Learning for Ischemic Stroke Lesion Segmentation Using Diffusion MRI

基于双编码变压器的多模态学习用于扩散磁共振成像的缺血性中风病变分割

Muhammad Usman, Azka Rehman, Muhammad Mutti Ur Rehman, Abd Ur Rehman, Muhammad Umar Farooq

机构 * Department of Anesthesiology, Perioperative and Pain Medicine, Stanford University(麻醉学、围术期与疼痛医学系,斯坦福大学) Department of Biomedical Sciences, Seoul National University(生物医学科学系,首尔国立大学) Department of Computer Engineering, National University of Sciences and Technology (NUST)(计算机工程系,国立科学与技术大学(NUST)) Department of Computer Science, The University of Alabama(计算机科学系,阿拉巴马大学) Department of Computer Science, Hanyang University(计算机科学系,翰阳大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出双编码变压器架构,利用多模态扩散MRI实现缺血性中风病变分割,达到85.4%的Dice分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19983 2025-12-24 cs.IR 78%

IGDMRec: Behavior Conditioned Item Graph Diffusion for Multimodal Recommendation

IGDMRec: 基于行为的物品图扩散用于多模态推荐

Ziyuan Guo, Jie Guo, Zhenghao Chen, Bin Song, Fei Richard Yu

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 IGDMRec通过行为条件图扩散和条件去噪网络,利用用户行为信息去噪多模态推荐的语义物品图,提升推荐性能。

Comments 12 pages, 6 figures. This paper has been accepted for publication in IEEE Transactions on Multimedia. The final published version will be available via IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00477 2025-12-24 cs.CV 74%

LAMIC: Layout-Aware Multi-Image Composition via Scalability of Multimodal Diffusion Transformer

LAMIC:基于多模态扩散变换器可扩展性的布局感知多图像合成

Yuzhuo Chen, Zehua Ma, Jianhua Wang, Kai Kang, Shunyu Yao, Weiming Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Onestory Team(Onestory团队) East China Normal University(华东师范大学)

专题命中 多模态生成 :multimodal(title);分类 cs.CV

AI总结 LAMIC通过无训练方式实现多参考图像合成,提升布局控制与背景一致性。

Comments 8 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20479 2025-12-24 cs.CV 70%

UTDesign: A Unified Framework for Stylized Text Editing and Generation in Graphic Design Images

UTDesign: 一种统一框架,用于图形设计图像中的风格化文本编辑与生成

Yiming Zhao, Yuanpeng Gao, Yuxuan Luo, Jiwei Duan, Shisong Lin, Longfei Xiong, Zhouhui Lian

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所) State Key Laboratory of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室)

专题命中 多模态生成 :multi-modal(abstract);MLLM(abstract);分类 cs.CV

AI总结 UTDesign提出了一种统一框架,实现高精度风格化文本编辑与生成,支持中英文文本,通过多模态编码器和DiT模型提升设计图像中的文本生成与编辑能力。

Comments 22 pages, 25 figures, SIGGRAPH Asia 2025, Conference Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08189 2025-12-24 cs.CV 57%

Reinforcement Learning for Large Model: A Survey

为大模型设计强化学习:综述

Weijia Wu, Chen Gao, Joya Chen, Kevin Qinghong Lin, Qingwei Meng, Yiming Zhang, Yuke Qiu, Hong Zhou, Mike Zheng Shou

机构 * National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 本文综述了视觉强化学习领域,探讨了多模态大语言模型、视觉生成等四个主题,分析了算法设计、奖励工程及评估协议,并指出了样本效率、泛化能力等开放挑战。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态评测 8 篇

2512.20168 2025-12-24 cs.CR cs.AI cs.LG 85%

Odysseus: Jailbreaking Commercial Multimodal LLM-integrated Systems via Dual Steganography

奥德赛:通过双隐写术对集成多模态大语言模型系统的商业系统进行劫持

Songze Li, Jiameng Cheng, Yiming Li, Xiaojun Jia, Dacheng Tao

机构 * S3IC-Lab(S3IC实验室)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);cross-modal(abstract);分类 cs.AI

AI总结 奥德赛通过双隐写术劫持多模态大语言模型集成系统,揭示现有安全过滤器的局限性,实现高达99%的攻击成功率。

Comments This paper is accepted by Network and Distributed System Security Symposium (NDSS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19716 2025-12-24 cs.LG cs.AI 79%

Development and external validation of a multimodal artificial intelligence mortality prediction model of critically ill patients using multicenter data

基于多模态人工智能的危重患者死亡风险预测模型的开发与外部验证

Behrooz Mamandipoor, Chun-Nan Hsu, Martin Krause, Ulrich H. Schmidt, Rodney A. Gabriel

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本研究开发了多模态人工智能模型,用于预测危重患者院内死亡风险,并通过外部验证展示了其有效性。

Comments 75 pages (33 main text + references, 35 supplementary materials), 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10229 2025-12-24 cs.LG cs.AI 79%

Adaptive Information Routing for Multimodal Time Series Forecasting

自适应信息路由用于多模态时间序列预测

Jun Seo, Hyeokjun Choe, Seohui Bae, Soyeon Park, Wonbin Ahn, Taeyoon Lim, Junhyeok Kang, Sangjun Han, Jaehoon Lee, Dongwan Kang, Minjae Kim, Sungdong Yoo, Soonyoung Lee

机构 * LG AI Research(LG人工智能研究)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出自适应信息路由框架,通过动态利用文本信息优化时间序列模型,提升多模态预测的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20595 2025-12-24 cs.CL cs.AI cs.CV 75%

Cube Bench: A Benchmark for Spatial Visual Reasoning in MLLMs

Cube Bench: 一个用于多模态大语言模型空间视觉推理的基准测试

Dhruv Anand, Ehsan Shareghi

机构 * Department of Data Science and AI, Monash University(数据科学与人工智能系,墨尔本大学)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 Cube Bench通过评估多模态大语言模型在空间视觉推理中的能力,揭示了模型在复杂任务中的表现差异及自我纠正的局限性。

Comments 27 pages, 5 figures, 9 tables. Cube available at https://github.com/dana-23/cube-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20344 2025-12-24 cs.AI 57%

A DeepSeek-Powered AI System for Automated Chest Radiograph Interpretation in Clinical Practice

基于DeepSeek的AI系统用于临床实践中自动胸部X光解读

Yaowei Bai, Ruiheng Zhang, Yu Lei, Xuhua Duan, Jingfeng Yao, Shuguang Ju, Chaoyang Wang, Wei Yao, Yiwan Guo, Guilin Zhang, Chao Wan, Qian Yuan, Lei Chen, Wenjuan Tang, Biqiang Zhu, Xinggang Wang, Tao Sun, Wei Zhou, Dacheng Tao, Yongchao Xu, Chuansheng Zheng, Huangxuan Zhao, Bo Du

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 基于DeepSeek的AI系统在临床实践中实现自动胸部X光解读,提升诊断可靠性与效率,减少解读时间并获得专家认可。

Comments arXiv admin note: substantial text overlap with arXiv:2507.19493

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20013 2025-12-24 cs.CV 57%

SegEarth-R2: Towards Comprehensive Language-guided Segmentation for Remote Sensing Images

SegEarth-R2: 向远程 sensing 图像的全面语言引导分割迈进

Zepeng Xin, Kaiyu Li, Luodi Chen, Wanchen Li, Yuchen Xiao, Hui Qiao, Weizhan Zhang, Deyu Meng, Xiangyong Cao

机构 * Xi’an Jiaotong University(西安交通大学) China Telecom Shaanxi Branch(中国电信陕西分支)

专题命中 多模态评测 :MLLM(abstract);分类 cs.CV

AI总结 SegEarth-R2通过MLLM架构实现远程 sensing 图像的全面语言引导分割,解决复杂场景下的多目标和隐含意图识别问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19743 2025-12-24 cs.LG cs.AI cs.CG 57%

From Theory to Throughput: CUDA-Optimized APML for Large-Batch 3D Learning

从理论到吞吐量:用于大规模批量3D学习的CUDA优化APML

Sasan Sharifipour, Constantino Álvarez Casado, Manuel Lage Cañellas, Miguel Bordallo López

机构 * Center for Machine Vision and Signal Analysis (CMVS), University of Oulu(机器视觉与信号分析中心(CMVS),奥卢大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 CUDA-APML通过稀疏GPU实现优化大规模批量3D学习的APML,显著降低内存使用并保持模型精度。

Comments 5 pages, 2 figures, 2 tables, 5 formulas, 34 references, journal paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12711 2025-12-24 cs.CV 57%

Drifting Away from Truth: GenAI-Driven News Diversity Challenges LVLM-Based Misinformation Detection

远离真相:生成式AI驱动的新闻多样性对基于LVLM的虚假信息检测的挑战

Fanxiao Li, Jiaying Wu, Tingchao Fu, Yunyun Dong, Bingbing Song, Wei Zhou

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文探讨生成式AI驱动的新闻多样性对基于LVLM的虚假信息检测系统造成的挑战,通过DriftBench基准揭示了现有系统在多级漂移下的鲁棒性问题,并指出需要更稳健的解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 多模态Agent 7 篇

2508.13256 2025-12-24 cs.AI cs.CY cs.MA 79%

CardAIc-Agents: A Multimodal Framework with Hierarchical Adaptation for Cardiac Care Support

CardAIc-Agents: 一种用于心脏护理支持的多模态框架,具有分层适应性

Yuting Zhang, Karina V. Bunting, Asgher Champsi, Xiaoxia Wang, Wenqi Lu, Alexander Thorley, Sandeep S Hothi, Zhaowen Qiu, Baturalp Buyukates, Dipak Kotecha, Jinming Duan

机构 * School of Computer Science, University of Birmingham, UK(英国伯明翰大学计算机科学学院) Department of Cardiovascular Sciences, University of Birmingham, UK(英国伯明翰大学心血管科学系) NIHR Birmingham Biomedical Research Centre and West Midlands NHS Secure Data Environment, University Hospitals Birmingham NHS Foundation Trust, UK(英国伯明翰大学医院 NHS 基础信任机构) Department of Computing and Mathematics, Manchester Metropolitan University, UK(曼彻斯特 Metropolitan 大学计算与数学系) Department of Cardiology, Heart and Lung Centre, Royal Wolverhampton NHS Trust, UK(皇家沃尔夫汉普顿 NHS 委员会心内科部门) College of Computer and Control Engineering, Northeast Forestry University, China(中国东北林业大学计算机与控制工程学院) Julius Center, University Medical Center Utrecht, the Netherlands(荷兰乌得勒支大学医学中心朱利叶斯中心) Division of Informatics, Imaging and Data Sciences, University of Manchester, UK(英国曼彻斯特大学信息学、成像与数据科学系)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 CardAIc-Agents通过多模态框架和分层适应性,提升心脏护理支持的效率和灵活性,有效解决传统AI代理在适应性推理、工具支持、知识更新和视觉输出方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19742 2025-12-24 cs.LG 78%

On-device Large Multi-modal Agent for Human Activity Recognition

用于人体活动识别的设备端大多模态智能体

Md Shakhrul Iman Siam, Ishtiaque Ahmed Showmik, Guanqun Song, Ting Zhu

机构 * The Ohio State University(俄亥俄州立大学)

专题命中 多模态Agent :multi-modal(title,abstract)

AI总结 本文提出了一种用于人体活动识别的设备端大多模态智能体,结合大语言模型提升性能与可解释性,实现高分类准确率和用户友好交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19933 2025-12-24 cs.CL 70%

PRISM: A Personality-Driven Multi-Agent Framework for Social Media Simulation

PRISM: 一种基于个性的多智能体框架用于社交媒体模拟

Zhixiang Lu, Xueyuan Deng, Yiran Liu, Yulong Li, Qiang Yan, Imran Razzak, Jionglong Su

机构 * University of Liverpool(利物浦大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) University College London(伦敦大学学院) Xi'an Jiaotong-Liverpool University(西安交通大学-利物浦大学) Chinese Academy of Sciences(中国科学院) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract);分类 cs.CL

AI总结 PRISM通过结合连续情绪演变与基于个性的决策过程,提供了一种更准确模拟社交媒体中个性驱动意见极化的框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19280 2025-12-24 cs.CV 70%

RemoteReasoner: Towards Unifying Geospatial Reasoning Workflow

RemoteReasoner: 向统一地理空间推理流程迈进

Liang Yao, Fan Liu, Hongbo Lu, Chuanyi Zhang, Rui Min, Shengxiang Xu, Shimin Di, Pai Peng

机构 * COWARobot

专题命中 多模态Agent :multi-modal(abstract);MLLM(abstract);分类 cs.CV

AI总结 RemoteReasoner通过强化学习实现统一地理空间推理流程,具备多粒度任务处理能力和自主推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏