arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-11-24 至 2025-11-24 共收录 43 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 8 篇

2407.07026 2025-11-24 cs.CV cs.CL cs.MM cs.SI 85%

Resolving Sentiment Discrepancy for Multimodal Sentiment Detection via Semantics Completion and Decomposition

通过语义补全与分解解决多模态情感检测中的情感差异

Daiqing Wu, Dongbao Yang, Huawen Shen, Can Ma, Yu Zhou

机构 * IIE, Chinese Academy of Sciences(中国科学院信息工程研究所) Nankai University(南开大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.MM

AI总结 本文提出CoDe网络,通过语义补全与分解解决多模态情感检测中的情感差异问题,提升分类性能。

Comments Accepted by Pattern Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12972 2025-11-24 cs.CV cs.AI 84%

Aligning Vision to Language: Annotation-Free Multimodal Knowledge Graph Construction for Enhanced LLMs Reasoning

对齐视觉与语言:无需注释的多模态知识图谱构建以增强大语言模型推理

Junming Liu, Siyuan Meng, Yanting Gao, Song Mao, Pinlong Cai, Guohang Yan, Yirong Chen, Zilin Bian, Ding Wang, Botian Shi

机构 * Tongji University(同济大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) East China Normal University(华东师范大学) Stanford University(斯坦福大学) New York University(纽约大学)

专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出 VaLiK 方法,通过跨模态信息补充构建无需注释的多模态知识图谱,提升大语言模型推理能力。

Comments 14 pages, 7 figures, 6 tables; Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17448 2025-11-24 cs.CV 79%

MMT-ARD: Multimodal Multi-Teacher Adversarial Distillation for Robust Vision-Language Models

MMT-ARD: 多模态多教师对抗蒸馏用于鲁棒视觉-语言模型

Yuqi Li, Junhao Dong, Chuanguang Yang, Shiping Wen, Piotr Koniusz, Tingwen Huang, Yingli Tian, Yew-Soon Ong

机构 * The City University of New York, CUNY(纽约城市大学) Nanyang Technological University(南洋理工大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Technology Sydney(悉尼技术大学) Data61, CSIRO(CSIRO数据61研究所) Shenzhen University of Advanced Technology(深圳先进技术大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 MMT-ARD通过多教师对抗蒸馏提升视觉-语言模型的对抗鲁棒性,实验显示鲁棒精度提升4.32%,训练效率提高2.3倍。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11313 2025-11-24 cs.CV 79%

DocSLM: A Small Vision-Language Model for Long Multimodal Document Understanding

DocSLM:一种用于长多模态文档理解的小型视觉-语言模型

Tanveer Hannan, Dimitrios Mallios, Parth Pathak, Faegheh Sardari, Thomas Seidl, Gedas Bertasius, Mohsen Fayyaz, Sunando Sengupta

机构 * Microsoft(微软公司) LMU Munich(慕尼黑大学) MCML FAIR Meta(Meta FAIR) UNC Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 DocSLM通过高效的小型视觉-语言模型,在受限内存下实现长多模态文档理解,使用更少的资源达到与先进方法相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17103 2025-11-24 cs.CV 74%

Bridging Visual Affective Gap: Borrowing Textual Knowledge by Learning from Noisy Image-Text Pairs

弥合视觉情感差距:通过学习噪声图像-文本对借用文本知识

Daiqing Wu, Dongbao Yang, Yu Zhou, Can Ma

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) TMCC, College of Computer Science, Nankai University(TMCC,南开大学计算机学院)

专题命中 图文多模态 :image-text(title);分类 cs.CV

AI总结 本文提出通过学习噪声图像-文本对中的文本知识,弥合视觉情感识别中的情感差距,提升预训练视觉模型的情感感知能力。

Comments Accepted by ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17036 2025-11-24 cs.CL cs.CV 62%

Do Vision-Language Models Understand Visual Persuasiveness?

视觉-语言模型理解视觉说服力吗?

Gyuwon Park

机构 * Department of Computer Science and Engineering, UNIST(计算机科学与工程系,UNIST)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.CL

AI总结 本文研究视觉-语言模型对视觉说服力的理解,发现模型在链接说服对象与沟通意图方面存在局限。

Comments 8 pages (except for reference and appendix), 5 figures, 7 tables, to be published in NeurIPS 2025 Workshop: VLM4RWD

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16951 2025-11-24 cs.CV 57%

FingerCap: Fine-grained Finger-level Hand Motion Captioning

FingerCap:细粒度指尖级手部动作描述

Xin Shen, Rui Zhu, Lei Shen, Xinyu Wang, Kaihao Zhang, Tianqing Zhu, Shuchen Wu, Chenxi Miao, Weikang Li, Yang Li, Deguo Xia, Jizhou Huang, Xin Yu

机构 * Baidu Inc.(百度公司) The University of Queensland(昆士兰大学) Nanjing University(南京大学) Institute of Computing Technology, CAS(中国科学院计算技术研究所) Peking University(北京大学) Australian National University(澳大利亚国立大学) City University of Macau(澳门城市大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 FingerCap通过FiGOP技术提升细粒度手部动作描述的准确性,解决视频大语言模型在指尖运动识别中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15278 2025-11-24 cs.CV 57%

MindShot: A Few-Shot Brain Decoding Framework via Transferring Cross-Subject Prior and Distilling Frequency Domain Knowledge

MindShot: 一种通过跨受试者先验知识转移和频域知识蒸馏的少样本脑解码框架

Shuai Jiang, Zhu Meng, Haiwen Li, Delong Liu, Fei Su, Zhicheng Zhao

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Beijing Key Laboratory of Network System(北京网络系统与网络文化重点实验室)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 MindShot通过跨受试者先验知识转移和频域知识蒸馏,实现少样本脑解码,提升解码适应性和效率。

Comments Accepted by KBS

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 4 篇

2311.02733 2025-11-24 cs.CV cs.AI cs.LG cs.MM cs.SD eess.AS 85%

AV-Lip-Sync+: Leveraging AV-HuBERT to Exploit Multimodal Inconsistency for Deepfake Detection of Frontal Face Videos

AV-Lip-Sync+: 借助AV-HuBERT利用多模态不一致性的深度伪造检测方法

Sahibzada Adil Shahzad, Ammarah Hashmi, Yan-Tsung Peng, Yu Tsao, Hsin-Min Wang

机构 * Social Networks and Human-Centered Computing Program, Taiwan International Graduate Program, Academia Sinica(学术.sinica.edu.tw 社会网络与人本计算计划,台湾国际研究生计划,台湾.sinica.edu.tw) Department of Computer Science, National Chengchi University(计算机科学系,国立政治大学) Institute of Information Systems and Applications, National Tsing Hua University(信息系统与应用研究所,国立清华大学) Research Center for Information Technology Innovation, Academia Sinica(资讯技术创新研究中心,学术.sinica.edu.tw) Institute of Information Science, Academia Sinica(资讯研究所,学术.sinica.edu.tw)

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 本文提出AV-Lip-Sync+方法,利用AV-HuBERT和多模态不一致性检测深度伪造,实现对正面人脸视频的高精度检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17323 2025-11-24 cs.SD cs.AI cs.CL cs.MM 82%

MusicAIR: A Multimodal AI Music Generation Framework Powered by an Algorithm-Driven Core

MusicAIR: 一种由算法驱动核心的多模态AI音乐生成框架

Callie C. Liao, Duoduo Liao, Ellie L. Zhang

机构 * Stanford University(斯坦福大学) George Mason University(乔治·马歇尔大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI、cs.MM

AI总结 MusicAIR通过算法驱动的核心生成音乐,能从歌词、文本和图像生成符合音乐理论的旋律谱,提升音乐创作效率并降低入门门槛。

Comments Accepted by IEEE Big Data 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09439 2025-11-24 eess.AS cs.SD 57%

Omni-R1: Do You Really Need Audio to Fine-Tune Your Audio LLM?

Omni-R1:你真的需要音频来微调你的音频大语言模型吗?

Andrew Rouditchenko, Saurabhchand Bhati, Edson Araujo, Samuel Thomas, Hilde Kuehne, Rogerio Feris, James Glass

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Goethe University of Frankfurt(法兰克福歌德大学) IBM Research AI(IBM人工智能研究部) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室) Tuebingen AI Center/University of Tuebingen(图宾根人工智能中心/图宾根大学)

专题命中 音频语音多模态 :multi-modal(abstract);分类 eess.AS

AI总结 Omni-R1通过强化学习方法GRPO微调多模态大语言模型,实现了在音频问答任务上的新SOTA性能,同时发现文本推理能力提升对音频性能有显著贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16769 2025-11-24 cs.HC 50%

Trust in AI emerges from distrust in humans: A machine learning study on decision-making guidance

对人工智能的信任源于对人类的不信任:一项关于决策指导的机器学习研究

Johan Sebastián Galindez-Acosta, Juan José Giraldo-Huertas

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本研究通过机器学习探讨了人工智能在决策指导中的信任机制,发现对人类的不信任会促使人们转向AI,且AI在事实性情景中更受青睐。

Comments 36 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 3 篇

2506.18883 2025-11-24 cs.CV 79%

Universal Video Temporal Grounding with Generative Multi-modal Large Language Models

通用视频时间定位与生成多模态大语言模型

Zeqian Li, Shangzhe Di, Zhonghua Zhai, Weilin Huang, Yanfeng Wang, Weidi Xie

机构 * SAI, Shanghai Jiao Tong University(上海交通大学SAI实验室) ByteDance Seed(字节跳动种子)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出UniTime模型,利用生成多模态大语言模型实现通用视频时间定位,有效处理多类型视频并提升VideoQA任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17199 2025-11-24 cs.CV 57%

VLA-4D: Embedding 4D Awareness into Vision-Language-Action Models for SpatioTemporally Coherent Robotic Manipulation

VLA-4D: 将4D意识嵌入视觉-语言-动作模型中以实现时空一致的机器人操作

Hanyu Zhou, Chuanhao Ma, Gim Hee Lee

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 VLA-4D通过4D意识增强视觉-语言-动作模型,实现时空一致的机器人操作,提升动作执行的空间平滑性和时间一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12114 2025-11-24 cs.HC cs.CV eess.IV 57%

Behind the Screens: Uncovering Bias in AI-Driven Video Interview Assessments Using Counterfactuals

屏幕背后:利用反事实揭示AI驱动视频面试评估中的偏见

Dena F. Mujtaba, Nihar R. Mahapatra

机构 * Department of Electrical and Computer Engineering, Michigan State University(电子与计算机工程系,密歇根州立大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出基于反事实的框架,用于评估AI驱动视频面试评估中的偏见,通过生成对抗网络生成反事实数据,揭示不同群体间的差异,提升伦理透明度。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 5 篇

2511.01588 2025-11-24 cs.LG cs.CV 83%

Explore More, Learn Better: Parallel MLLM Embeddings under Mutual Information Minimization

探索更多,学习更好:基于互信息最小化的并行 MLLM 嵌入

Zhicheng Wang, Chen Ju, Xu Chen, Shuai Xiao, Jinsong Lan, Xiaoyong Zhu, Ying Chen, Zhiguo Cao

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) Huazhong University of Science and Technology(华中科技大学)

专题命中 跨模态检索 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 本文提出基于互信息最小化的并行解耦框架,通过多条并行路径提升多模态嵌入质量,实现高效且鲁棒的嵌入空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09878 2025-11-24 cs.CV cs.AI cs.RO 81%

CleverDistiller: Simple and Spatially Consistent Cross-modal Distillation

CleverDistiller: 简单且空间一致的跨模态知识蒸馏

Hariprasath Govindarajan, Maciej K. Wozniak, Marvin Klingner, Camille Maurice, B Ravi Kiran, Senthil Yogamani

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 CleverDistiller通过简单有效的跨模态知识蒸馏方法,在自动驾驶任务中实现语义分割和3D目标检测的高性能表现。

Comments Accepted to BMVC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.07419 2025-11-24 cs.IR cs.MM 79%

Breaking the Curse of Knowledge: Towards Effective Multimodal Recommendation using Knowledge Soft Integration

突破知识诅咒:通过知识软整合实现有效的多模态推荐

Kai Ouyang, Chen Tang, Zenghao Chai, Wenhao Zheng, Xiangjin Xie, Xuanji Xiao, Zhi Wang

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.MM

AI总结 本文提出KSI框架,通过知识软整合解决多模态推荐中的知识诅咒问题,提升推荐个性化效果。

Comments Accepted to IEEE Transactions on Multimedia (TMM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17255 2025-11-24 cs.CV cs.IR 57%

A Little More Like This: Text-to-Image Retrieval with Vision-Language Models Using Relevance Feedback

略多一些像这个:利用视觉语言模型进行文本到图像检索的相关反馈

Bulat Khaertdinov, Mirela Popa, Nava Tintarev

机构 * Maastricht University(马斯特里赫特大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 本文提出基于相关反馈机制提升视觉语言模型文本到图像检索性能的方法,通过四种反馈策略在Flickr30k和COCO数据集上验证,提升了检索效果并增强了多轮检索的鲁棒性。

Comments Accepted to WACV'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16950 2025-11-24 physics.optics 50%

Single-Axis Ptychographic Coherent Diffractive Imaging for Spectroscopic and Wavefront Retrieval

单轴投影衍射成像用于光谱和波前恢复

Qijun You, Lingshuo Meng, Fangrui Quan, Wei Cao

专题命中 跨模态检索 :multi-modal(abstract)

AI总结 单轴投影衍射成像技术通过单轴扫描提高通量,实现光谱和波前的同步成像,用于高效多模式实时成像。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 4 篇

2511.16917 2025-11-24 cs.CV 83%

UniModel: A Visual-Only Framework for Unified Multimodal Understanding and Generation

UniModel: 一种仅依赖视觉的统一多模态理解和生成框架

Chi Zhang, Jiepeng Wang, Youming Wang, Yuanzhi Liang, Xiaoyan Yang, Zuoxin Li, Haibin Huang, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI)(人工智能研究所)

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 UniModel通过统一模型、任务和表示,在单一视觉空间中实现多模态理解和生成的统一框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17501 2025-11-24 cs.CV cs.GR 57%

Native 3D Editing with Full Attention

原生3D编辑与全关注

Weiwei Cai, Shuangkang Fang, Weicai Ye, Xin Dong, Yunhan Yang, Xuanyang Zhang, Wei Cheng, Yanpei Cao, Gang Yu, Tao Chen

机构 * Fudan University(复旦大学) StepFun, Inc.(StepFun公司) Zhejiang University(浙江大学) Tsinghua University(清华大学) VAST

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出一种高效的原生3D编辑框架,通过多模态数据集和3D标记连接方法,提升3D编辑的效率和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00737 2025-11-24 cs.HC cs.AI 57%

How LLMs are Shaping the Future of Virtual Reality

大型语言模型如何塑造虚拟现实的未来

Süeda Özkaya, Santiago Berrezueta-Guzman, Stefan Wagner

机构 * Technical University of Munich(慕尼黑技术大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本文探讨了大型语言模型如何通过增强叙事生成、NPC互动和个性化来塑造虚拟现实的未来,并提出了多模态AI和伦理保障等未来研究方向。

Comments Pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16900 2025-11-24 eess.SY cs.SY 50%

When Motion Learns to Listen: Diffusion-Prior Lyapunov Actor-Critic Framework with LLM Guidance for Stable and Robust AUV Control in Underwater Tasks

当运动学会倾听:带有LLM引导的扩散先验Lyapunov动作-批评者框架用于水下任务中稳定和鲁棒的AUV控制

Jingzehua Xu, Weiyi Liu, Weihang Zhang, Zhuofan Xi, Guanwen Xie, Shuai Zhang, Yi Li

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出一种结合扩散模型、Lyapunov批评者和LLM的框架,用于提升水下机器人控制的稳定性与鲁棒性,通过生成-过滤-优化机制实现高效探索和多目标优化。

Comments This paper is currently under review and does not represent the final version. Jingzehua Xu, Weiyi Liu and Weihang Zhang are co-first authors of this paper, with Zhuofan Xi as the second author

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态评测 8 篇

2511.17477 2025-11-24 cs.SD cs.AI 79%

Enhancing Quranic Learning: A Multimodal Deep Learning Approach for Arabic Phoneme Recognition

增强《古兰经》学习:一种多模态深度学习方法用于阿拉伯语音素识别

Ayhan Kucukmanisa, Derya Gelmez, Sukru Selim Calik, Zeynep Hilal Kilimci

机构 * Department of Electronics and Communication Engineering, Kocaeli University, 41001, Kocaeli, Turkey(电子与通信工程系,科拉尔大学) Department of Information Systems Engineering, Kocaeli University, 41001, Kocaeli, Turkey(信息系统工程系,科拉尔大学) Maviay Consultancy Company, Kocaeli University Technopark, 41275, Kocaeli, Turkey(Maviay咨询公司,科拉尔大学技术园区)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出一种基于变压器的多模态框架,结合声学和文本表示,用于阿拉伯语音素误发音检测,通过融合策略提升精度与鲁棒性。

Comments 11 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17106 2025-11-24 cs.CV 79%

ChainV: Atomic Visual Hints Make Multimodal Reasoning Shorter and Better

ChainV: 原子视觉提示使多模态推理更短更优

Yuan Zhang, Ming Lu, Junwen Pan, Tao Huang, Kuan Cheng, Qi She, Shanghang Zhang

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) ByteDance Inc.(字节跳动公司) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 ChainV通过动态整合视觉提示,提升多模态推理的效率和准确性,尤其在数学密集型基准测试中表现突出。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15675 2025-11-24 cs.CV cs.AI 62%

MF-GCN: A Multi-Frequency Graph Convolutional Network for Tri-Modal Depression Detection Using Eye-Tracking, Facial, and Acoustic Features

MF-GCN:一种多频图卷积网络用于利用眼动、面部和音频特征的三模态抑郁检测

Sejuti Rahman, Swakshar Deb, MD. Sameer Iqbal Chowdhury, MD. Jubair Ahmed Sourov, Mohammad Shamsuddin

机构 * Department of Computer Science, New Uzbekistan University, Tashkent, Uzbekistan(计算机科学系,新乌兹别克斯坦大学) Department of Robotics and Mechatronics Engineering, University of Dhaka, Bangladesh(机器人与机电工程系,达卡大学) Department of Electrical and Computer Engineering, University of Virginia, USA(电气与计算机工程系,弗吉尼亚大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 MF-GCN通过整合眼动、面部和音频多模态数据,利用多频图卷积网络提升抑郁症检测的准确性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16937 2025-11-24 cs.CV cs.AI 62%

OmniGround: A Comprehensive Spatio-Temporal Grounding Benchmark for Real-World Complex Scenarios

OmniGround: 一个全面的时空接地基准用于现实复杂场景

Hong Gao, Jingyu Wu, Xiangkai Xu, Kangni Xie, Yunchen Zhang, Bin Zhong, Xurui Gao, Min-Ling Zhang

机构 * SouthEast University(东南大学) ZTE Corporation(中兴通讯)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 OmniGround提出一个全面的时空接地基准,通过改进的标注流程和评估框架,提升了复杂现实场景中视频目标定位的性能。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22300 2025-11-24 cs.CR cs.AI cs.CV 62%

T2I-RiskyPrompt: A Benchmark for Safety Evaluation, Attack, and Defense on Text-to-Image Model

T2I-RiskyPrompt:用于评估、攻击和防御文本到图像模型安全性的基准

Chenyu Zhang, Tairen Zhang, Lanjun Wang, Ruidong Chen, Wenhui Li, Anan Liu

专题命中 多模态评测 :MLLM(abstract);分类 cs.CV、cs.AI

AI总结 T2I-RiskyPrompt提出了一种用于评估文本到图像模型安全性的综合基准,通过层次化风险分类和原因驱动的检测方法,全面评估了多种模型和防御策略的安全性能。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17056 2025-11-24 cs.AI 57%

Patient-level Information Extraction by Consistent Integration of Textual and Tabular Evidence with Bayesian Networks

通过贝叶斯网络一致整合文本和表格证据进行患者层面的信息提取

Paloma Rabaey, Adrick Tench, Stefan Heytens, Thomas Demeester

专题命中 多模态评测 :multi-modal(abstract);分类 cs.AI

AI总结 本文提出通过整合文本和表格证据,利用贝叶斯网络和神经分类器,提升患者信息提取的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏