arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46430 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4597 篇

2603.06505 2026-08-19 cs.CL 版本更新 57%

Speak in Context: Multilingual ASR with Speech Context Alignment via Contrastive Learning

在语境中说话:通过对比学习实现的多语言语音识别与语音语境对齐

Yuchen Zhang, Haralambos Mouratidis, Ravi Shekhar

机构 * Institute for Analytics and Data Science, University of Essex(数据分析与科学研究所,埃塞克斯大学) School of Computer Science and Electronic Engineering, University of Essex(计算机科学与电子工程学院,埃塞克斯大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL

AI总结 本文提出一种基于对比学习的多语言语音识别框架,通过语境对齐提升识别性能,支持多种语言和口音,实现语音与上下文的高效交互。

Comments Accepted at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28687 2026-08-18 cs.LG cs.AI cs.ET 版本更新 57%

Technological Advances in Detecting and Managing Cognitive Impairment in Older Adults: Trends, Challenges, and Future Directions

老年人认知障碍检测与管理的技术进展:趋势、挑战与未来方向

Mohammad Asif, Azizuddin Khan, Mohd Azam, Anurag Rajkumar Bombarde

机构 * Indian Institute of Technology Bombay(印度理工学院孟买分校) T-Systems ICT India Pvt. Ltd.(德国电信系统印度信息通信技术私人有限公司)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文综合老年人认知障碍检测与管理的技术进展,提出跨学科分类法等成果,指出现有模型多依赖小数据集,展望了可信多模态纵向验证系统的发展前景。

Comments Withdrawn due to an unresolved dispute regarding authorship eligibility and attribution

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08384 2026-08-18 cs.CL 版本更新 57%

jina-embeddings-v5-omni: Geometry-preserving Embeddings via Locked Aligned Towers

jina-embeddings-v5-omni: 通过锁定对齐塔实现几何保持嵌入

Florian Hönicke, Michael Günther, Andreas Koukounas, Mohammad Kalim Akram, Saba Sturua, Han Xiao

机构 * Jina by Elastic(Jina 由 Elastic 公司)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文提出GELATO方法,通过冻结对齐塔实现多模态嵌入,生成统一语义空间,训练效率高且保持文本嵌入一致性。

Comments 11 pages, 9 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14150 2026-08-17 cs.CL 新提交 57%

Leading-Silence Augmentation and Multi-Stage Synthetic Supervision for the Second MLC-SLM Challenge

面向第二届MLC-SLM挑战赛的前置静音增强与多阶段合成监督

Kexin Shi, Renhe Sun, Yuge Huang, Ximeng Wang, Jiayi Zhou, Jian Liu, Malu Zhang

机构 * Ant Group(蚂蚁集团) UESTC(电子科技大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 针对第二届MLC-SLM挑战赛的两项任务,分别采用前置静音增强等策略微调VibeVoice-ASR-7B、用合成问答对微调Qwen3-Omni-30B-A3B-Instruct,提升了任务1和任务2的评估性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00982 2026-08-17 eess.AS 57%

VisG AV-HuBERT: Viseme-Guided AV-HuBERT

VisG AV-HuBERT:基于视觉发音的AV-HuBERT

Aristeidis Papadopoulos, Rishabh Jain, Naomi Harte

专题命中 音频语音多模态 :audio-visual(abstract);分类 eess.AS

AI总结 本文提出VisG AV-HuBERT,通过引入辅助的发音分类任务,强化模型对视觉发音特征的依赖,提升在噪声环境下的语音识别性能。

Comments Includes Supplementary Material. Accepted for Publication at International Conference on Pattern Recognition 2026 - ICPR 2026. Code is available at https://github.com/aristosp/visg_avhubert

Journal ref A. Papadopoulos, R. Jain, N. Harte, VisG AV-HuBERT: Viseme-Guided AV-HuBERT, in Pattern Recognition. ICPR 2026, Lecture Notes in Computer Science, vol. 16812, pp. 667-682, Springer, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10441 2026-08-17 cs.CL 版本更新 57%

Decoding Student Minds: Leveraging Conversational Agents for Psychological and Learning Analysis

解码学生心智:利用对话代理进行心理和学习分析

Nour El Houda Ben Chaabene, Hamza Hammami, Laid Kahloul

机构 * STIH Laboratory, Sorbonne University(索邦大学STIH实验室) LIPAH-LR11ES14, National Engineering School of Tunis(突尼斯国家工程学院LIPAH-LR11ES14) Faculty of Sciences of Tunis(突尼斯科学学院) LINFI Laboratory(LINFI实验室)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文提出一种结合多模态数据和语义推理的对话代理,用于实时分析学生认知和情感状态,提升学习表现和情感福祉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08235 2026-08-14 eess.AS 版本更新 57%

SraVaani 1.0: Scaling Inclusive Speech Recognition for Indic Languages

SraVaani 1.0:面向印度语言的包容性自动语音识别规模化模型

Sujith Pulikodan, Agneedh Basu, Pavan Kumar J, Pranav D Bhat, Suryansh Shukla, Nihar Desai, Prasanta Kumar Ghosh

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 本文提出SraVaani 1.0,一款基于FastConformer架构的多语言ASR模型,覆盖65种印度语言,经三阶段训练后在8个基准上表现优异,是唯一支持多种低资源及部落印度语言转录的开源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08874 2026-08-14 cs.CV 版本更新 57%

AeroReformer2: Spoken-Query Referring Segmentation for Aerial Images

AeroReformer2:面向航拍图像的语音查询指称分割

Rui Li, Chenxi Duan, Haoyang Yang

机构 * Massachusetts Institute of Technology(麻省理工学院) The University of Manchester(曼彻斯特大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文针对现有指称遥感图像分割基准仅支持书面表达的问题,构建了首个语音查询指称分割基准RISBench-S,并提出高效双边网络模型AeroReformer2,在相关任务上取得优于基线的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12034 2026-08-13 eess.AS cs.SD 新提交 57%

The SLT 2026 SmartGlasses Challenge: Benchmarking Egocentric Multi-Talker Speech Recognition and Understanding with Audio-Language Models

2026 IEEE SLT智能眼镜挑战赛:基于音频-语言模型的自我中心多说话人语音识别与理解基准测试

Dehui Gao, Zhixian Zhao, Zhennan Lin, Yujie Liao, Yuhang Dai, Yike Zhu, Longshuai Xiao, Hui Bu, Xin Xu, Xie Chen, Shuai Wang, Liumeng Xue, Zhonghua Fu, Jun Du, Eng-Siong Chng, Jun Zhou, Lei Xie

机构 * Northwestern Polytechnical University(西北工业大学) Huawei(华为) AIShell Inc(AIShell公司) Shanghai Jiao Tong University(上海交通大学) Nanjing University(南京大学) University of Science and Technology of China(中国科学技术大学) Nanyang Technological University(南洋理工大学) Rokid

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 本文介绍IEEE SLT 2026智能眼镜挑战赛,构建含714个真实场景会话的106小时四通道自我中心语音数据集,评估TSA-ASR与SLU,发现说话人重叠影响TSA-ASR性能、音频-语言模型难理解副语言声学。

Comments 7 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11804 2026-08-13 eess.AS cs.SD 新提交 57%

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching

MiDashengLM-Gen:基于大语言模型驱动的自回归流匹配的统一音频场景生成

Xingwei Sun, Heinrich Dinkel, Gang Li, Jiahao Mei, Yadong Niu, Zerui Han, Yuepeng Jiang, Jiahao Zhou, Lichun Fan, Jian Luan

机构 * MiLM Plus Xiaomi Inc.(小米公司) Shanghai Jiao Tong University(上海交通大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 eess.AS

AI总结 MiDashengLM-Gen是首个端到端训练的通用文本到音频生成模型,通过结合LLM与每token条件流匹配,在Seed-TTS等基准上大幅提升语音可懂度,且支持多语言场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01982 2026-08-12 cs.HC cs.AI 版本更新 57%

Music Interpretation and Emotion Perception: A Computational and Neurophysiological Investigation

音乐诠释与情感感知:计算与神经生理学调查

Vassilis Lyberatos, Spyridon Kantarelis, Ioanna Zioga, Christina Anagnostopoulou, Giorgos Stamou, Anastasia Georgaki

机构 * School of Electrical and Computer Engineering, National Technical University of Athens(电气与计算机工程学院,国家技术大学雅典) Department of Music Studies, National and Kapodistrian University of Athens(音乐研究系,国家与卡波迪斯特里亚大学雅典)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 本研究利用计算和神经生理学方法,探究不同演奏情境(如曲目、调式练习曲和即兴演奏)及表现力水平对表演者情感传达和听众反应的影响,发现表现力和即兴演奏具有独特声学特征并引发更强情感反应,且即兴演奏带来更大的神经生理放松。

Comments Accepted at SMC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09593 2026-08-11 cs.SD cs.AI 新提交 57%

MADBench: A Benchmark for Modality-Aware Audio Deepfake Detection

MADBench:面向模态感知音频深度伪造检测的基准

Yanqiu Li, Yang Xiao, Jisheng Bai, Bin Chen, Hong Jia, Ting Dang

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 MADBench是首个区分语音与环境音频的音频深度伪造检测基准,测试发现环境音频操纵更易检测,现有预训练检测器在两类声学成分上均失效,为相关研究提供严谨基础。

Comments 11 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08990 2026-08-11 cs.HC cs.MM 新提交 57%

AI-Guided Learning: Research on Knowledge and Skill Acquisition Support Methods Using Deep Learning Audio-Video Processing Techniques

AI引导式学习:基于深度学习音视频处理技术的知识与技能获取支持方法研究

Kazuki Kawamura

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.MM

AI总结 本研究提出含三个系统的AI引导式学习框架,通过深度学习音视频处理技术,解决学习中长内容耗时、技能模仿反馈不足的问题,相关系统在播放效率、视频时长缩减、发音提升上均有良好效果。

Comments 118 pages, 26 figures, 4 tables. Doctoral dissertation, Doctor of Interdisciplinary Informatics, The University of Tokyo; degree awarded September 19, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22790 2026-08-11 cs.SD cs.AI 版本更新 57%

Scaling Audio Models Efficiently: A Joint Study of Compute Constraints and Optimization Behavior

高效扩展音频模型:计算约束与优化行为的联合研究

Vyom Agarwal, Mokshda Gangrade, Siddharth Pal, Jerry Wu

机构 * University of Maryland(马里兰大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 针对ASR和SER任务,提出统一框架分析模型大小、输入长度和表示分辨率三个计算维度,在固定预算下优化资源分配,发现非线性缩放行为并确定最优操作点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05550 2026-08-11 cs.SD cs.CL cs.LG 版本更新 57%

Assessing Factual Music Comprehension in Large Audio Language Models

评估大型音频语言模型中的事实音乐理解能力

Daniel Chenyu Lin, Michael Freeman, John Thickstun

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 针对现有MusicQA数据集无法衡量模型回答事实正确性的问题,提出基于可验证信息的评估协议,通过精确率、召回率和F1分数客观评估模型,并在三个数据集上定义六项事实检索任务,对九个最新LALM进行基准测试。

Comments 17 pages; ISMIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06900 2026-08-10 cs.SD eess.AS 新提交 57%

MMAG: A Multi-Control Mixed Audio Generation Benchmark

MMAG:多控制混合音频生成基准

Zihao Zheng, Xuenan Xu, Jiahao Mei, Yixuan Li, Minghao Lv, Wen Wu, Chao Zhang, Mengyue Wu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Lab(上海人工智能实验室)

专题命中 音频语音多模态 :audio-visual(abstract);分类 eess.AS

AI总结 本研究针对现有音频生成基准的不足,推出MMAG混合音频生成基准,构建含4000个标注音频的数据集,提出系统评估协议,测试发现各类模型在多控制能力间存在性能权衡,为该领域提供综合基准。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06632 2026-08-10 cs.AI 新提交 57%

Shape Your Feed: An LLM-based Agentic System for Conversational Recommendation

塑造你的信息流:一种基于大语言模型的智能体对话推荐系统

Ziyun Xu, Bosen Ding, Yue Zhang, Ji Qi, Qingyuan Song, Jizhou Huang, Liwei Wang, Jefferey Santelli, Yue Weng, Qichao Que, Zhenheng Yang, Junfeng Pan, Linhong Zhu

机构 * Meta Platforms(元平台公司)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出基于LLM的智能体推荐框架SYF,采用三层架构实现实时多模态内容协同策划,经离线评估与在线A/B实验验证,可提升信息流相关性与用户情感,为工业场景提供交互式推荐方案。

Comments Accepted in RecSys 2026 Industrial Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31589 2026-08-10 cs.CV 版本更新 57%

Recognizing Co-Speech Gestures in-the-Wild

识别野外伴随语音的手势

Sindhu B Hegde, K R Prajwal, Andrew Zisserman

机构 * Visual Geometry Group, Dept. of Engineering Science, University of Oxford(视觉几何组,工程科学系,牛津大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对当前多模态模型难以捕捉语义性伴随手势的问题,构建了首个大规模基准数据集GRW,用于训练视频模型进行手势语义分类、对应词汇识别和时序定位。

Journal ref European Conference on Computer Vision (ECCV), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05803 2026-08-07 cs.CV 新提交 57%

Vorch-Omni: Multi-Task Orchestration of Sight and Sound

Vorch-Omni:视觉与听觉的多任务编排

Vorch Team, Xiaoyu Chen, Yang Ding, Cong Han, Menglin Han, Yuxin Hong, Jiebo Hou, Zequn Jie, Xiang Li, Jing Liu, Qi Liu, Yulei Lu, Siyuan Luo, Lin Ma, Xin Ma, Yinlong Qian, Peng Shi, Fang Wan, Siqi Wang, Yaohui Wang, Yaole Wang, Yidi Wu, Siqian Yang, Mingyu Yin, Haoran Yu, Gang Yue, Lisai Zhang, Yuting Zhang

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV

AI总结 Vorch-Omni是基于流匹配扩散Transformer的统一多任务视听合成框架,支持10余项视听相关任务,为通用视听生成与操作提供可扩展基础。

Comments Project Page: https://vorch-project.github.io/Vorch-Omni-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06612 2026-08-07 cs.CV 版本更新 57%

A Bridge from Audio to Video: Phoneme-Viseme Alignment Allows Every Face to Speak Multiple Languages

从音频到视频的桥梁:音素-视素对齐让任意人脸可说多种语言

Zibo Su, Kun Wei, Jiahua Li, Jing Kong, Xu Yang, Cheng Deng

机构 * Xidian University(西安电子科技大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CV

AI总结 该研究提出MuEx框架,通过PG-MoE架构和PV-Align机制,结合含12种语言的MTFD数据集,实现多语言语音驱动说话人脸合成,在MTFD全语言表现优异且可零样本泛化到未见语言。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03742 2026-08-05 cs.SD cs.AI 新提交 57%

AI-Based Sound Effect Generation: A Narrative Review of Generative Models Across Input Modalities

基于AI的音效生成:跨输入模态生成模型的叙事性综述

Sandy Abdo, Bill Kapralos, Priyamvada Tripathi, KC Collins, Adam Dubrowski

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 本章综述了跨文本、视觉等输入模态的AI音效生成模型,考察30篇文献,指出模型性能提升的同时存在时间同步局限等挑战,推动音效生成向自适应系统发展。

Comments 29 pages, 5 figures, to appear in G. A. Tsihrintzis, M. Virvou, N. Bourbakis, and L. C. Jain (Eds.), Advances in Global Applied Artificial Intelligence: Springer, Learning and Analytics in Intelligent Systems Book Series

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15755 2026-08-03 cs.SD cs.AI 版本更新 57%

AuEmoChat: Authentic Emotion Understanding and Rendering for Conversational Speech Synthesis

AuEmoChat:用于对话语音合成的真实情感理解与呈现

Zhenqi Jia, Yuan Zhao, Aruukhan, Rui Liu, Haizhou Li

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 针对对话语音合成中情感表达不真实及多模态令牌干扰问题,提出AuEmoChat框架,通过AuEmoCodec学习情感令牌空间、AuEmoToMe合并冗余令牌,集成到模型并结合情感流匹配渲染语音,实验证明其性能优于现有基线。

Comments Accepted by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27436 2026-07-31 eess.AS 新提交 57%

WeSep: A Modular and Cue-Composable Framework for Target Speaker Extraction

WeSep:面向目标说话人提取的模块化与线索可组合框架

Ke Zhang, Xiaoyang Yu, Haoyu Li, Shuai Wang, Shuhan Zhang, Haizhou Li

专题命中 音频语音多模态 :cross-modal(abstract);分类 eess.AS

AI总结 WeSep是将目标说话人提取重新表述为异质线索条件学习问题的统一框架,通过模块化设计提升灵活性,多模态实验验证其稳定性,工具包将公开。

Comments 6 pages, accepted by Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26567 2026-07-30 cs.RO cs.CV 新提交 57%

Speech2Grasp: Data-Efficient Transfer of Text-Conditioned Grasp Detection to Speech in Humanoid Robots

Speech2Grasp:面向人形机器人的文本条件抓取检测到语音的高效数据迁移

Hung Nguyen, Kim Nhat Minh Nguyen, Van Duc Vu, Van-Danh Le, Hoang Huy Le, Dinh Tuan Nguyen, Pham Tuyen Le, Van-Truong Nguyen, Quan Nguyen

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本研究提出Speech2Grasp框架,以数据高效方式将文本条件抓取检测模型迁移至语音输入,通过轻量级MLP投影器适配,在人形机器人实验中性能优于级联ASR流水线且延迟更低,为文本系统扩展到语音提供实用范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07044 2026-07-30 cs.DB cs.AI cs.CR 版本更新 57%

Balancing Privacy and Efficiency: Music Information Retrieval via Additive Homomorphic Encryption

平衡隐私与效率:基于加法同态加密的音乐信息检索

William Zerong Wang, Dongfang Zhao

机构 * University of Washington(华盛顿大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 该研究提出基于加法同态加密的音乐检索方法,实现音乐专用推理攻击量化、结构感知加法原语优化,在四组音频数据集上验证其兼具隐私性与高效扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25085 2026-07-29 eess.AS 新提交 57%

Text-Prompted CLAP: Learning Query-Conditioned Audio Representations via Contrastive Learning

文本提示的CLAP:通过对比学习学习查询条件音频表示

Mohan Li, Rama Doddipatla, Philip C. Woodland

专题命中 音频语音多模态 :cross-modal(abstract);分类 eess.AS

AI总结 研究旨在解决CLAP独立编码模态限制,提出TP-CLAP,通过引入交叉注意力融合模块,利用音频多项选择题框架训练,在音频问答、检索等任务中表现出色,优于标准CLAP基线。

Comments 5 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18946 2026-07-29 cs.CL 版本更新 57%

Constrained CTC Decoding for Efficient Diacritic Restoration

用于高效变音符恢复的约束 CTC 解码

Rufael Marew, Amr Keleg, Hanan Aldarmaki

机构 * Mohamed Bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL

AI总结 研究阿拉伯语音转录本变音符恢复问题,提出基于 CTC 的高效非自回归方法,通过构建标注格并纳入硬约束进行解码,在相关测试集上评估,相比基线降低了变音符错误率,实现性能和效率提升。

Comments Accepted at Interspeech 2026. Includes an additional appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24359 2026-07-28 cs.CV 新提交 57%

TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation

TaoMate:用于实时音频-视频数字人生成的锚点引导内存桥接演化和参考状态

Qijun Gan, Chenwei Zhang, Meiguang Jin, Junfeng Ma, Qiu Shen

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV

AI总结 研究实时长格式数字人生成问题,提出TaoMate框架,通过锚点引导、内存桥接等方法,在保持稳定外观和视听同步下,实现少步联合音频-视频生成,且能跨块并行执行加速自回归推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24082 2026-07-28 cs.AI 新提交 57%

Towards High-Level Semantic Intelligence

迈向高级语义智能

Xiujie Song, Gefei Yang, Yining You, Jiahui Gan, Qi Jia, Shota Watanabe, Tianxi Wan, Mengyue Wu, Kai Yu

机构 * Shanghai Jiao Tong University(上海交通大学) Nanjing University(南京大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 综述从语义复杂性角度审视人工智能语义智能发展,系统调研高级语义任务研究,总结理解和生成的相关方法及策略,旨在推动人工智能向高级语义智能持续发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20541 2026-07-28 cs.CL cs.CY 版本更新 57%

SAFE-MEME: Structured Reasoning Framework for Robust Hate Speech Detection in Memes

SAFE-MEME:用于表情包中鲁棒性仇恨言论检测的结构化推理框架

Palash Nandi, Shivam Sharma, Tanmoy Chakraborty

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 研究表情包中仇恨言论检测难题,提出SAFE-MEME框架及其两个变体,通过构建新型数据集进行基准测试,实验表明SAFE-MEME-QA和SAFE-MEME-H能有效检测仇恨言论,且不同方法在常规和混淆场景各有优势,还分析了错误案例。

Comments 44 pages, 27 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏