arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 9213 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 9213 篇

2604.11225 2026-06-26 cs.CV cs.CL 66%

Sign Language Recognition in the Age of LLMs

在大语言模型时代的手语识别

Vaclav Javorek, Jakub Honzik, Ivan Gruber, Tomas Zelezny, Marek Hruz

机构 * University of West Bohemia(西波西米亚大学) Eindhoven University of Technology(埃因霍温理工大学)

专题命中 多模态评测 :multimodal(abstract,comments);分类 cs.CV、cs.CL

AI总结 研究探讨现代VLMs在零样本条件下进行孤立手语识别的能力,发现开源模型表现欠佳,而大模型在精度上表现突出,强调模型规模和训练数据多样性的重要性。

Comments Accepted at the CVPR 2026 Workshop on Multimodal Sign Language Research (MSLR), 8 pages, 3 figures

Journal ref Proc. IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW), 2026, pp. 10511-10519

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02441 2026-03-26 cs.CV cs.AI 66%

Understanding Pure Textual Reasoning for Blind Image Quality Assessment

理解纯文本推理在盲图像质量评估中的应用

Yuan Li, Shin'ya Nishida

机构 * Kyoto University(京都大学)

专题命中 多模态评测 :image-text(abstract,comments);分类 cs.CV、cs.AI

AI总结 本文从信息流角度探讨文本信息对图像质量预测的贡献,通过对比现有模型与三种文本推理方法,发现文本信息在质量预测中效果有限,但Self-Consistency方法显著缩小了图像与文本预测间的差异。

Comments Code available at https://github.com/AnonymousUserPublish/Bridging-Image-Text-Gap-for-BIQA/tree/main. This work is accepted by ICME (IEEE International Conference on Multimedia and Expo) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16746 2025-10-10 cs.CV cs.CL cs.LG 66%

Zebra-CoT: A Dataset for Interleaved Vision Language Reasoning

Ang Li, Charles Wang, Deqing Fu, Kaiyu Yue, Zikui Cai, Wang Bill Zhu, Ollie Liu, Peng Guo, Willie Neiswanger, Furong Huang, Tom Goldstein, Micah Goldblum

机构 * Columbia University(哥伦比亚大学) University of Maryland(马里兰大学) University of Southern California(南加州大学) New York University(纽约大学)

专题命中 多模态评测 :multimodal(abstract,comments);分类 cs.CV、cs.CL

Comments dataset link: https://huggingface.co/datasets/multimodal-reasoning-lab/Zebra-CoT

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10018 2025-08-07 cs.CV cs.AI 66%

RGB-Event based Pedestrian Attribute Recognition: A Benchmark Dataset and An Asymmetric RWKV Fusion Framework

Xiao Wang, Haiyang Wang, Shiao Wang, Qiang Chen, Jiandong Jin, Haoyu Song, Bo Jiang, Chenglong Li

机构 * School of Computer Science and Technology, Anhui University(计算机科学与技术学院,安徽大学) School of Artificial Intelligence, Anhui University(人工智能学院,安徽大学)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.AI;multimodal(comments)

Comments The First Benchmark Dataset for RGB-Event Multimodal Pedestrian Attribute Recognition Task

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16508 2025-05-02 cs.CV cs.CL 66%

All Languages Matter: Evaluating LMMs on Culturally Diverse 100 Languages

Ashmal Vayani, Dinura Dissanayake, Hasindri Watawana, Noor Ahsan, Nevasini Sasikumar, Omkar Thawakar, Henok Biadglign Ademtew, Yahya Hmaiti, Amandeep Kumar, Kartik Kuckreja, Mykola Maslych, Wafa Al Ghallabi, Mihail Mihaylov, Chao Qin, Abdelrahman M Shaker, Mike Zhang, Mahardika Krisna Ihsani, Amiel Esplana, Monil Gokani, Shachar Mirkin, Harsh Singh, Ashay Srivastava, Endre Hamerlik, Fathinah Asma Izzati, Fadillah Adamsyah Maani, Sebastian Cavada, Jenny Chim, Rohit Gupta, Sanjay Manjunath, Kamila Zhumakhanova, Feno Heriniaina Rabevohitra, Azril Amirudin, Muhammad Ridzuan, Daniya Kareem, Ketan More, Kunyang Li, Pramesh Shakya, Muhammad Saad, Amirpouya Ghasemaghaei, Amirbek Djanibekov, Dilshod Azizov, Branislava Jankovic, Naman Bhatia, Alvaro Cabrera, Johan Obando-Ceron, Olympiah Otieno, Fabian Farestam, Muztoba Rabbani, Sanoojan Baliah, Santosh Sanjeev, Abduragim Shtanchaev, Maheen Fatima, Thao Nguyen, Amrin Kareem, Toluwani Aremu, Nathan Xavier, Amit Bhatkal, Hawau Toyin, Aman Chadha, Hisham Cholakkal, Rao Muhammad Anwer, Michael Felsberg, Jorma Laaksonen, Thamar Solorio, Monojit Choudhury, Ivan Laptev, Mubarak Shah, Salman Khan, Fahad Khan

机构 * University of Central Florida(佛罗里达中央大学) Mohamed bin Zayed University of AI(穆罕默德·本·扎耶德人工智能大学) Amazon(亚马逊) Aalto University(艾尔托大学) Australian National University(澳大利亚国立大学) Linköping University(林奈大学) Ehtiopian AI Institute(埃塞俄比亚AI研究所) Johns Hopkins University(约翰·霍普金斯大学) Aalborg University(奥尔堡大学) University of the West of England(英国西部大学) Alpinference University of Maryland(马里兰大学) HUN-REN Institute for CS and Control(HUN-REN计算机科学与控制研究所) Queen Mary University of London(伦敦玛丽女王大学) Chongqing University(重庆大学) University(大学)

专题命中 多模态评测 :multimodal(abstract,comments);分类 cs.CV、cs.CL

Comments A Multilingual Multimodal cultural benchmark for 100 languages

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.10553 2022-12-09 cs.LG cs.AI cs.CV eess.IV 66%

Guidelines and Evaluation of Clinical Explainable AI in Medical Image Analysis

Weina Jin, Xiaoxiao Li, Mostafa Fatehi, Ghassan Hamarneh

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.AI;multimodal(comments)

Comments Code: http://github.com/weinajin/multimodal_explanation, Supplementary Material S1 and S2: https://github.com/weinajin/multimodal_explanation/tree/main/paper

Journal ref Medical Image Analysis, 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27477 2026-08-31 cs.AI cs.CV 新提交 62%

Benchmarking General Mobile Assistants in Challenging Real-World Scenarios

在具有挑战性的真实场景中对通用移动助手进行基准测试

Yiqi Zhu, Feiyu Gao, Jiaxing Fan, Jiahui Zeng, Minggang Wu, Chenliang Li, Haiyang Xu, Peng Li, Ming Yan, Yang Liu

机构 * Tsinghua University(清华大学) Alibaba Group(阿里巴巴集团) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR))

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 该研究提出名为GMA的移动助手基准,涵盖七个应用与300个不同难度任务,评估八个前沿模型发现其性能随任务复杂度提升而下降,还证实合适的智能体控制设计可显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21919 2026-08-31 cs.CV cs.AI 版本更新 62%

SDGBiasBench: Benchmarking and Mitigating Vision--Language Models' Biases in Sustainable Development Goals

SDGBiasBench: 评估和减轻可持续发展目标中视觉-语言模型的偏见

Zihang Lin, Huaiyuan Qin, Muli Yang, Hongyuan Zhu

机构 * Nanyang Technological University(南洋理工大学)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SDGBiasBench,一个用于评估和减轻可持续发展目标中视觉-语言模型偏见的大型基准测试集,通过分析模型在决策和估计层面的偏见,提出CADE方法以减少偏见,提高模型的准确性和可靠性。

Comments Accepted to EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06079 2026-08-31 cs.CV cs.AI 版本更新 62%

Scientific Graphics Program Synthesis via Dual Self-Consistency Reinforcement Learning

通过双自一致性强化学习实现科学图形程序合成

Juekai Lin, Yun Zhu, Honglin Lin, Sijing Li, Tianwei Lin, Zheng Liu, Xiaoyang Wang, Wenqiao Zhang, Lijun Wu

机构 * Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory, OpenDataLab(上海人工智能实验室,OpenDataLab) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出双自一致性强化学习框架,结合高质量数据集和多维基准,提升科学图形到可编辑TikZ代码的转换能力,实现视觉与结构的高精度优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17198 2026-08-31 cs.CV cs.AI 版本更新 62%

Riverbank Erosion Analysis in Bangladesh Using Spatiotemporal Segmentation

基于时空分割的孟加拉国河岸侵蚀分析

M. Saifuzzaman Rafat, Akif Islam, Mohd Ruhul Ameen, Momen Khandoker Ope, Abu Saleh Musa Miah, Jungpil Shin

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本研究采用适配通用分割模型SAM的参数高效方法,基于500组卫星图像对构建数据集,实现孟加拉国河岸侵蚀的快速可靠监测,模型在测试集上表现优异且具备区域泛化能力。

Comments 5 figures, 4 Tables, Accepted to 2026 International Conference on Power, Electronics, Communications, Computing, and Intelligent Infrastructure (PECCII)

Journal ref 2026 International Conference on Power, Electronics, Communications, Computing, and Intelligent Infrastructure (PECCII)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27358 2026-08-28 cs.CL cs.AI 新提交 62%

RCMN: Understanding Misleadingness in Influential Public Discourse

RCMN:理解有影响力公共话语中的误导性

Peiling Yi

机构 * School of Computer Science and Mathematics(计算机科学与数学学院) Faculty of Engineering, Computing and the Environment(工程、计算与环境学院) Kingston University London(伦敦金斯顿大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本研究针对有影响力公共话语的误导性,提出以读者为中心的RCMN框架构建数据集,发现轻量表征可恢复读者解读但难识别误导机制,为可扩展误导性分析提供了新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26950 2026-08-28 cs.AI cs.CL 新提交 62%

From Atomic to Agentic: Towards Interpretable Evaluation of LLMs' Agentic Mathematical Capabilities

从原子到智能体:迈向大语言模型智能体数学能力的可解释评估

Jiayi Kuang, Yinghui Li, Yunze Song, Keyu Chen, Zhifeng Shen, Yangning Li, Yidong Wang, Di Yin, Ruizhi Qiao, Xing Sun, Kai Jin, Ying Shen, Liang Lin, Philip S. Yu

机构 * Sun Yat-sen University(中山大学) Tencent Youtu Lab(腾讯优图实验室) University of Illinois Chicago(伊利诺伊大学芝加哥分校) Pengcheng Laboratory(鹏城实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出过程级基准,对齐智能体行为与数学原子能力分类,评估LLMs智能体数学推理能力,发现相似端到端准确率的模型智能体能力轮廓差异显著,凸显过程级评估的重要性。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26921 2026-08-28 cs.CV cs.CL 新提交 62%

AraMS-28k: The Largest Publicly Released Line-Level Dataset of Historical Arabic Manuscripts with Margin and Insertion-Anchor Annotations

AraMS-28k:公开发布的最大规模带页边距和插入锚点标注的历史阿拉伯手稿行级数据集

Mohamed Guechaoui, Mohamed Diaa Zellagui, Souleyman Chaib, Sahraoui Dhelim

机构 * Higher School of Computer Science (ESI-SBA)(高等计算机科学学院(ESI-SBA))

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 研究人员发布了最大规模带页边距和插入锚点标注的历史阿拉伯手稿行级数据集AraMS-28k,采用RefLAM流程构建,提供基线HTR结果,支持阿拉伯手稿相关研究。

Comments Data and code available at this https URL and this https URL. Dataset: https://doi.org/10.5281/zenodo.22095333 Code: https://github.com/ArchaText/AraMS-28k-Dataset

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26713 2026-08-28 cs.CV cs.AI 新提交 62%

AesCanvas: A Large-Scale Dataset and Benchmark for Aesthetic Critique and Contextual Suitability

AesCanvas:用于美学评论与情境适配性的大规模数据集和基准

Xuanwei Hu, Haoyu Dong, Kejun Wu, Tianyi Liu, Jianjun Gao

机构 * School of Electronic Information and Communications, Huazhong University of Science and Technology(华中科技大学电子信息与通信学院) School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究针对现有图像美学评估基准的不足,构建含两个互补组件的AesCanvas数据集与基准,评估不同类型MLLMs,发现评论生成与情境敏感判断存在差距,确立文化情境化适配性为美学建模新目标。

Comments 10 pages, 4 figures, 6 tables. Supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26147 2026-08-28 cs.CL cs.CV 新提交 62%

CARE: Causally-Aligned Reasoning Exploration for Medical Large Language Models

CARE:面向医学大语言模型的因果对齐推理探索

Yucheng Zhou, Peng Luo, Qianning Wang, Chengzhong Xu, Jianbing Shen

机构 * University of Macau(澳门大学) Auckland University of Technology(奥克兰理工大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本研究针对医学大语言模型的推理缺陷,提出CARE框架,通过因果充分性与近端可学习性条件筛选训练经验,在医学基准上提升了推理一致性与训练稳定性。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24931 2026-08-27 eess.IV cs.AI cs.CV cs.LG 新提交 62%

Modality Contribution Score - A Per-Patient Framework for Quantifying the Relative Diagnostic Contribution of Structural MRI and Amyloid PET in Alzheimer's Disease

模态贡献分数——一种用于量化阿尔茨海默病中结构MRI与淀粉样PET相对诊断贡献的患者专属框架

Dawa Chyophel Lepcha, Aaliya Ali, Sophie A. Martin, Deepika Koundal, Pierrick Coupe, Shabbir Syed-Abdul

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 该研究提出患者专属框架MCNet与MCS,量化AD中结构MRI与淀粉样PET的相对诊断贡献,在ADNI-3与OASIS-3队列中验证了其分期性能、单调梯度及跨队列泛化性,为痴呆护理可信AI奠定基础。

Comments 15 pages, 7 figures, Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25981 2026-08-27 cs.CV cs.AI cs.LG 新提交 62%

FRAME: separating sampling variation from representational cause in medical imaging fairness

FRAME:在医学影像公平性中分离采样变异与表征成因

Mahshad Lotfinia, Daniel Truhn, Andreas Maier, Soroosh Tayebi Arasteh

机构 * Friedrich-Alexander-Universität Erlangen-Nürnberg(埃尔朗根-纽伦堡弗里德里希-亚历山大大学) RWTH Aachen University(亚琛工业大学) University Hospital RWTH Aachen(亚琛工业大学医院)

专题命中 多模态评测 :image-text(abstract);分类 cs.CV、cs.AI

AI总结 FRAME是用于医学影像公平性审计的两步框架,可分离采样变异与表征成因,能解释部分性能差异,辅助区分需机制解释的差异与采样变异可解释的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01287 2026-08-27 cs.CV cs.AI 版本更新 62%

Beyond Visual Memory: Mechanistic Diagnostics of Latent Visual Reasoning

超越视觉记忆:潜在视觉推理的机制诊断

Jiawei Guo, Yu Chen, Xiang Wang, Shuai Li, Xinpei Zhao, Huaxing Liu, Shuai Dong, Feifei Zhai, Yu Zhou

机构 * Amap, Alibaba Group(阿里集团亚马通) Shanghai Innovation Institute(上海创新研究院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 通过分解潜在令牌为三个可测试组件,发现边界标记和格式而非潜在槽贡献了主要性能提升,揭示了潜在视觉推理的真正机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20510 2026-08-25 cs.AI cs.CL 版本更新 62%

Telco-GAIA: Bilingual Benchmark for Agents in Telecom Domain

电信-GAIA:电信领域智能体的双语基准测试

Dmitrii Khizbullin, Zaid Alyafeai, Abdelrahman Eldesokey, Nourah AlSultan, Raghad Alshalan, Bernard Ghanem, David R. Pugh

机构 * King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学) stc(沙特电信公司)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CL、cs.AI

AI总结 介绍电信-GAIA双语多模态基准测试,含100个人工验证问答任务,需多跳推理,跨越多种异构源。以沙盒化Docker环境提供,通过规范化精确字符串匹配评分。评估发现其具有挑战性,为企业智能体提供测试平台和构建基准测试的模板。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18484 2026-08-25 cs.CV cs.CL 版本更新 62%

Benchmarking and Boosting Multilingual Capabilities of LVLMs via OCR-Centric Reinforcement Learning

PM4Bench: 通过平行多语言多模态多任务语料库对大型视觉-语言模型进行基准测试

Junyuan Gao, Jiahe Song, Jiang Wu, Runchuan Zhu, Guanlin Shen, Shasha Wang, Xingjian Wei, Haote Yang, Weijia Li, Bin Wang, Lijun Wu, Conghui He

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) Sun Yat-Sen University(中山大学) Chinese University of Hong Kong(香港中文大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 PM4Bench通过平行多语言多模态多任务语料库评估大型视觉-语言模型,揭示跨语言性能差异与OCR能力的关系。

Comments Accepted by EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20984 2026-08-24 cs.CV cs.CL cs.CY 新提交 62%

MigrationNarrate: A Dataset for Detection of Migration Narratives in YouTube Videos

MigrationNarrate:用于检测YouTube视频中移民叙事的数据集

Fatima Haouari, Carolina Scarton, Kalina Bontcheva

机构 * University of Sheffield(谢菲尔德大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 该研究推出首个用于检测英国移民叙事的多模态数据集MigrationNarrate,包含1115个YouTube视频字幕,结合预训练编码器与大语言模型开展基准测试,为移民叙事检测研究提供关键资源。

Comments This work was accepted to the main conference of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18579 2026-08-20 cs.CV cs.AI 新提交 62%

MR-IQA-2: Faithful Image Quality Reflection via Fine-Grained Credit Assignment

MR-IQA-2:通过细粒度信用分配实现真实的图像质量反映

Yuan li, Youyuan Lin, Chenhui Chu, Shin'ya Nishida

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本研究针对现有盲图像质量评估(IQA)中推理真实性不足的问题,提出MR-IQA-2框架,通过解耦推理与评分的细粒度信用分配,在IQA基准上实现了与人类评分的竞争性对齐,还能提供更丰富的视觉理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18438 2026-08-20 cs.CL cs.AI cs.LG 新提交 62%

Pedagogical AI in Mental Health: A Tri-Stream Fine-Tuned LLM Framework for Automated Clinical Supervision and Risk Triage

心理健康领域的教学式AI:用于自动化临床监督与风险分诊的三通路微调大语言模型框架

Shreeya Sharma, Ravish Gupta, Saket Kumar, Abhishek Aggarwal

机构 * Microsoft(微软) BigCommerce University at Buffalo, The State University of New York(纽约州立大学布法罗分校) Amazon(亚马逊)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CL、cs.AI

AI总结 针对精神医疗的监督缺口,提出三通路微调Mistral-7B-instruct框架,实现自动化临床监督与风险分诊,提升效率并解决冷启动问题。

Comments 14 pages, 1 figure, 2 tables. Accepted for publication in AICTC 2026, Lecture Notes in Networks and Systems, vol. 2165, Springer

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17514 2026-08-20 cs.CV cs.MM 版本更新 62%

SE-MoLoRA: Shared-Expert LoRA Adapters for Domain-Specific Photographic Assessment

SE-MoLoRA:用于特定领域摄影评估的共享专家LoRA适配器

Bishwash Khanal, Anlan Zhang, Sasu Tarkoma, Tommi Mikkonen, Abhishek Kumar

机构 * Faculty of Information Technology(信息技术学院) University of Jyväskylä(于韦斯屈莱大学) Adobe Research(奥多比研究院) University of Helsinki(赫尔辛基大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.MM

AI总结 本文提出SE-MoLoRA框架,通过共享LoRA专家与路由适配器解耦通用摄影知识和专业判断,在摄影评论生成任务上显著提升BERTScore-F1,且更受偏好、参数更少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17931 2026-08-19 cs.CL cs.MM cs.SD 新提交 62%

SpeechSense: A Paralinguistic-Focused Dataset for Fine-Grained Speech Sentiment Analysis

SpeechSense:面向细粒度语音情感分析的副语言聚焦数据集

Shicheng Ma, Wenqian Cui, Irwin King

机构 * The Chinese University of Hong Kong(香港中文大学)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CL、cs.MM

AI总结 本文针对现有语音情感分析研究的两大局限,构建了副语言聚焦的细粒度语音情感分析数据集SpeechSense,实验证实具备声学信息的模型性能优于纯文本基线,凸显了声学线索的重要性。

Comments 7 pages, 2 figures, 5 tables. Accepted to ACM Multimedia 2026 (Dataset Track). Dataset and code: https://github.com/Sher13cked/SpeechSense

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17044 2026-08-19 cs.CV cs.AI 新提交 62%

The 10th AI City Challenge

第10届AI City挑战赛

Zheng Tang, Shuo Wang, David C. Anastasiu, Ming-Ching Chang, Anuj Sharma, Quan Kong, Munkhjargal Gochoo, Jun-Wei Hsieh, Tomasz Kornuta, Zhedong Zheng, Renran Tian, Judah Goldfeder, Fulgencio Navarro, Yuxing Wang, Yizhou Wang, Sameer Satish Pusegaonkar, Anqi Li, Nalin Dadhich, Ridham Kachhadiya, Dhanishtha Patil, Haoquan Liang, Jiajun Li, Han Zhang, Yilin Zhao, Zaid Pervaiz Bhat, Shuyu Yang, Ashutosh Kumar, Rong Wang, Rafael Martin Nieto, Peter Christiansen, Ahmed Abduljawad, Mohanrasu Shanmugam, Nadeem Shaik, Sujit Biswas, Xunlei Wu, Vidya Murali, Rama Chellappa

机构 * Santa Clara University(圣克拉拉大学) University at Albany, SUNY(纽约州立大学奥尔巴尼分校) Iowa State University(爱荷华州立大学) Woven by Toyota(丰田编织公司) United Arab Emirates University(阿拉伯联合酋长国大学) National Yang Ming Chiao Tung University(国立阳明交通大学) University of Macau(澳门大学) North Carolina State University(北卡罗来纳州立大学) Columbia University(哥伦比亚大学) Milestone Systems(里程碑系统公司) Xi’an Jiaotong University(西安交通大学) Johns Hopkins University(约翰斯·霍普金斯大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文总结了与ECCV 2026同期举办的第10届AI City挑战赛的设置、数据集、评估结果等,该赛事规模扩大,设多类赛道,成功系统结合基础模型与多种技术。

Comments Summary of the 10th AI City Challenge Workshop in conjunction with ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16622 2026-08-18 cs.CV cs.AI 新提交 62%

HarmTrace: Anchor-Calibrated Decoupled Optimization for Fine-Grained Target Identification in Harmful Memes

HarmTrace:用于恶意梗图细粒度目标识别的锚定校准解耦优化方法

Yujia Li, Yiqun Zhang, Zihan Cheng, Yijie Huang, Tenglong Ye, Zihan Wang, Xiaocui Yang, Shi Feng, Yifei Zhang, Daling Wang

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本研究针对多模态恶意梗图检测中存在的目标识别错误问题,提出HarmTrace框架,结合实体感知微调与CTPO方法,在Qwen3-VL-8B上JRA提升至52.51%,还构建了Meme3W数据集与JRA指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15630 2026-08-18 cs.HC cs.AI cs.CL 新提交 62%

Do Assessment Instruments Measure the Same Thing for Humans and LLMs? A Latent Structure Analysis

评估工具对人类和大语言模型(LLMs)是否测量相同的内容?潜在结构分析

Alona Strugatski, Licol Zeinfeld, Giora Alexandron

机构 * Weizmann Institute of Science(魏茨曼科学研究院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过探索性因子分析等方法,发现高中化学和大学入学考试定量推理部分的评估,对人类与六个多模态LLMs测量的潜在结构存在系统性差异,质疑了此类评估用于推断AI能力的效度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15425 2026-08-18 cs.CV cs.AI 新提交 62%

NumerosityVLM: A Cognitively Inspired Benchmark for Interpreting Numerosity Representations in Vision-Language Models

NumerosityVLM:一种受认知启发的、用于解释视觉-语言模型中数量表征的基准测试

Yiming Fu, Fangjun Li, Xiujin Liu, Ruidong Ma, Hang Yu, Zhichen Lu, Kanwei He, Alessandro Di Nuovo, Angelo Cangelosi, Zhegong Shangguan

机构 * The University of Manchester(曼彻斯特大学) University of Michigan(密歇根大学) Sheffield Hallam University(谢菲尔德哈勒姆大学) Tufts University(塔夫茨大学) ENSTA, Institut Polytechnique de Paris(巴黎综合理工学院国立高等先进技术学校)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究针对视觉-语言模型数量感知研究的基准缺陷,提出受认知启发的NumerosityVLM基准,评估7个模型发现架构对性能影响最大,数量信号出现在视觉编码器早期,差异主要来自语言模型组件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14724 2026-08-18 cs.CV cs.AI cs.LG 新提交 62%

Privacy-Preserving Dataset Curation for Kuala Lumpur Urban Traffic: Grounded Vision-Language Detection with Spatial Vehicle-Context Filtering

面向吉隆坡城市交通的隐私保护数据集构建:结合空间车辆上下文过滤的接地视觉-语言检测

Mohammed Abdul Al Arafat Tanzin, Rudzidatul Akmam Dziyauddin

机构 * Faculty of Artificial Intelligence, Universiti Teknologi Malaysia(马来西亚理工大学人工智能学院)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 针对吉隆坡热带城市交通场景的隐私保护数据集构建难题,提出结合Grounding DINO与空间车辆ROI包含引擎的自动化匿名化框架,在1266帧图像上实现约95%的匿名化成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏