arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-27 至 2026-01-27 共收录 116 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 14 篇

2502.00662 2026-01-27 cs.CV cs.CL cs.LG 84%

Mitigating the Modality Gap: Few-Shot Out-of-Distribution Detection with Multi-modal Prototypes and Image Bias Estimation

弥合模态差距:基于多模态原型和图像偏差估计的少样本分布外检测

Yimu Wang, Evelien Riddell, Adrian Chow, Sean Sedwards, Krzysztof Czarnecki

机构 * University of Waterloo(滑铁卢大学)

专题命中 图文多模态 :multi-modal(title);cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.CL

AI总结 本文提出SUPREME框架,通过引入多模态原型和图像偏差估计,有效缓解图像与文本之间的模态差距,提升少样本分布外检测性能。

Comments WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11808 2026-01-27 cs.CV cs.AI cs.CL cs.CY cs.MM 83%

Labels or Input? Rethinking Augmentation in Multimodal Hate Detection

标签还是输入?重新思考多模态仇恨检测中的增强

Sahajpreet Singh, Kokil Jaidka, Subhayan Mukerjee

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出通过提示优化、微调和自动化数据增强改进小型模型,开发多模态增强框架以提升隐含仇恨检测性能。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18356 2026-01-27 cs.LG 82%

Making medical vision-language models think causally across modalities with retrieval-augmented cross-modal reasoning

通过检索增强的跨模态推理使医疗视觉-语言模型在多模态中实现因果推理

Weiqin Yang, Haowen Xue, Qingyi Peng, Hexuan Hu, Qian Huang, Tingbo Zhang

机构 * University of Adelaide(阿德莱德大学) Hohai University(河海大学) Amap

专题命中 图文多模态 :cross-modal(title);multimodal(abstract);image-text(abstract)

AI总结 本文提出多模态因果检索增强生成框架,通过整合因果推理原理与多模态检索,提升医疗VLMs在诊断预测和视觉问答中的事实准确性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11020 2026-01-27 cs.CV cs.AI 81%

GeoVLMath: Enhancing Geometry Reasoning in Vision-Language Models via Cross-Modal Reward for Auxiliary Line Creation

GeoVLMath: 通过跨模态奖励增强视觉-语言模型中的几何推理以辅助线创建

Shasha Guo, Liang Pang, Xi Wang, Yanling Wang, Huawei Shen, Jing Zhang

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Renmin University of China(中国人民大学) Zhipu AI(智谱AI)

专题命中 图文多模态 :cross-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 GeoVLMath通过跨模态奖励模型提升视觉-语言模型在复杂立体几何问题中的几何推理能力。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18190 2026-01-27 cs.CV 79%

Multi-Perspective Subimage CLIP with Keyword Guidance for Remote Sensing Image-Text Retrieval

多视角子图像CLIP与关键词引导的遥感图像-文本检索

Yifan Li, Shiying Wang, Jianqiang Huang

机构 * School of Computer Technology and Applications(计算机技术与应用学院) Qinghai University(青海大学) Qinghai Provincial Laboratory for Intelligent Computing and Application(青海省智能计算与应用实验室)

专题命中 图文多模态 :image-text(title,abstract);分类 cs.CV

AI总结 MPS-CLIP通过关键词引导的多视角细粒度对齐提升遥感图像-文本检索性能,实现35.18%和48.40%的mR成绩。

Comments 7 pages, 3 figures. Code: https://github.com/Lcrucial1f/MPS-CLIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17197 2026-01-27 cs.CL cs.LG 79%

Reasoning Beyond Literal: Cross-style Multimodal Reasoning for Figurative Language Understanding

超越字面:跨风格多模态推理用于隐喻语言理解

Seyyed Saeid Cheshmi, Hahnemann Ortiz, James Mooney, Dongyeop Kang

机构 * University of Minnesota(明尼苏达大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出一种三步框架,通过跨风格多模态推理提升隐喻语言理解能力,实验显示推理轨迹和跨风格训练能显著提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24330 2026-01-27 cs.CV 79%

SenseNova-MARS: Empowering Multimodal Agentic Reasoning and Search via Reinforcement Learning

SenseNova-MARS: 通过强化学习赋能多模态代理推理与搜索

Yong Xien Chng, Tao Hu, Wenwen Tong, Xueheng Li, Jiandong Chen, Haojia Yu, Jiefan Lu, Hewei Guo, Hanming Deng, Chengjun Xie, Gao Huang, Dahua Lin, Lewei Lu

机构 * SenseTime Research(商汤科技研究院) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 SenseNova-MARS通过强化学习赋能多模态代理推理与搜索,提升视觉-语言模型在复杂视觉任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17082 2026-01-27 cs.CY cs.AI cs.CL cs.CV cs.LG 67%

Do VLMs Have a Moral Backbone? A Study on the Fragile Morality of Vision-Language Models

视觉-语言模型是否具有道德基础?对视觉语言模型脆弱道德的研究

Zhining Liu, Tianyi Wang, Xiao Lin, Penghao Ouyang, Gaotang Li, Ze Yang, Hui Liu, Sumit Keswani, Vishwa Pardeshi, Huijun Zhao, Wei Fan, Hanghang Tong

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊) Fidelity Investments(富达投资)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 研究发现视觉语言模型在面对文本和视觉扰动时道德判断易变,需通过轻量干预提升道德鲁棒性以确保负责任的部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13379 2026-01-27 cs.AI cs.CV 62%

The Art of Saying "Maybe": A Conformal Lens for Uncertainty Benchmarking in VLMs

也许的艺术:一种用于VLMs不确定性基准测试的共形透镜

Asif Azad, Mohammad Sadat Hossain, MD Sadik Hossain Shanto, M Saifur Rahman, Md Rizwan Parvez

机构 * Bangladesh University of Engineering and Technology(孟加拉工程与技术大学) Qatar Computing Research Institute(卡塔尔计算研究所)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种用于VLMs不确定性基准测试的共形透镜,评估了18种最先进的VLMs在6个多元数据集上的表现,发现更大模型在不确定性量化方面表现更佳,而数学和推理任务则表现出较差的不确定性性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17706 2026-01-27 cs.CL cs.CV 62%

A Computational Approach to Visual Metonymy

一种视觉隐喻的计算方法

Saptarshi Ghosh, Linfeng Liu, Tianyu Jiang

机构 * University of Cincinnati(辛辛那提大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出了一种基于符号学理论的计算方法,通过构建ViMET数据集评估多模态语言模型在理解视觉隐喻方面的认知推理能力,并揭示了机器在处理间接视觉参考上的局限性。

Comments EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18525 2026-01-27 cs.LG cs.CV 57%

Closing the Modality Gap Aligns Group-Wise Semantics

弥合模态差距以对齐群体语义

Eleonora Grassucci, Giordano Cicchetti, Emanuele Frasca, Aurelio Uncini, Danilo Comminiello

机构 * Department of Information Engineering, Electronics, and Telecommunications(信息工程、电子与电信系)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出了一种方法,证明模态差距在群体级任务中显著影响性能,而非实例级任务。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.16738 2026-01-27 cs.CV 57%

ELIP: Efficient Discriminative Language-Image Pre-training with Fewer Vision Tokens

ELIP: 一种更高效的语言-图像预训练方法,使用更少的视觉标记

Yangyang Guo, Haoyu Zhang, Yongkang Wong, Liqiang Nie, Mohan Kankanhalli

机构 * National University of Singapore(新加坡国立大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 ELIP通过高效修剪视觉标记,减少计算资源消耗,同时保持模型性能,适用于多种下游任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06515 2026-01-27 cs.CV 57%

BigTokDetect: A Clinically-Informed Vision-Language Modeling Framework for Detecting Pro-Bigorexia Videos on TikTok

BigTokDetect: 一种临床指导的视觉-语言建模框架,用于检测TikTok上促进大肌肉畸形行为的视频

Minh Duc Chu, Kshitij Pawar, Zihao He, Roxanna Sharifi, Ross Sonnenblick, Magdalayna Curry, Laura D'Adamo, Lindsay Young, Stuart B Murray, Kristina Lerman

机构 * USC Information Sciences Institute(USC信息科学研究所) Keck School of Medicine, USC(USC凯克医学院) Department of Clinical Psychology, Drexel University(德雷塞尔大学临床心理学系) Department of Psychiatry and Biobehavioral Sciences, UCLA(UCLA精神病学与生物行为科学系)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 BigTokDetect通过临床指导的视觉-语言模型,检测TikTok上促进大肌肉畸形行为的视频,建立了可扩展的有害内容缓解框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11908 2026-01-27 cs.RO 50%

Safe Learning for Contact-Rich Robot Tasks: A Survey from Classical Learning-Based Methods to Safe Foundation Models

接触丰富机器人任务的安全学习:从经典学习方法到安全基础模型的综述

Heng Zhang, Rui Dai, Gokhan Solak, Pokuang Zhou, Yu She, Arash Ajoudani

机构 * Human-Robot Interfaces and Interaction Lab, Istituto Italiano di Tecnologia, Genova, Italy(人类-机器人接口与交互实验室,意大利技术研究院,热那亚,意大利) Ph.D. program of national interest in Robotics and Intelligent Machines (DRIM) and Università di Genova, Genoa, Italy(机器人与智能机器国家利益博士项目(DRIM)和热那亚大学,热那亚,意大利) Edwardson School of Industrial Engineering, Purdue University, West Lafayette, IN, USA(工业工程埃德华森学校,普渡大学,西拉法伊斯,美国)

专题命中 图文多模态 :multimodal(abstract)

AI总结 本文综述了接触丰富机器人任务的安全学习方法,探讨了从经典学习方法到安全基础模型的发展,分析了安全探索与执行的关键技术及未来方向。

Comments version 2

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 14 篇

2508.01659 2026-01-27 cs.SD eess.AS 88%

From Contrast to Commonality: Audio Commonality Captioning for Enhanced Audio-Text Cross-modal Understanding in Multimodal LLMs

从对比到共同性:用于增强多模态大语言模型中音频-文本跨模态理解的音频共同性描述

Yuhang Jia, Xu Zhang, Yujie Guo, Yang Chen, Shiwan Zhao

机构 * TMCC, College of Computer Science, Nankai University, Tianjin, China(TMCC,计算机科学学院,南开大学,天津,中国)

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(title,abstract);分类 eess.AS

AI总结 本文提出音频共同性描述方法,旨在增强多模态大语言模型中音频与文本的跨模态理解,通过捕捉音频片段间的共享语义以改善模型的泛化能力与任务特定性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17645 2026-01-27 cs.SD cs.CL cs.CV cs.MM eess.AS 85%

AVMeme Exam: A Multimodal Multilingual Multicultural Benchmark for LLMs' Contextual and Cultural Knowledge and Thinking

AVMeme Exam: 一个多模态、多语言、多文化的基准测试,用于评估LLM的上下文和文化知识与思维

Xilin Jiang, Qiaolin Wang, Junkai Wu, Xiaomin He, Zhongweiyang Xu, Yinghao Ma, Minshuo Piao, Kaiyi Yang, Xiuwen Zheng, Riki Shimizu, Yicong Chen, Arsalan Firoozi, Gavin Mischler, Sukru Samet Dindar, Richard Antonello, Linyang He, Tsun-An Hsieh, Xulin Fan, Yulun Wu, Yuesheng Ma, Chaitanya Amballa, Weixiong Chen, Jiarui Hai, Ruisi Li, Vishal Choudhari, Cong Han, Yinghao Aaron Li, Adeen Flinker, Mounya Elhilali, Emmanouil Benetos, Mark Hasegawa-Johnson, Romit Roy Choudhury, Nima Mesgarani

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(abstract);分类 cs.CV、cs.CL、cs.MM

AI总结 AVMeme Exam 通过多模态、多语言、多文化的基准测试,评估LLM在上下文和文化理解方面的局限性,揭示模型在无文本音乐和文化思维上的不足。

Comments avmemeexam.github.io/public

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17530 2026-01-27 cs.CL 83%

Revealing the Truth with ConLLM for Detecting Multi-Modal Deepfakes

用ConLLM揭示真相以检测多模态深度伪造

Gautam Siddharth Kashyap, Harsh Joshi, Niharika Jain, Ebad Shabbir, Jiechao Gao, Nipun Joshi, Usman Naseem

机构 * Macquarie University(麦考瑞大学) Bharati Vidyapeeth’s College Of Engineering(巴里蒂大学工程学院) Vivekananda Institute of Professional Studies (VIPS)(维维kananda专业研究学院) DSEU-Okhla Center for SDGC(SDGC研究中心) Stanford University(斯坦福大学) Cornell University(康奈尔大学)

专题命中 音频语音多模态 :multi-modal(title);multimodal(abstract);audio-visual(abstract);分类 cs.CL

AI总结 ConLLM通过对比学习和大语言模型推理,有效提升多模态深度伪造检测的准确率和泛化能力。

Comments Accepted at EACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18393 2026-01-27 cs.SD cs.CL eess.AS 81%

OCR-Enhanced Multimodal ASR Can Read While Listening

增强OCR的多模态ASR可边听边读

Junli Chen, Changli Tang, Yixuan Li, Guangzhi Sun, Chao Zhang

机构 * Department of Electrical Engineering, Tsinghua University, Beijing, China(电子工程系,清华大学,北京,中国)

专题命中 音频语音多模态 :multimodal(title);audio-visual(abstract);分类 cs.CL、eess.AS

AI总结 Donut-Whisper通过结合双编码器和交叉注意力模块,利用视觉信息提升中英文语音识别性能,实现显著的WER和CER降低。

Comments 4 pages, 2 figures. Submitted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17880 2026-01-27 cs.CV 79%

Quran-MD: A Fine-Grained Multilingual Multimodal Dataset of the Quran

Quran-MD: 一部涵盖多语言多模态的《古兰经》细粒度数据集

Muhammad Umar Salman, Mohammad Areeb Qazi, Mohammed Talha Alam

机构 * MBZUAI(穆扎伊人工智能研究所)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 Quran-MD 是一个包含多语言多模态的《古兰经》数据集,涵盖文本、语言和音频层面,用于提升语音识别、语义检索和个性化教学系统等应用。

Comments 6 pages, 2 tables and 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17638 2026-01-27 cs.CR 78%

FOCA: Multimodal Malware Classification via Hyperbolic Cross-Attention

FOCA:基于双模态的恶意软件分类方法

Nitin Choudhury, Bikrant Bikram Pratap Maurya, Orchid Chetia Phukan, Arun Balaji Buduru

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 FOCA通过双曲空间中的交叉注意力机制和双曲投影模块,实现音频和视觉模态的恶意软件分类,展现出优越的分类性能。

Comments Accepted to the International Conference on Acoustics, Speech, and Signal Processing (ICASSP) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18451 2026-01-27 cs.CV cs.AI cs.LG cs.MM cs.SD 67%

3DGesPolicy: Phoneme-Aware Holistic Co-Speech Gesture Generation Based on Action Control

3DGesPolicy: 基于动作控制的音素感知整体语义手势生成

Xuanmeng Sha, Liyun Zhang, Tomohiro Mashita, Naoya Chiba, Yuki Uranishi

机构 * The University of Osaka(大阪大学) Osaka Electro-Communication University(大阪电讯大学) Osaka University(大阪大学)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 3DGesPolicy通过基于动作控制的框架,结合音素感知和多模态信号融合,实现了更自然且高度语音对齐的整体语义手势生成。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16387 2026-01-27 cs.CL cs.AI cs.SD eess.AS 67%

Probing the Hidden Talent of ASR Foundation Models for L2 English Oral Assessment

探测ASR基础模型在二语英语口语评估中的隐藏潜能

Fu-An Chao, Bi-Cheng Yan, Berlin Chen

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 本文通过探测Whisper模型的隐藏能力,展示了其在二语英语口语评估中的潜力,通过轻量级分类器和辅助线索提升性能。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05749 2026-01-27 cs.SD 67%

MSF-SER: Enriching Acoustic Modeling with Multi-Granularity Semantics for Speech Emotion Recognition

MSF-SER:通过多粒度语义增强语音情感识别的声学建模

Haoxun Li, Yuqing Sun, Hanlei Shi, Yu Liu, Leyuan Qu, Taihao Li

机构 * Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(杭州高等研究所,中国科学院大学)

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract)

AI总结 MSF-SER通过多粒度语义融合提升语音情感识别的声学建模效果,解决传统方法在情感表达细节和高层解释性线索方面的不足。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18456 2026-01-27 cs.SD eess.AS 57%

Geneses: Unified Generative Speech Enhancement and Separation

Geneses: 一体化的生成式语音增强与分离

Kohei Asai, Wataru Nakata, Yuki Saito, Hiroshi Saruwatari

机构 * The University of Tokyo, Japan(东京大学) National Institute of Advanced Industrial Science and Technology (AIST), Japan(日本先进工业科学和技术研究院)

专题命中 音频语音多模态 :multi-modal(abstract);分类 eess.AS

AI总结 Geneses通过多模态扩散Transformer和潜在流匹配实现统一的高质量语音增强与分离,优于传统方法并具备更强的复杂退化鲁棒性。

Comments Accepted to ICASSP 2025 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14784 2026-01-27 eess.AS 57%

MELA-TTS: Joint transformer-diffusion model with representation alignment for speech synthesis

MELA-TTS:联合变压器-扩散模型与表征对齐用于语音合成

Keyu An, Zhiyu Zhang, Changfeng Gao, Yabin Li, Zhendong Peng, Haoxu Wang, Zhihao Du, Han Zhao, Zhifu Gao, Xiangang Li

专题命中 音频语音多模态 :cross-modal(abstract);分类 eess.AS

AI总结 MELA-TTS通过联合变压器-扩散模型与表征对齐,实现端到端文本到语音合成,提升连续特征建模效率和跨模态一致性。

Comments accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18010 2026-01-27 eess.AS cs.SD 57%

AmbER$^2$: Dual Ambiguity-Aware Emotion Recognition Applied to Speech and Text

AmbER$^2$: 双重模糊感知情感识别应用于语音和文本

Jingyao Wu, Grace Lin, Yinuo Song, Rosalind Picard

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 AmbER$^2$通过双重模糊感知框架提升语音和文本情感识别的准确性与鲁棒性。

Comments Accepted in ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03310 2026-01-27 eess.AS 57%

TASU: Text-Only Alignment for Speech Understanding

TASU:用于语音理解的纯文本对齐

Jing Peng, Yi Yang, Xu Li, Yu Xi, Quanwei Tang, Yangui Fang, Junjie Li, Kai Yu

专题命中 音频语音多模态 :cross-modal(abstract);分类 eess.AS

AI总结 TASU通过纯文本数据实现语音理解的跨模态对齐,提升了零样本语音识别性能,并在多个基准测试中优于现有模型。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17287 2026-01-27 cs.RO 50%

Real-Time Synchronized Interaction Framework for Emotion-Aware Humanoid Robots

面向情感感知人形机器人的实时同步交互框架

Yanrong Chen, Xihan Bian

机构 * Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本文提出一种实时框架,通过双通道情感引擎、动态时间规整和闭环验证,实现人形机器人的情感同步交互,提升在医疗、教育等动态场景中的应用能力。

Comments 6 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 10 篇

2503.18712 2026-01-27 cs.CV 83%

LLaVAction: evaluating and training multi-modal large language models for action understanding

LLaVAction:评估和训练多模态大语言模型进行动作理解

Haozhe Qi, Shaokai Ye, Alexander Mathis, Mackenzie W. Mathis

专题命中 视频多模态 :multi-modal(title);multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 LLaVAction通过引入动作标记和两阶段流程提升多模态大语言模型的动作理解能力,显著提升基准测试性能。

Comments https://github.com/AdaptiveMotorControlLab/LLaVAction

Journal ref International Conference on Learning Representations (ICLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17466 2026-01-27 cs.HC cs.AI cs.CL 81%

Autiverse: Eliciting Autistic Adolescents' Daily Narratives through AI-guided Multimodal Journaling

Autiverse: 通过AI引导的多模态日记记录 eliciting 自闭症青少年的日常叙述

Migyeong Yang, Kyungah Lee, Jinyoung Han, SoHyun Park, Young-Ho Kim

机构 * NAVER AI Lab(NAVER AI实验室) Dodakim Child Development Center(Dodakim儿童发展中心) Sungkyunkwan University(松均大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 Autiverse通过AI引导的多模态日记记录帮助自闭症青少年组织日常经历,提升叙述能力并增强自主感。

Comments 19 pages excluding reference. Conditionally accepted to ACM CHI 2026

Journal ref In Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems (CHI '26), April 13-17, 2026, Barcelona, Spain. ACM, New York, NY, USA, 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏