arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-10 至 2026-02-10 共收录 127 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 8 篇

2602.07790 2026-02-10 cs.LG 82%

MaD-Mix: Multi-Modal Data Mixtures via Latent Space Coupling for Vision-Language Model Training

MaD-Mix: 通过潜在空间耦合实现多模态数据混合用于视觉-语言模型训练

Wanyun Xie, Francesco Tonin, Volkan Cevher

机构 * LIONS, EPFL(EPFL 雷奥尼实验室)

专题命中 图文多模态 :multi-modal(title,abstract);image-text(abstract)

AI总结 MaD-Mix通过潜在空间耦合实现多模态数据混合,提升视觉-语言模型训练效率,减少训练步骤并增强复杂场景下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07017 2026-02-10 cs.CV cs.AI 81%

XAI-CLIP: ROI-Guided Perturbation Framework for Explainable Medical Image Segmentation in Multimodal Vision-Language Models

XAI-CLIP: 通过区域感兴趣引导扰动框架实现多模态视觉-语言模型中可解释的医学图像分割

Thuraya Alzubaidi, Sana Ammar, Maryam Alsharqi, Islem Rekik, Muzammil Behzad

机构 * King Fahd University of Petroleum and Minerals(国王法赫德石油和矿物大学) Massachusetts Institute of Technology(麻省理工学院) Imperial College London(伦敦帝国学院) KFUPM-SDAIA Joint Research Centre for Artificial Intelligence(KFUPM-SDAIA联合人工智能研究中心)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 XAI-CLIP通过多模态视觉-语言模型嵌入实现医学图像分割的可解释性和效率提升,减少计算开销并提高分割精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00030 2026-02-10 cs.LG 78%

RAPTOR-AI for Disaster OODA Loop: Hierarchical Multimodal RAG with Experience-Driven Agentic Decision-Making

RAPTOR-AI用于灾难OODA循环:基于经验驱动的多模态RAG框架

Takato Yasuno

专题命中 图文多模态 :multimodal(title,abstract)

AI总结 RAPTOR-AI通过分层多模态RAG框架,结合经验驱动的代理控制和LoRA适应,提升灾害响应中的检索精度、情境基础性和任务分解准确性。

Comments 8 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07311 2026-02-10 cs.CV cs.AI 73%

LUCID-SAE: Learning Unified Vision-Language Sparse Codes for Interpretable Concept Discovery

LUCID-SAE:学习统一的视觉-语言稀疏代码以发现可解释的概念

Difei Gu, Yunhe Gao, Gerasimos Chatzoudis, Zihan Dong, Guoning Zhang, Bangwei Guo, Yang Zhou, Mu Zhou, Dimitris Metaxas

机构 * Rutgers University(罗杰斯大学) Stanford University(斯坦福大学)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 LUCID-SAE通过统一视觉-语言稀疏编码方法,实现了跨模态的可解释概念发现与多模态表示的鲁棒性提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08339 2026-02-10 cs.AI cs.CV 62%

CoTZero: Annotation-Free Human-Like Vision Reasoning via Hierarchical Synthetic CoT

CoTZero:通过分层合成CoT实现无标注的人类级视觉推理

Chengyi Du, Yazhe Niu, Dazhong Shen, Luxin Xu

机构 * University of Electronic Science and Technology of China(电子科技大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Chinese University of Hong Kong MMLab(香港中文大学 MMLab) The College of Computer Science and Technology(计算机科学与技术学院) Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

AI总结 CoTZero通过双阶段数据合成和认知对齐训练,实现无标注的人类级视觉推理,提升模型的层次推理和泛化能力。

Comments 16 pages 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11397 2026-02-10 cs.CV 57%

EAGLE: Elevating Geometric Reasoning through LLM-empowered Visual Instruction Tuning

通过LLM赋能的视觉指令微调提升几何推理能力

Zhihao Li, Yao Du, Yang Liu, Yan Zhang, Yufang Liu, Mengdi Zhang, Xunliang Cai, Charles Ling, Boyu Wang

机构 * Department of Computer Science, Western University(计算机科学系,西部大学) Meituan Inc.(美团公司) Department of Automation, Tsinghua University(自动化系,清华大学) School of Computer Science and Technology, East China Normal University(计算机科学与技术学院,东华大学)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 EAGLE通过视觉增强框架提升几何推理能力,解决MLLMs在几何理解与视觉感知上的不足。

Comments revised version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07469 2026-02-10 astro-ph.IM 50%

Toward Vision-Language Assistants for Radio Astronomical Source Analysis

迈向射电天文源分析的视觉-语言助手

S. Riggi

专题命中 图文多模态 :multimodal(abstract)

AI总结 本文提出radio-llava,一种针对射电天文的视觉-语言助手,通过指令微调提升多任务性能,但发现专用视觉模型仍更优,且微调导致通用任务性能下降。

Comments 5 pages, 3 figures, Proceedings IAU Symposium No. 397, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05325 2026-02-10 cs.RO 50%

RoboPaint: From Human Demonstration to Any Robot and Any View

RoboPaint:从人类示范到任何机器人和任何视角

Jiacheng Fan, Zhiyue Zhao, Yiqian Zhang, Chao Chen, Peide Wang, Hengdi Zhang, Zhengxue Cheng

机构 * Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

专题命中 图文多模态 :multimodal(abstract)

AI总结 RoboPaint通过真实-仿真-真实数据流程,将人类示范转化为机器人训练数据,实现高效、低成本的复杂灵巧操作训练。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 11 篇

2602.08309 2026-02-10 cs.CV 88%

CAE-AV: Improving Audio-Visual Learning via Cross-modal Interactive Enrichment

CAE-AV:通过跨模态交互增强改进音频-视觉学习

Yunzuo Hu, Wen Li, Jing Zhang

机构 * School of Information Science and Engineering, East China University of Science and Technology (ECUST)(信息科学与工程学院,东华大学)

专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(title,abstract);分类 cs.CV

AI总结 CAE-AV通过跨模态交互增强框架,解决音频-视觉学习中的模态不对齐问题,提升表示质量和任务性能。

Comments 13 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08293 2026-02-10 eess.AS 88%

Cross-Modal Bottleneck Fusion For Noise Robust Audio-Visual Speech Recognition

跨模态瓶颈融合用于噪声鲁棒的音频视觉语音识别

Seaone Ok, Min Jun Choi, Eungbeom Kim, Seungu Han, Kyogu Lee

专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(title,abstract);分类 eess.AS

AI总结 CoBRA通过跨模态瓶颈融合机制,在噪声环境下提升音频视觉语音识别的鲁棒性和效率。

Comments 5 pages, 3 figures, ICASSP 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08914 2026-02-10 cs.HC cs.AI 83%

Gesturing Toward Abstraction: Multimodal Convention Formation in Collaborative Physical Tasks

指向抽象:协作物理任务中的多模态惯例形成

Kiyosu Maeda, William P. McCarthy, Ching-Yi Tsai, Jeffrey Mu, Haoliang Wang, Robert D. Hawkins, Judith E. Fan, Parastoo Abtahi

机构 * Princeton University(普林斯顿大学) Brown University(布朗大学) MIT(麻省理工学院) Stanford University(斯坦福大学)

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 研究通过多模态协作任务探讨了如何通过建立语言和手势抽象来提高协作效率,并扩展了惯例形成的概率模型。

Comments Accepted at the 2026 CHI Conference on Human Factors in Computing Systems (CHI 2026). 15 pages

Journal ref Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems (CHI '26), ACM, 2026

URL PDF HTML 收藏
2602.07960 2026-02-10 cs.CV 79%

D-ORCA: Dialogue-Centric Optimization for Robust Audio-Visual Captioning

D-ORCA:面向鲁棒音频视觉描述的对话中心优化

Changli Tang, Tianyi Wang, Fengyun Rao, Jing Lyu, Chao Zhang

机构 * Tsinghua University(清华大学) WeChat Vision, Tencent Inc.(腾讯微信视觉实验室)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

AI总结 D-ORCA通过对话中心优化,提升音频视觉描述的鲁棒性和准确性,填补开源生态关键空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07434 2026-02-10 cs.RO cs.AI 79%

Bridging Speech, Emotion, and Motion: a VLM-based Multimodal Edge-deployable Framework for Humanoid Robots

弥合语音、情感与运动:一种基于视觉语言模型的多模态边缘可部署框架用于人形机器人

Songhua Yang, Xuetao Li, Xuanye Fei, Mengde Li, Miao Li

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出SeM$^2$框架,通过多模态感知、思维链推理和语义序列对齐机制,实现情感一致的多模态交互,提升人形机器人在现实环境中的社交表达能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11261 2026-02-10 cs.CL 79%

Kahaani: A Multimodal Co-Creative Storytelling System

Kahaani:一种多模态协同创作叙事系统

Samee Arif, Muhammad Saad Haroon, Aamina Jamal Khan, Taimoor Arif, Agha Ali Raza, Awais Athar

机构 * Lahore University of Management Sciences(拉瓦尔大学管理科学学院) University of Michigan(密歇根大学) Strategize Labs(战略实验室)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 Kahaani通过多模态技术帮助儿童提升英语能力、学习生活教训并理解故事结构,采用协同创作方式提供沉浸式教育体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18268 2026-02-10 cs.LG 78%

Reducing Aleatoric and Epistemic Uncertainty through Multi-modal Data Acquisition

通过多模态数据采集减少偶然性和epistemic不确定性

Arthur Hoarau, Benjamin Quost, Sébastien Destercke, Willem Waegeman

机构 * Université de Lorraine, CentraleSupélec CNRS, LORIA, Metz, France(洛林大学、中央超导电子学学院 CNRS、LORIA、法国梅茨) Université de technologie de Compiègne UMR CNRS 7253 Heudiasyc, France(图卢兹理工学院 UMR CNRS 7253 Heudiasyc、法国) CNRS, Université de technologie de Compiègne UMR CNRS 7253 Heudiasyc, France(CNRS、图卢兹理工学院 UMR CNRS 7253 Heudiasyc、法国) University of Ghent Ghent, Belgium(根特大学、比利时根特)

专题命中 音频语音多模态 :multi-modal(title,abstract)

AI总结 本文提出一种多模态数据采集框架,通过增加模态数量和收集更多观测来减少偶然性和epistemic不确定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19611 2026-02-10 cs.HC 78%

Scene2Hap: Generating Scene-Wide Haptics for VR from Scene Context with Multimodal LLMs

Scene2Hap: 从场景上下文生成VR场景中的全域触觉反馈

Arata Jingu, Easa AliAbbasi, Sara Safaee, Paul Strohmeier, Jürgen Steimle

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 Scene2Hap通过多模态大语言模型生成VR场景中的触觉反馈,提升沉浸感与真实感。

Comments Accepted at CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07179 2026-02-10 cs.HC cs.AI cs.CL cs.CY cs.IT math.IT 62%

An Information-Theoretic Framework for Comparing Voice and Text Explainability

一种信息论框架用于比较语音和文本的可解释性

Mona Rajhans, Vishal Khawarey

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种信息论框架,用于比较语音和文本在AI系统可解释性中的效果,发现类比基于的交付在理解效率与信任校准之间取得最佳平衡。

Comments Accepted for publication at the 10th ACM International Conference on Intelligent Systems, Metaheuristics & Swarm Intelligence (ISMSI 2026), April 24-26, Cebu City, Phillipines

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07143 2026-02-10 cs.SD cs.CL 57%

Massive Sound Embedding Benchmark (MSEB)

大规模声音嵌入基准(MSEB)

Georg Heigold, Ehsan Variani, Tom Bagby, Cyril Allauzen, Ji Ma, Shankar Kumar, Michael Riley

机构 * Google Research(谷歌研究)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 MSEB是一个用于评估多模态系统听觉组件的可扩展框架,提供八个核心任务和大规模数据集,旨在推动稳健的机器听觉智能发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07266 2026-02-10 cs.HC 50%

ADCanvas: Accessible and Conversational Audio Description Authoring for Blind and Low Vision Creators

ADCanvas: 为视障和低视力创作者提供可访问且对话式的音频描述创作工具

Franklin Mingzhe Li, Michael Xieyang Liu, Cynthia L. Bennett, Shaun K. Kane

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 ADCanvas为视障和低视力创作者提供可访问且对话式的音频描述创作工具,通过多模态交互支持端到端的AD创作和视觉问答。

Comments 21 pages, 4 figures, published in CHI '26

Journal ref Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems (CHI '26), April 13-17, 2026, Barcelona, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 18 篇

2511.18845 2026-02-10 cs.AI 83%

UNeMo: Collaborative Visual-Language Reasoning and Navigation via a Multimodal World Model

UNeMo:通过多模态世界模型实现协作的视觉-语言推理与导航

Changxin Huang, Lv Tang, Zhaohuan Zhan, Lisha Yu, Runhao Zeng, Zun Liu, Zhengjie Wang, Jianqiang Li

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 UNeMo通过多模态世界模型实现视觉-语言推理与导航的协作优化,提升导航准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08057 2026-02-10 cs.CV cs.AI 81%

Weak to Strong: VLM-Based Pseudo-Labeling as a Weakly Supervised Training Strategy in Multimodal Video-based Hidden Emotion Understanding Tasks

弱到强:基于VLM的伪标签作为多模态视频隐藏情绪理解任务中的弱监督训练策略

Yufei Wang, Haixu Liu, Tianxiang Xu, Chuancheng Shi, Hongsheng Xing

机构 * The University of New South Wales, Sydney, New South Wales, Australia(新南威尔士大学) The University of Sydney, Sydney, New South Wales, Australia(悉尼大学) School of Software and Microelectronics, Peking University, Zibo, Shandong, China(北京大学软件与微电子学院) Shandong University of Technology, Beijing, China(山东理工大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出基于VLM的伪标签弱监督方法,用于多模态视频隐藏情绪识别,提升准确率至0.69并建立新基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08861 2026-02-10 cs.CV 79%

TiFRe: Text-guided Video Frame Reduction for Efficient Video Multi-modal Large Language Models

TiFRe: 基于文本的视频帧减少用于高效视频多模态大语言模型

Xiangtian Zheng, Zishuo Wang, Yuxin Peng

机构 * Wangxuan Institute of Computer Technology, Peking University(王轩计算机技术研究所,北京大学)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 TiFRe通过文本引导的帧采样和帧匹配机制,有效减少视频输入帧数,同时保留关键信息,提升视频多模态大语言模型的效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13564 2026-02-10 cs.CV 79%

State-Space Hierarchical Compression with Gated Attention and Learnable Sampling for Hour-Long Video Understanding in Large Multimodal Models

具有门控注意力和可学习采样的状态空间分层压缩用于大多模态模型中的小时级视频理解

Geewook Kim, Minjoon Seo

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于状态空间模型和门控注意力的高效压缩方法,用于减少大模型中小时级视频的token消耗,同时保持性能。

Comments AAAI 2026 (Oral). Project page: https://github.com/naver-ai/mambamia

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07388 2026-02-10 cs.RO 78%

Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation

面向长时程机器人操作的多模态动作消歧的轨迹聚焦扩散策略

Yuxuan Hu, Xiangyu Chen, Chuhao Zhou, Yuxi Liu, Gen Li, Jindou Jia, Jianfei Yang

机构 * MARS Lab, Nanyang Technological University(MARS实验室,南洋理工大学)

专题命中 视频多模态 :multi-modal(title,abstract)

AI总结 TF-DP通过轨迹聚焦解决长时程机器人操作中的多模态动作模糊问题,提升时间一致性和鲁棒性,实验结果优于普通扩散策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08439 2026-02-10 cs.CV 70%

Demo-ICL: In-Context Learning for Procedural Video Knowledge Acquisition

Demo-ICL: 用于过程视频知识获取的上下文学习

Yuhao Dong, Shulin Tian, Shuai Liu, Shuangrui Ding, Yuhang Zang, Xiaoyi Dong, Yuhang Cao, Jiaqi Wang, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) Shanghai AI Lab(上海人工智能实验室) CUHK-MMLab(香港大学多媒体实验室)

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 Demo-ICL通过两阶段训练策略提升模型从上下文示例中学习的能力,针对视频理解中的新挑战提出Demo-ICL-Bench基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03803 2026-02-10 cs.CV 70%

EgoLife: Towards Egocentric Life Assistant

EgoLife:迈向以自身为中心的生活助手

Jingkang Yang, Shuai Liu, Hongming Guo, Yuhao Dong, Xiamengwei Zhang, Sicheng Zhang, Pengyun Wang, Zitang Zhou, Binzhu Xie, Ziyue Wang, Bei Ouyang, Zhengyu Lin, Marco Cominelli, Zhongang Cai, Yuanhan Zhang, Peiyuan Zhang, Fangzhou Hong, Joerg Widmer, Francesco Gringoli, Lei Yang, Bo Li, Ziwei Liu

机构 * S-Lab, Nanyang Technological University, Singapore(南洋理工大学新加坡分校) LMMs-Lab(LMMs实验室) IMDEA Networks, Spain(西班牙IMDEA网络) University of Brescia, Italy(意大利布雷西亚大学) Politecnico di Milano, Italy(意大利米兰理工学院)

专题命中 视频多模态 :multimodal(abstract);omni-modal(abstract);分类 cs.CV

AI总结 EgoLife旨在通过AI赋能的可穿戴设备开发以自身为中心的生活助手,通过多模态数据集和EgoButler系统提升日常效率与个性化服务。

Comments This version corrects the author affiliation to reflect the accurate institutional information at the time of publication. No technical content of the paper has been changed

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08448 2026-02-10 cs.CV cs.AI 62%

Vista: Scene-Aware Optimization for Streaming Video Question Answering under Post-Hoc Queries

Vista:面向事后查询的场景感知流视频问答优化

Haocheng Lu, Nan Zhang, Wei Tao, Xiaoyang Qu, Guokuan Li, Jiguang Wan, Jianzong Wang

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 Vista通过场景感知分割、压缩和召回技术,实现了高效且可扩展的流视频问答,提升了长上下文推理能力,同时保持低延迟和内存效率。

Comments Accepted to AAAI 2026 (Main Technical Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07625 2026-02-10 cs.CV cs.AI 62%

AD-MIR: Bridging the Gap from Perception to Persuasion in Advertising Video Understanding via Structured Reasoning

AD-MIR:通过结构化推理弥合从感知到说服的广告视频理解鸿沟

Binxiao Xu, Junyu Feng, Xiaopeng Lin, Haodong Li, Zhiyuan Feng, Bohan Zeng, Shaolin Lu, Ming Lu, Qi She, Wentao Zhang

机构 * Peking University, Beijing, China(北京大学) Tsinghua University, Beijing, China(清华大学) Xi'an Jiaotong University, Xi'an, China(西安交通大学) South China University of Technology, Guangzhou, China(华南理工大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 AD-MIR通过结构化推理框架,结合语义检索与精确关键词匹配,有效解码广告意图,提升广告视频理解的准确性与说服策略分析能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08828 2026-02-10 cs.CV 57%

VideoVeritas: AI-Generated Video Detection via Perception Pretext Reinforcement Learning

VideoVeritas:通过感知预设强化学习实现AI生成视频检测

Hao Tan, Jun Lan, Senyuan Shi, Zichang Tan, Zijian Yu, Huijia Zhu, Weiqiang Wang, Jun Wan, Zhen Lei

机构 * MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS部) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Shenzhen Institute of Advanced Technology (SIAT), Chinese Academy of Sciences(中国科学院深圳先进技术研究所)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 VideoVeritas通过感知预设强化学习提升AI生成视频检测性能,整合细粒度感知与事实推理,采用时空定位和自监督计数提升检测效果。

Comments Project: https://github.com/EricTan7/VideoVeritas

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08706 2026-02-10 cs.HC cs.AI cs.ET 57%

Technosocial risks of ideal emotion recognition technologies: A defense of the (social) value of emotional expressions

理想情感识别技术的科技社会风险:对情感表达(社会)价值的辩护

Alexandra Pregent

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文探讨理想情感识别技术可能带来的科技社会风险,指出其对情感表达的社会功能的误解可能导致社会凝聚力和个体自主性的削弱,主张以功能为导向的监管方法保护社会利益。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏