arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-05 至 2025-12-05 共收录 43 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4 篇

2503.05255 2025-12-05 cs.CV 85%

CMMCoT: Enhancing Complex Multi-Image Comprehension via Multi-Modal Chain-of-Thought and Memory Augmentation

CMMCoT:通过多模态链式思考和记忆增强提升复杂多图像理解

Guanghao Zhang, Tao Zhong, Yan Xia, Mushui Liu, Zhelun Yu, Haoyuan Li, Wanggui He, Fangxun Shu, Dong She, Yi Wang, Hao Jiang

专题命中 图文多模态 :multi-modal(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 CMMCoT通过多模态链式思考和记忆增强提升多图像理解的复杂性与准确性

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04895 2025-12-05 cs.AI cs.MA 79%

Chameleon: Adaptive Adversarial Agents for Scaling-Based Visual Prompt Injection in Multimodal AI Systems

Chameleon:基于尺度的视觉提示注入的自适应对抗代理

M Zeeshan, Saud Satti

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 Chameleon是一种自适应对抗框架,通过动态优化图像扰动来暴露和利用多模态AI系统中的缩放漏洞,显著提高攻击成功率并影响决策准确性。

Comments 5 pages, 2 figures, IEEE Transactions on Dependable and Secure Computing

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04763 2025-12-05 cs.LG cs.CL cs.CV 62%

MemLoRA: Distilling Expert Adapters for On-Device Memory Systems

MemLoRA: 通过专家适配器实现设备端记忆系统

Massimo Bini, Ondrej Bohdal, Umberto Michieli, Zeynep Akata, Mete Ozay, Taha Ceritli

机构 * Samsung R&D Institute UK(三星英国研发中心) Technical University of Munich(慕尼黑技术大学) Helmholtz Munich(慕尼黑海德堡研究所)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 MemLoRA通过为小型语言模型添加专用记忆适配器,实现设备端记忆系统的本地部署,并扩展至视觉理解任务,提升多模态场景下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04309 2025-12-05 cs.CV cs.CL 62%

Text-Only Training for Image Captioning with Retrieval Augmentation and Modality Gap Correction

仅文本训练的图像描述生成:结合检索增强与模态差距校正

Rui Fonseca, Bruno Martins, Gil Rocha

机构 * INESC-ID, Instituto Superior Tecnico, University of Lisbon(INESC-ID,理工学院,里斯本大学)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL

AI总结 TOMCap通过检索增强和模态差距校正,实现无需对齐图像-文本对的纯文本训练图像描述生成。

Comments Submitted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 2 篇

2512.04720 2025-12-05 cs.SD 82%

M3-TTS: Multi-modal DiT Alignment & Mel-latent for Zero-shot High-fidelity Speech Synthesis

M3-TTS: 多模态DiT对齐与梅尔-潜在空间用于零样本高质量语音合成

Xiaopeng Wang, Chunyu Qiang, Ruibo Fu, Zhengqi Wen, Xuefei Liu, Yukun Liu, Yuzhe Liang, Kang Yin, Yuankun Xie, Heng Xie, Chenxing Li, Chen Zhang, Changsheng Li

机构 * Beijing Institute of Technology(北京理工大学) Kuaishou Technology(快手科技) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 音频语音多模态 :multi-modal(title,abstract);cross-modal(abstract)

AI总结 M3-TTS通过多模态扩散变换器实现零样本高质量语音合成,采用联合扩散层和梅尔-变体编码器,实现高效且自然的语音生成。

Comments Submitted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04814 2025-12-05 cs.SD cs.CV 74%

Shared Multi-modal Embedding Space for Face-Voice Association

用于人脸-语音关联的共享多模态嵌入空间

Christopher Simic, Korbinian Riedhammer, Tobias Bocklet

专题命中 音频语音多模态 :multi-modal(title);分类 cs.CV

AI总结 本文提出了一种基于共享多模态嵌入空间的人脸-语音关联方法,通过自适应角边距损失实现跨语言的高效识别

Comments Ranked 1st in Fame 2026 Challenge, ICASSP

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 4 篇

2512.04356 2025-12-05 cs.CV cs.AI cs.CL cs.LG 85%

Mitigating Object and Action Hallucinations in Multimodal LLMs via Self-Augmented Contrastive Alignment

通过自增强对比对齐缓解多模态大语言模型中的对象和动作幻觉

Kai-Po Chang, Wei-Yuan Cheng, Chi-Pin Huang, Fu-En Yang, Yu-Chiang Frank Wang

机构 * Graduate Institute of Communication Engineering, National Taiwan University(国家交通大学通信工程研究所) NVIDIA

专题命中 视频多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 SANTA框架通过自增强对比对齐方法,有效缓解多模态大语言模型中的对象和动作幻觉问题。

Comments IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) 2026. Project page: https://kpc0810.github.io/santa/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21908 2025-12-05 cs.LG 82%

Multi-Modal Machine Learning for Early Trust Prediction in Human-AI Interaction Using Face Image and GSR Bio Signals

多模态机器学习在人机交互中早期信任预测中的应用:利用面部图像和GSR生物信号

Hamid Shamszare, Avishek Choudhury

专题命中 视频多模态 :multi-modal(title,abstract);multimodal(abstract)

AI总结 本研究提出多模态机器学习框架,结合面部图像和GSR生物信号,用于预测人机交互中AI或人类推荐的早期信任,通过多模态堆叠集成提升预测性能。

Comments This version contains errors in content presentation and arrangement, so it is being withdrawn until a corrected version is generated

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23400 2025-12-05 astro-ph.IM astro-ph.SR 67%

Solar flare forecasting with foundational transformer models across image, video, and time-series modalities

基于基础Transformer模型的太阳耀斑预测:跨图像、视频和时间序列模态

S. Riggi, P. Romano, A. Pilzer, U. Becciani

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract)

AI总结 本文通过比较三种基础Transformer模型在太阳耀斑预测中的表现,发现Moirai2在时间序列预测中表现最佳,展示了预训练模型在多模态空间天气预测中的潜力。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04532 2025-12-05 cs.CV cs.AI 62%

PhyVLLM: Physics-Guided Video Language Model with Motion-Appearance Disentanglement

PhyVLLM:具有运动-外观解耦的物理引导视频语言模型

Yu-Wei Zhan, Xin Wang, Hong Chen, Tongtong Feng, Wei Feng, Ren Wang, Guangyao Li, Qing Li, Wenwu Zhu

机构 * Department of Computer Science and Technology, Tsinghua University(计算机科学与技术系,清华大学) Department of Electronic Engineering, Tsinghua University(电子工程系,清华大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 PhyVLLM通过引入物理运动建模和运动-外观解耦,提升视频语言模型在物理推理和视频理解任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 1 篇

2512.04522 2025-12-05 cs.CV 57%

Identity Clue Refinement and Enhancement for Visible-Infrared Person Re-Identification

身份线索细化与增强用于可见-红外人再识别

Guoqing Zhang, Zhun Wang, Hairui Wang, Zhonglin Ye, Yuhui Zheng

机构 * School of Computer Science, Nanjing University of Information Science and Technology(南京信息工程大学计算机学院) Key Laboratory of Social Computing and Cognitive Intelligence (Dalian University of Technology), Ministry of Education(社会计算与认知智能重点实验室(大连理工大学)) State Key Laboratory of Tibetan Intelligent Information Processing and Application, Qinghai Normal University(藏语智能信息处理与应用国家重点实验室(青海师范大学))

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出ICRE网络,通过细化和增强身份线索来提升可见-红外人再识别的性能。

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 6 篇

2512.04222 2025-12-05 cs.CV 83%

ReasonX: MLLM-Guided Intrinsic Image Decomposition

ReasonX: 基于多模态大语言模型的内在图像分解

Alara Dirik, Tuanfeng Wang, Duygu Ceylan, Stefanos Zafeiriou, Anna Frühstück

机构 * Imperial College London(伦敦帝国学院) Adobe Research(Adobe研究院)

专题命中 多模态生成 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 ReasonX通过多模态大语言模型提供相对比较监督,提升内在图像分解的泛化能力与精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19051 2025-12-05 cs.CV cs.AI cs.MM 82%

Multimodal Markup Document Models for Graphic Design Completion

多模态标记文档模型用于图形设计完成

Kotaro Kikuchi, Ukyo Honda, Naoto Inoue, Mayu Otani, Edgar Simo-Serra, Kota Yamaguchi

机构 * Waseda University(早稻田大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 MarkupDM是一种多模态标记文档模型,通过统一处理图形设计任务,实现文本、图像和属性值的完成,展示了其在设计自动化中的广泛适用性。

Comments Accepted by ACM Multimedia 2025, Project page: https://cyberagentailab.github.io/MarkupDM/

Journal ref Proceedings of the 33rd ACM International Conference on Multimedia. 2025. p.11022-11031

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05112 2025-12-05 cs.CV cs.AI cs.CL cs.LG 67%

DraCo: Draft as CoT for Text-to-Image Preview and Rare Concept Generation

DraCo: 文本到图像预览与稀有概念生成的草稿作为CoT

Dongzhi Jiang, Renrui Zhang, Haodong Li, Zhuofan Zong, Ziyu Guo, Jun He, Claire Guo, Junyan Ye, Rongyao Fang, Weijia Li, Rui Liu, Hongsheng Li

机构 * CUHK MMLab(香港中文大学 MMLab) CUHK IMIXR(香港中文大学 IMIXR) Sun Yat-Sen University(中山大学) SCUT(华南理工大学) CUHK (Shenzhen)(香港中文大学(深圳))

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 DraCo通过结合文本和视觉内容的交错推理,提升文本到图像生成的精度和稀有概念生成能力。

Comments Project Page: https://github.com/CaraJ7/DraCo

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04087 2025-12-05 q-bio.NC cs.CL cs.CV cs.CY cs.HC 62%

Human-Centred Evaluation of Text-to-Image Generation Models for Self-expression of Mental Distress: A Dataset Based on GPT-4o

以人为中心评估文本到图像生成模型以表达心理压力:基于GPT-4o的数据库

Sui He, Shenbin Qian

机构 * School of Culture and Communication, Swansea University(文化与沟通学院,萨里大学) Department of Informatics, University of Oslo(信息学院,奥斯陆大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.CL

AI总结 本研究基于GPT-4o构建首个公开的文本到图像评估数据集,评估AI生成图像在心理健康自我表达中的有效性,发现角色提示设计显著影响用户评分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04857 2025-12-05 cs.CV 57%

Autoregressive Image Generation Needs Only a Few Lines of Cached Tokens

自回归图像生成只需少量缓存的token

Ziran Qin, Youru Lv, Mingbao Lin, Zeren Zhang, Chanfan Gan, Tieyuan Chen, Weiyao Lin

机构 * Shanghai Jiao Tong University(上海交通大学) Rakuten Peking University(北京大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 LineAR通过行级缓存压缩技术,在自回归图像生成中实现内存节省和吞吐量提升,同时保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23002 2025-12-05 cs.CV 57%

JarvisEvo: Towards a Self-Evolving Photo Editing Agent with Synergistic Editor-Evaluator Optimization

JarvisEvo: 向自进化式照片编辑代理迈进:协同编辑器-评估器优化

Yunlong Lin, Linqing Wang, Kunjie Lin, Zixu Lin, Kaixiong Gong, Wenbo Li, Bin Lin, Zhenxi Li, Shiyi Zhang, Yuyang Peng, Wenxun Dai, Xinghao Ding, Chunyu Wang, Qinglin Lu

机构 * Tencent Hunyuan(腾讯文元)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 JarvisEvo通过协同编辑器-评估器优化,实现自进化式照片编辑代理,提升编辑质量和内容保真度。

Comments 31 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态评测 13 篇

2512.03783 2025-12-05 cs.AI cs.SD 83%

Omni-AutoThink: Adaptive Multimodal Reasoning via Reinforcement Learning

Omni-AutoThink: 通过强化学习实现自适应多模态推理

Dongchao Yang, Songxiang Liu, Disong Wang, Yuanyuan Wang, Guanglu Wan, Helen Meng

机构 * The Chinese University of Hong Kong(香港中文大学) Meituan(美团)

专题命中 多模态评测 :multimodal(title,abstract);audio-visual(abstract);分类 cs.AI

AI总结 Omni-AutoThink通过强化学习实现自适应多模态推理,提升模型在不同任务难度下的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.17773 2025-12-05 cs.CV cs.AI cs.CL cs.LG 82%

KiVA: Kid-inspired Visual Analogies for Testing Large Multimodal Models

KiVA:儿童启发的视觉类比用于测试大多模态模型

Eunice Yiu, Maan Qraitem, Anisa Noor Majhi, Charlie Wong, Yutong Bai, Shiry Ginosar, Alison Gopnik, Kate Saenko

机构 * University of California, Berkeley(加州大学伯克利分校) Boston University(波士顿大学) Google DeepMind(谷歌DeepMind) Toyota Technological Institute at Chicago(芝加哥丰田技术研究所)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 KiVA通过4300个日常物体视觉转换测试大模型的类比推理能力,发现儿童和成人表现优于现有模型,尤其在复杂任务上存在显著差距。

Comments 10 pages. Project website: https://ey242.github.io/kiva.github.io/. Benchmark and code: https://github.com/ey242/KiVA

Journal ref The Thirteenth International Conference on Learning Representations (ICLR), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01424 2025-12-05 cs.CV 79%

ViRectify: A Challenging Benchmark for Video Reasoning Correction with Multimodal Large Language Models

ViRectify:一种用于多模态大语言模型视频推理纠错的挑战性基准

Xusen Hei, Jiali Chen, Jinyu Yang, Mengchen Zhao, Yi Cai

机构 * South China University of Technology(华南理工大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 ViRectify是一个用于评估多模态大语言模型视频推理纠错能力的挑战性基准,通过构建大规模数据集和提出轨迹证据驱动的纠正框架,验证了模型在纠错任务中的性能差异。

Comments 22 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09321 2025-12-05 cs.CV cs.AI cs.LG 73%

DAVE: Diagnostic benchmark for Audio Visual Evaluation

DAVE: 音频视觉评估诊断基准

Gorjan Radevski, Teodora Popordanoska, Matthew B. Blaschko, Tinne Tuytelaars

机构 * KU Leuven(卢森堡大学)

专题命中 多模态评测 :multi-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.AI

AI总结 DAVE提出一个诊断基准,通过确保两种模态必要性及分解评估子类,解决多模态模型评估中的视觉偏见问题,提供更精准的模型诊断与改进指导。

Comments First two authors contributed equally

Journal ref NeurIPS 2025 Datasets & Benchmarks

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09080 2025-12-05 cs.AI 70%

BioAnalyst: A Foundation Model for Biodiversity

BioAnalyst: 一种用于生物多样性的基础模型

Athanasios Trantas, Martino Mensio, Stylianos Stasinos, Sebastian Gribincea, Taimur Khan, Damian Podareanu, Aliene van der Veen

机构 * Nederlandse Organisatie voor Toegepast Natuurwetenschappelijk Onderzoek – TNO(荷兰应用自然科学研究院 – TNO) Eindhoven University of Technology(埃因霍温理工大学) Amazon(亚马逊) University of Groningen(格罗宁根大学) Helmholtz Center for Environmental Research – UFZ(环境研究赫尔姆霍茨中心 – UFZ) SURF

专题命中 多模态评测 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.AI

AI总结 BioAnalyst是一种针对生物多样性分析和保护规划的多模态基础模型,通过预训练和微调实现物种分布建模和生态预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05091 2025-12-05 cs.CV 57%

Visual Reasoning Tracer: Object-Level Grounded Reasoning Benchmark

视觉推理追踪器:对象级 grounded 推理基准

Haobo Yuan, Yueyi Sun, Yanwei Li, Tao Zhang, Xueqing Deng, Henghui Ding, Lu Qi, Anran Wang, Xiangtai Li, Ming-Hsuan Yang

机构 * UC Merced(加州大学默塞德分校) PKU(北京大学) NTU(国立台湾大学) CUHK(香港中文大学) WHU(武汉大学) FDU(福建大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出视觉推理追踪器任务,通过对象级 grounded 推理基准评估模型的推理路径生成能力,并引入了新的评估指标和大规模数据集提升模型推理表现。

Comments Technical Report; Project Page: https://harboryuan.github.io/visual-reasoning-tracer

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04660 2025-12-05 cs.CV 57%

I2I-Bench: A Comprehensive Benchmark Suite for Image-to-Image Editing Models

I2I-Bench: 一种全面的图像到图像编辑模型评估套件

Juntong Wang, Jiarui Wang, Huiyu Duan, Jiaxiang Kang, Guangtao Zhai, Xiongkuo Min

机构 * Institute of Image Communication and Network Engineering(图像通信与网络工程研究所) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 I2I-Bench 提出了一种全面的图像到图像编辑模型评估套件,通过多样化的任务、全面的评估维度和严格的对齐验证,评估主流图像编辑模型的性能和权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04105 2025-12-05 cs.CY cs.AI cs.HC 57%

LegalWebAgent: Empowering Access to Justice via LLM-Based Web Agents

LegalWebAgent:通过基于大语言模型的网络代理赋能正义获取

Jinzhe Tan, Karim Benyekhlef

机构 * Cyberjustice Laboratory, Faculty of Law, University of Montreal, Canada(法律正义实验室,法学院,蒙特利尔大学,加拿大)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 LegalWebAgent通过多模态大语言模型实现网络代理,解决普通公民在法律问题中的获取障碍,实现从查询到行动的全流程自动化,实验结果显示其在复杂场景中的高自主性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04479 2025-12-05 cs.CL 57%

ThaiOCRBench: A Task-Diverse Benchmark for Vision-Language Understanding in Thai

ThaiOCRBench: 一种任务多样化的泰语视觉-语言理解基准

Surapon Nonesung, Teetouch Jaknamon, Sirinya Chaiophat, Natapong Nitarach, Chanakan Wittayasakpan, Warit Sirichotedumrong, Adisai Na-Thalang, Kunat Pipatanakul

机构 * SCB 10X R&D(SCB 10X研发部) SCB 10X SCBX Group(SCBX集团)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 ThaiOCRBench是一个针对泰语视觉-语言理解任务的多样化基准,通过人工标注的数据集评估了多种VLMs,揭示了专有模型在性能上的优势及开源模型在细粒度文本识别中的挑战。

Comments Accepted at IJCNLP-AACL 2025 (Main). This version includes the corrected Table 2 and an updated conclusion regarding the deletion count of the Gemma model

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04125 2025-12-05 cs.LG 56%

ASCIIBench: Evaluating Language-Model-Based Understanding of Visually-Oriented Text

ASCIIBench: 评估基于语言模型的视觉文本理解

Kerry Luo, Michael Fu, Joshua Peguero, Husnain Malik, Anvay Patil, Joyce Lin, Megan Van Overborg, Ryan Sarmiento, Kevin Zhu

机构 * Algoverse AI Research(Algoverse AI研究院)

专题命中 多模态评测 :multimodal(abstract,comments)

AI总结 ASCIIBench通过评估LLM生成ASCII艺术的性能,揭示了多模态表示的局限性,并推动了针对符号视觉模态的新方法发展。

Comments Accepted to The Thirty-Ninth Annual Conference on Neural Information Processing Systems (NeurIPS 2025): LLM Evaluation Workshop & Multimodal Algorithmic Reasoning Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05080 2025-12-05 cs.LG 50%

OMTRA: A Multi-Task Generative Model for Structure-Based Drug Design

OMTRA: 一种基于结构的药物设计多任务生成模型

Ian Dunn, Liv Toft, Tyler Katz, Juhi Gupta, Riya Shah, Ramith Hettiarachchi, David R. Koes

机构 * Department of Computational and Systems Biology, School of Medicine, University of Pittsburgh(计算生物学系,医学院,匹兹堡大学) Ray and Stephanie Lane Computational Biology Department, School of Computer Science, Carnegie Mellon University(Ray和Stephanie Lane计算生物学系,计算机科学学院,卡内基梅隆大学)

专题命中 多模态评测 :multi-modal(abstract)

AI总结 OMTRA是一种多任务生成模型,用于基于结构的药物设计,通过多模态流匹配模型实现多种相关任务的统一框架,提升了从头设计和对接性能。

Comments Presented at the Machine Learning for Structural Biology Workshop, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21584 2025-12-05 stat.ML cs.LG 50%

IndiSeek learns information-guided disentangled representations

IndiSeek 学习信息引导的解耦表示

Yu Gui, Cong Ma, Zongming Ma

机构 * Department of Statistics and Data Science, University of Pennsylvania(宾夕法尼亚大学统计与数据科学系) Department of Statistics, University of Chicago(芝加哥大学统计系) Department of Statistics and Data Science, Yale University(耶鲁大学统计与数据科学系)

专题命中 多模态评测 :multi-modal(abstract)

AI总结 IndiSeek通过结合独立性强制目标和高效重建损失,有效学习信息引导的解耦表示,提升多模态学习性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16702 2025-12-05 cs.HC 50%

Truth and Trust: Fake News Detection via Biosignals

真实与信任:通过生物信号进行假新闻检测

Gennie Nguyen, Lei Wang, Yangxueqing Jiang, Tom Gedeon

专题命中 多模态评测 :multimodal(abstract)

AI总结 本研究通过分析EDA和PPG信号,探讨了生物信号在假新闻检测中的应用,发现EDA在检测真实性方面表现更优,但联合信念与真实性的分类任务面临挑战。

Comments Research report

Journal ref International Journal of Information Technology (BJIT), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏