arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-29 至 2026-01-29 共收录 3 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 3 篇

2402.14891 2026-01-29 cs.CL cs.AI 73%

LLMBind: A Unified Modality-Task Integration Framework

LLMBind:一种统一的模态-任务整合框架

Bin Zhu, Munan Ning, Peng Jin, Bin Lin, Jinfa Huang, Qi Song, Junwu Zhang, Zhenyu Tang, Mingjun Pan, Li Yuan

机构 * pku(北京大学) pcl(鹏城实验室) hkbu(香港 Baptist大学)

专题命中 音频语音多模态 :multimodal(abstract);multi-modal(abstract);分类 cs.CL、cs.AI

AI总结 LLMBind通过双路径机制和MoE架构,实现多模态任务的统一整合,提升任务扩展性和性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17641 2026-01-29 cs.CL cs.AI cs.LG cs.SD 62%

AuditoryBench++: Can Language Models Understand Auditory Knowledge without Hearing?

AuditoryBench++: 语言模型能否在不听觉的情况下理解听觉知识?

Hyunjong Ok, Suho Yoo, Hyeonjun Kim, Jaeho Lee

机构 * Pohang University of Science and Technology(坡山科学技术大学) HJ AILAB Korea Advanced Institute of Science and Technology(韩国高级科学技术研究院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 AuditoryBench++通过AIR-CoT方法提升语言模型在听觉知识推理中的表现。

Comments ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20402 2026-01-29 cs.HC cs.AI 57%

GuideAI: A Real-time Personalized Learning Solution with Adaptive Interventions

GuideAI: 一种具有自适应干预的实时个性化学习解决方案

Ananya Shukla, Chaitanya Modi, Satvik Bajpai, Siddharth Siddharth

机构 * HTI Lab, Plaksha University(普拉克斯大学HTI实验室)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.AI

AI总结 GuideAI通过整合实时生物反馈和多模态学习策略,提升LLM在个性化学习中的适应性和有效性,显著改善学习效果和认知负荷。

Comments Accepted for publication at the 31st International Conference on Intelligent User Interfaces (IUI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏