arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-25 至 2026-02-25 共收录 4 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 其他多模态 4 篇

2602.20918 2026-02-25 cs.AI cs.CL 81%

Predicting Sentence Acceptability Judgments in Multimodal Contexts

在多模态上下文中预测句子可接受性判断

Hyewon Jang, Nikolai Ilinykh, Sharid Loáiciga, Jey Han Lau, Shalom Lappin

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了在多模态上下文中,视觉上下文对人类和LLM句子可接受性判断的影响,发现LLM在去除视觉上下文时表现更优,且不同模型的判断分布各异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19760 2026-02-25 cs.RO 78%

Skin-Machine Interface with Multimodal Contact Motion Classifier

皮肤-机器接口与多模态接触运动分类器

Alberto Confente, Takanori Jin, Taisuke Kobayashi, Julio Rogelio Guadarrama-Olvera, Gordon Cheng

机构 * Department of Informatics, Technical University of Munich(技术大学慕尼黑信息学院) National Institute of Informatics(国家信息研究所) The Graduate University for Advanced Studies (SOKENDAI)(高级研究大学(SOKENDAI)) Institute for Cognitive Systems (ICS), Technical University of Munich(认知系统研究所(ICS),技术大学慕尼黑)

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 本文提出了一种利用皮肤传感器作为机器人新操作接口的框架,通过多模态接触运动分类器提升机器人任务执行能力。

Comments 8 pages, 8 figures (accepted in Humanoids2025)

Journal ref Humanoids2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21042 2026-02-25 cs.CV 57%

OmniOCR: Generalist OCR for Ethnic Minority Languages

OmniOCR:面向少数民族语言的通用OCR

Bonan Liu, Zeyu Zhang, Bingbing Meng, Han Wang, Hanshuo Zhang, Chengping Wang, Daji Ergu, Ying Cai

机构 * Southwest Minzu University(西南民族大学) AI Geeks

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV

AI总结 OmniOCR通过动态LoRA和稀疏正则化技术,实现了对少数民族语言的高效OCR识别,显著提升了低资源和零样本场景下的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18470 2026-02-25 cs.CY cs.AI 57%

Transforming Science Learning Materials in the Era of Artificial Intelligence

人工智能时代科学学习材料的变革

Xiaoming Zhai, Kent Crippen

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文探讨了人工智能在科学教育中如何变革学习材料,通过六个领域展示AI对个性化教学、互动模拟和多模态内容生成的影响,并强调伦理和教育价值的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏