arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-28 至 2026-01-28 共收录 8 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 8 篇

2601.19839 2026-01-28 cs.RO cs.AI cs.HC 79%

HARMONI: Multimodal Personalization of Multi-User Human-Robot Interactions with LLMs

HARMONI: 基于大语言模型的多用户人机交互多模态个性化

Jeanne Malécot, Hamed Rahimi, Jeanne Cattoni, Marie Samson, Mouad Abrini, Mahdi Khoramshahi, Maribel Pino, Mohamed Chetouani

机构 * Institut Curie, Université Paris-Saclay(巴黎-萨克勒大学Curie研究所) Institute of Intelligent Systems and Robotics (ISIR), Sorbonne University(索邦大学智能系统与机器人研究所) Assistance Publique – Hôpitaux de Paris (AP-HP), Université Paris Cité(巴黎公共医院(AP-HP)与巴黎城市大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 HARMONI通过多模态个性化框架,利用大语言模型提升多用户人机交互的持续个性化和动态适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19834 2026-01-28 cs.AI 79%

Visual Generation Unlocks Human-Like Reasoning through Multimodal World Models

视觉生成通过多模态世界模型解锁类人推理

Jialong Wu, Xiaoying Zhang, Hongyi Yuan, Xiangcheng Zhang, Tianhao Huang, Changjing He, Chaoyi Deng, Renrui Zhang, Youbin Wu, Mingsheng Long

机构 * Tsinghua University(清华大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出视觉生成在特定任务中优于纯语言推理,通过构建VisWorld-Eval评估套件验证了多模态世界模型提升类人推理的能力。

Comments Project page: https://thuml.github.io/Reasoning-Visual-World

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19228 2026-01-28 cs.CV 70%

Towards Pixel-Level VLM Perception via Simple Points Prediction

通过简单的点预测实现像素级VLM感知

Tianhui Song, Haoyu Lu, Hao Yang, Lin Sui, Haoning Wu, Zaida Zhou, Zhiqi Huang, Yiping Bao, Y. Charles, Xinyu Zhou, Limin Wang

专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 SimpleSeg通过简单点预测实现多模态大语言模型的像素级感知,无需复杂架构即可获得高精度分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19613 2026-01-28 cs.CL cs.AI 62%

Up to 36x Speedup: Mask-based Parallel Inference Paradigm for Key Information Extraction in MLLMs

最高36倍提速:面向MLLMs关键信息提取的基于掩码的并行推断范式

Xinzhong Wang, Ya Guo, Jing Li, Huan Chen, Yi Tu, Yijie Hong, Gongshen Liu, Huijia Zhu

机构 * Shanghai Jiao Tong University(上海交通大学) Ant Info Security Lab, Ant Group(蚂蚁集团信息安全部实验室) Inner Mongolia Research Institute, Shanghai Jiao Tong University(内蒙古研究院,上海交通大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于掩码的并行推断范式,通过并行生成提升MLLMs关键信息提取的效率,实现最高36倍的提速。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12529 2026-01-28 cs.HC cs.AI cs.CL 62%

Accepted with Minor Revisions: Value of AI-Assisted Scientific Writing

接受修改后:人工智能辅助科学写作的价值

Sanchaita Hazra, Doeun Lee, Bodhisattwa Prasad Majumder, Sachin Kumar

机构 * The University of Utah(犹他大学) The Ohio State University(俄亥俄州立大学) Allen Institute for AI(人工智能研究院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了AI辅助科学写作的有效性,发现AI生成摘要在披露来源信息后可达到与人工摘要相当的可接受性,且作者编辑行为受对AI作者身份的感知驱动。

Comments Published in ACM IUI 2026 (Paphos, Cyprus)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19484 2026-01-28 cs.CV 57%

Dynamic Worlds, Dynamic Humans: Generating Virtual Human-Scene Interaction Motion in Dynamic Scenes

动态世界,动态人类:生成动态场景中的虚拟人类-场景交互动作

Yin Wang, Zhiying Leng, Haitian Liu, Frederick W. B. Li, Mu Li, Xiaohui Liang

机构 * Beihang University(北航大学) University of Durham(达勒姆大学) State Key Laboratory of Virtual Reality Technology and Systems(虚拟现实技术与系统国家重点实验室) Zhongguancun Laboratory(中关村实验室)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出Dyn-HSI架构,通过动态视觉导航、分层经验记忆和人-场景交互扩散模型,生成高质量的动态场景中人-场景交互动作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18997 2026-01-28 cs.CV cs.LG 57%

Anatomically-aware conformal prediction for medical image segmentation with random walks

解剖学感知的符合预测用于带有随机游走的医学图像分割

Mélanie Gaillochet, Christian Desrosiers, Hervé Lombaert

机构 * École de Technologie Supérieure Mila - Quebec AI Institute Polytechnique Montréal

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出RW-CP方法,通过随机游走扩散不确定性,提升医学图像分割的解剖学一致性与预测稳定性。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19504 2026-01-28 q-fin.CP 50%

Generating Alpha: A Hybrid AI-Driven Trading System Integrating Technical Analysis, Machine Learning and Financial Sentiment for Regime-Adaptive Equity Strategies

生成Alpha:一种融合技术分析、机器学习和金融情绪的混合AI驱动交易系统,用于适应性股票策略

Varun Narayan Kannan Pillai, Akshay Ajith, Sumesh K J

专题命中 多模态生成 :multi-modal(abstract)

AI总结 本文提出一种融合技术分析、机器学习和金融情绪的混合AI交易系统,通过多模态AI实现适应性股票策略,取得135.49%的回报率。

Comments Preprint. Full version of an accepted conference paper (ComSIA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏