arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-27 至 2026-01-27 共收录 11 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 其他多模态 11 篇

2601.18240 2026-01-27 cs.CV 70%

V-Loop: Visual Logical Loop Verification for Hallucination Detection in Medical Visual Question Answering

V-Loop:用于医学视觉问答中幻觉检测的视觉逻辑循环验证

Mengyuan Jin, Zehui Liao, Yong Xia

机构 * Northwestern Polytechnical University(西北工业大学)

专题命中 其他多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 V-Loop通过双向推理和视觉逻辑循环验证,提升医学视觉问答中幻觉检测的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18222 2026-01-27 cs.CV 57%

HomoFM: Deep Homography Estimation with Flow Matching

HomoFM:基于流匹配的深度视角估计

Mengfan He, Liangzheng Sun, Chunyu Li, Ziyang Meng

机构 * Department of Precision Instrument, Tsinghua University(清华大学精密仪器系) School of Instrument Science and Opto-Electronics Engineering, Beijing Information Science and Technology University(北京信息科技大学仪器科学与光电工程学院) School of Aerospace Engineering, Beijing Institute of Technology(北京理工大学航空航天工程学院)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV

AI总结 HomoFM通过引入流匹配技术,首次将生成建模中的速度场学习应用于视角估计,提升估计精度与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18619 2026-01-27 cs.AI 57%

Visual Attention Reasoning via Hierarchical Search and Self-Verification

通过分层搜索与自验证的视觉注意力推理

Wei Cai, Jian Zhao, Yuchen Yuan, Tianle Zhang, Ming Zhu, Haichuan Tang, Xuelong Li

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出通过分层搜索与自验证的视觉注意力推理框架,有效提升多模态大语言模型的视觉定位和推理能力,显著降低幻觉发生率。

Comments The paper is withdrawn by the authors after discovering a flaw in the theoretical derivation presented in the Method section. This incorrect step leads to conclusions that are not supported by the corrected derivation. The authors plan to reconstruct the argument and will release an updated version once the issue is fully resolved

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07137 2026-01-27 cs.LG cs.AI 57%

A Comprehensive Survey of Mixture-of-Experts: Algorithms, Theory, and Applications

混合专家的全面综述:算法、理论与应用

Siyuan Mu, Sen Lin

机构 * University of Houston(德克萨斯大学休斯敦分校) Department of Computer Science, University of Houston(德克萨斯大学休斯敦分校计算机科学系)

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文综述了混合专家模型在算法、理论和应用方面的最新进展,探讨了其在持续学习、元学习等机器学习范式中的设计,并总结了其在计算机视觉和自然语言处理中的应用。

Comments 29 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18193 2026-01-27 cs.HC 50%

InkIdeator: Supporting Chinese-Style Visual Design Ideation via AI-Infused Exploration of Chinese Paintings

InkIdeator: 通过融合AI的中国绘画探索支持中文风格视觉设计构思

Shiwei Wu, Ziyao Gao, Zhendong He, Zongtan He, Zhupeng Huang, Xia Chen, Wei Zeng, Xiaojuan Ma, Zhenhui Peng

专题命中 其他多模态 :multi-modal(abstract)

AI总结 InkIdeator通过融合AI技术,利用多模态大模型分析中国绘画中的文化维度,为中文风格视觉设计提供构思支持,帮助用户高效探索文化符号和可视化想法。

Comments 21 pages, 15 figures, CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17890 2026-01-27 cs.HC 50%

Physiological and Behavioral Modeling of Stress and Cognitive Load in Web-Based Question Answering

基于Web问答的应激与认知负荷的生理与行为建模

Ailin Liu, Francesco Chiossi, Felix Henninger, Lisa Bondo Andersen, Tobias Wistuba, Sonja Greven, Frauke Kreuter, Fiona Draxler

专题命中 其他多模态 :multimodal(abstract)

AI总结 本文通过多模态数据建模,探索基于网络问答的应激与认知负荷的快速检测方法,为更适应的调查界面提供可行性证明。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17676 2026-01-27 cs.HC 50%

GazeSummary: Exploring Gaze as an Implicit Prompt for Personalization in Text-based LLM Tasks

GazeSummary: 探索目光作为隐式提示在基于文本的LLM任务中的个性化应用

Jiexin Ding, Yizhuo Zhang, Xinyun Liu, Ke chen, Yuntao Wang, Shwetak Patel, Akshay Gadre

专题命中 其他多模态 :multimodal(abstract)

AI总结 本文研究了利用用户目光作为隐式提示,通过LLM生成个性化文本摘要的方法,并验证了其在真实阅读任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17440 2026-01-27 cs.RO 50%

PILOT: A Perceptive Integrated Low-level Controller for Loco-manipulation over Unstructured Scenes

PILOT:一种用于非结构化场景中人形机器人类人协作的感知式低层控制器

Xinru Cui, Linxi Feng, Yixuan Zhou, Haoqi Han, Zhe Liu, Hesheng Wang

机构 * School of Automation and Intelligent Sensing(自动化与智能感知学院) Shanghai Jiao Tong University(上海交通大学) Global College(全球学院) school of Computer Science(计算机科学学院) Shanghai Key Laboratory of Navigation and Location Based Services(导航与位置基于服务上海市重点实验室)

专题命中 其他多模态 :cross-modal(abstract)

AI总结 PILOT通过统一的强化学习框架,实现了感知式人形机器人移动与操作的稳定控制,提升了在复杂非结构化环境中的任务执行能力。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17296 2026-01-27 econ.EM 50%

Recovering Counterfactual Distributions via Wasserstein GANs

通过Wasserstein GANs恢复反事实分布

Xinran Liu

专题命中 其他多模态 :multimodal(abstract)

AI总结 本文提出基于Wasserstein GANs的稳健估计方法,用于恢复反事实分布,解决了传统DSC在支持不匹配和多模态结果下的稳定性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20280 2026-01-27 math.DS 50%

Rigidité, expansion et entropie en dynamique non-archimédienne (Rigidity, expansion and entropy in non-Archimedean dynamics)

刚性、扩张与熵在非阿基米德动力学中

Charles Favre, Juan Rivera-Letelier

专题命中 其他多模态 :multimodal(abstract)

AI总结 该研究在非阿基米德动力学中证明了有理映射的刚性性质,表明其拓扑熵为整数对数,并建立了李亚普诺夫指数与野分支位置的关系。

Comments 60 pages, in french. Comments welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17012 2026-01-27 cs.CY cs.HC 50%

The Digital Divide in Geriatric Care: Why Usability, Not Access, is the Real Problem

老龄化护理中的数字鸿沟:为什么是可用性,而不是访问性才是真正的难题

Christine Ine

专题命中 其他多模态 :multimodal(abstract)

AI总结 本研究指出,老年人数字鸿沟的核心问题在于可用性设计,而非访问性,强调以用户为中心的设计改进对提升老年人数字健康采用至关重要。

Comments Page Count - 15 Word Count - 3671

详情

展开后加载摘要…

URL PDF HTML 收藏