arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-11-27 至 2025-11-27 共收录 7 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 7 篇

2511.20904 2025-11-27 cs.IR 71%

Generating Querying Code from Text for Multi-Modal Electronic Health Record

从文本生成多模态电子健康记录的查询代码

Mengliang ZHang

专题命中 多模态Agent :multi-modal(title)

AI总结 本文提出TQGen-EHRQuery框架,通过整合表格和文本数据,提升多模态电子健康记录查询的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19900 2025-11-27 cs.CV cs.AI 62%

Agent0-VL: Exploring Self-Evolving Agent for Tool-Integrated Vision-Language Reasoning

Agent0-VL: 探索自我进化代理用于工具集成的视觉-语言推理

Jiaqi Liu, Kaiwen Xiong, Peng Xia, Yiyang Zhou, Haonian Ji, Lu Feng, Siwei Han, Mingyu Ding, Huaxiu Yao

机构 * UNC-Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 Agent0-VL通过工具集成推理实现自我进化,无需人类标注或外部奖励,提升视觉-语言推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21042 2025-11-27 cs.CV 57%

LungNoduleAgent: A Collaborative Multi-Agent System for Precision Diagnosis of Lung Nodules

LungNoduleAgent: 一种用于肺结节精准诊断的协作多智能体系统

Cheng Yang, Hui Jin, Xinlei Yu, Zhipeng Wang, Yaoqun Liu, Fenglei Fan, Dajiang Lei, Gangyong Jia, Changmiao Wang, Ruiquan Ge

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 LungNoduleAgent通过协作多智能体系统提升肺结节诊断的精度与效率

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20766 2025-11-27 cs.AI 57%

OpenApps: Simulating Environment Variations to Measure UI-Agent Reliability

OpenApps: 通过模拟环境变化来衡量UI代理的可靠性

Karen Ullrich, Jingtong Su, Claudia Shi, Arjun Subramonian, Amir Bar, Ivan Evtimov, Nikolaos Tsilivis, Randall Balestriero, Julia Kempe, Mark Ibrahim

机构 * FAIR at Meta(Meta 的 FAIR 研究组) New York University(纽约大学) Brown University(布朗大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 OpenApps通过模拟不同应用程序变化来衡量UI代理的可靠性,发现任务成功率在不同环境中有显著波动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20351 2025-11-27 cs.CV 57%

Thinking in 360°: Humanoid Visual Search in the Wild

全方位思考:野外人形视觉搜索

Heyang Yu, Yinan Han, Xiangyu Zhang, Baiqiao Yin, Bowen Chang, Xiangyu Han, Xinhao Liu, Jing Zhang, Marco Pavone, Chen Feng, Saining Xie, Yiming Li

机构 * NYU(纽约大学) NVIDIA(英伟达) TU Darmstadt(图鲁姆大学) UC Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 多模态Agent :MLLM(abstract);分类 cs.CV

AI总结 本文提出人形视觉搜索方法,通过人形代理在360°全景图像中搜索物体和路径,实验表明现有模型在复杂场景中表现不佳,但通过后训练技术显著提升了性能。

Comments Website: https://humanoid-vstar.github.io/ ; Code: https://github.com/humanoid-vstar/hstar

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07858 2025-11-27 cs.AI cs.LG 57%

Augur: Modeling Covariate Causal Associations in Time Series via Large Language Models

Augur:通过大型语言模型建模时间序列中的协变量因果关联

Zhiqing Cui, Binwu Wang, Qingxiang Liu, Yeqiang Wang, Zhengyang Zhou, Yuxuan Liang, Yang Wang

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 Augur通过大型语言模型建模时间序列中的协变量因果关联,提升预测准确性并实现透明的因果推理。

Comments 24 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21000 2025-11-27 cs.HC 50%

PileUp: A Tufting Approach to Soft, Tactile, and Volumetric E-Textile Interfaces

PileUp:一种基于毛毡的柔软、触觉和体积电子织物接口方法

Seoyoung Choi, Rashmi Balegar Mohan, Heather Jin Hee Kim, Jisoo Ha, Jeyeon Jo

专题命中 多模态Agent :multimodal(abstract)

AI总结 PileUp通过毛毡技术实现柔软、触觉和体积电子织物接口,能够检测压力、弯曲、应变及湿度等,为集成传感织物提供新的制造方法。

Comments Twentieth International Conference on Tangible, Embedded, and Embodied Interaction (TEI '26)

详情

展开后加载摘要…

URL PDF HTML 收藏