Generating Querying Code from Text for Multi-Modal Electronic Health Record
从文本生成多模态电子健康记录的查询代码
专题命中 多模态Agent :multi-modal(title)
AI总结 本文提出TQGen-EHRQuery框架,通过整合表格和文本数据,提升多模态电子健康记录查询的准确性和效率。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
从文本生成多模态电子健康记录的查询代码
专题命中 多模态Agent :multi-modal(title)
AI总结 本文提出TQGen-EHRQuery框架,通过整合表格和文本数据,提升多模态电子健康记录查询的准确性和效率。
Agent0-VL: 探索自我进化代理用于工具集成的视觉-语言推理
机构 * UNC-Chapel Hill(北卡罗来纳大学教堂山分校)
专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 Agent0-VL通过工具集成推理实现自我进化,无需人类标注或外部奖励,提升视觉-语言推理能力。
LungNoduleAgent: 一种用于肺结节精准诊断的协作多智能体系统
专题命中 多模态Agent :multimodal(abstract);分类 cs.CV
AI总结 LungNoduleAgent通过协作多智能体系统提升肺结节诊断的精度与效率
Comments Accepted by AAAI 2026
OpenApps: 通过模拟环境变化来衡量UI代理的可靠性
机构 * FAIR at Meta(Meta 的 FAIR 研究组) ; New York University(纽约大学) ; Brown University(布朗大学)
专题命中 多模态Agent :multimodal(abstract);分类 cs.AI
AI总结 OpenApps通过模拟不同应用程序变化来衡量UI代理的可靠性,发现任务成功率在不同环境中有显著波动。
全方位思考:野外人形视觉搜索
机构 * NYU(纽约大学) ; NVIDIA(英伟达) ; TU Darmstadt(图鲁姆大学) ; UC Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学)
专题命中 多模态Agent :MLLM(abstract);分类 cs.CV
AI总结 本文提出人形视觉搜索方法,通过人形代理在360°全景图像中搜索物体和路径,实验表明现有模型在复杂场景中表现不佳,但通过后训练技术显著提升了性能。
Comments Website: https://humanoid-vstar.github.io/ ; Code: https://github.com/humanoid-vstar/hstar
Augur:通过大型语言模型建模时间序列中的协变量因果关联
专题命中 多模态Agent :multimodal(abstract);分类 cs.AI
AI总结 Augur通过大型语言模型建模时间序列中的协变量因果关联,提升预测准确性并实现透明的因果推理。
Comments 24 pages, 9 figures
PileUp:一种基于毛毡的柔软、触觉和体积电子织物接口方法
专题命中 多模态Agent :multimodal(abstract)
AI总结 PileUp通过毛毡技术实现柔软、触觉和体积电子织物接口,能够检测压力、弯曲、应变及湿度等,为集成传感织物提供新的制造方法。
Comments Twentieth International Conference on Tangible, Embedded, and Embodied Interaction (TEI '26)