AutoGPS: Automated Geometry Problem Solving via Multimodal Formalization and Deductive Reasoning
AutoGPS: 通过多模态形式化和演绎推理实现自动几何问题求解
专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI
AI总结 AutoGPS通过多模态形式化和演绎推理解决几何问题,提供可靠且可解释的解决方案
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
AutoGPS: 通过多模态形式化和演绎推理实现自动几何问题求解
专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI
AI总结 AutoGPS通过多模态形式化和演绎推理解决几何问题,提供可靠且可解释的解决方案
增强智能用于乳腺癌多模态虚拟活检的生成式人工智能
机构 * Department of Radiology, Fondazione Policlinico Campus Bio-Medico(放射学系,政策临床医学院) ; Department of Radiology, Università Campus Bio-Medico di Roma(放射学系,罗马生物医学大学) ; Department of Diagnostics and Intervention, Radiation Physics, Biomedical Engineering, Umeå University(诊断与介入系,辐射物理,生物医学工程,乌梅拉大学)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 本文提出基于生成式人工智能的多模态虚拟活检方法,整合FFDM和CESM模态以提高乳腺病变分类准确性,并公开数据集促进研究进展。
RoadscapesQA: 一个用于印度道路视觉问答的多任务、多模态数据集
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV
AI总结 RoadscapesQA数据集通过多任务多模态方法,为印度道路场景的视觉问答提供支持,包含9000张图像及手动标注的边界框,用于提升无结构环境下的视觉场景理解能力。
类平衡多样性多模态集成用于阿尔茨海默病诊断和早期检测
机构 * Unit of Computer Systems and Bioinformatics, Department of Engineering, Università Campus Bio-Medico di Roma(计算机系统与生物信息学单位,工程系,罗马生物医学大学) ; Operative Research Unit of Neurology, Fondazione Policlinico Universitario Campus Bio-Medico(神经学操作研究单位,大学医学研究院生物医学 Campus) ; Eustema S.p.A., Research and Development Centre(Eustema 公司,研发中心) ; Department of Diagnostic and Intervention, Radiation Physics, Biomedical Engineering, Umeå University(诊断与介入部门,辐射物理,生物医学工程,乌梅大学)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV
AI总结 本文提出IMBALMED方法,通过多模态数据和类平衡技术提升阿尔茨海默病的诊断和早期检测性能。
EPRBench: 一种高质量的基于事件流的视觉位置识别基准数据集
机构 * School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院) ; Harbin Institute of Technology(哈尔滨工业大学) ; Peng Cheng Laboratory(鹏城实验室) ; School of Computer Science, Peking University(北京大学计算机科学学院) ; Shenzhen Graduate School, Peking University(北京大学深圳研究生院)
专题命中 多模态评测 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 EPRBench提出了一种高质量的基于事件流的视觉位置识别基准数据集,结合LLM生成场景描述与多模态融合方法,提升位置识别的准确性和模型透明度。
EVA:朝着免疫系统通用模型迈进
专题命中 多模态评测 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.AI
AI总结 EVA是首个跨物种多模态免疫学基础模型,通过整合转录组和组织学数据,提升免疫疾病研究的转化应用能力。
强化学习在视觉推理中提升了什么?一种弗兰肯斯坦式分析
机构 * University of Maryland(马里兰大学) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 本文通过弗兰肯斯坦式分析框架,揭示强化学习在视觉推理中通过中到晚期变压器计算的系统性细化,改进了视觉到推理的对齐和推理性能,而非单纯的视觉感知增强。
AMPS: 通过功能熵实现自适应模态偏好引导
机构 * University of California, San Diego(加州大学圣地亚哥分校) ; Adobe Research(Adobe研究)
专题命中 多模态评测 :multimodal(abstract)
AI总结 AMPS通过实例感知的诊断度量和可学习模块,实现对多模态大语言模型模态偏好的自适应引导,有效调节偏好并降低生成错误率。
GatheringSense: 基于人工智能生成影像与具身体验的文人聚会理解
专题命中 多模态Agent :multimodal(abstract)
AI总结 GatheringSense通过AI生成影像与具身体验相结合,探索文人聚会的文化理解与共鸣,提出双路径框架并提供设计启示。
多模态大语言模型与分层混合专家用于3D脑部MRI的视觉问答
机构 * UCLA Computer Science(UCLA计算机科学系) ; UCSF Radiology(UCSF放射学) ; UCLA Medicine(UCLA医学)
专题命中 多模态训练与对齐 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL
AI总结 本研究提出了一种多模态大语言模型mpLLM,用于3D脑部MRI的视觉问答,通过分层混合专家架构提升肿瘤描述的临床可解释性,并在多个数据集上优于现有基线模型。
Comments 17 pages, 3 figures
通过注意力驱动的自我压缩进行视觉标记减少以提高高效多模态大语言模型的效率
专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 通过注意力驱动的自我压缩方法,有效减少多模态大语言模型中的视觉标记,提升计算效率并保持模型性能。
Comments 2025 IEEE International Conference on Big Data (BigData)
探究多模态大语言模型中多个视觉编码器的冗余性
专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 本文研究了多模态大语言模型中多个视觉编码器的冗余性,通过分析发现编码器的专业化、冗余性和有害性,并提出了量化冗余的指标,为更高效的多模态架构设计提供依据。
Comments accepted by ICLR2026, project website: https://github.com/MaoSong2022/Encoder-Redundancy
时机至关重要:在多模态医学影像中寻找最佳融合点
机构 * Department of Diagnostics and Intervention, Biomedical Engineering and Radiation Physics, Umeå University(诊断与介入系,生物医学工程与放射物理,乌梅大学)
专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 本文提出一种顺序前进搜索算法,用于高效确定多模态医学影像中最佳融合时机,提升诊断准确性并减少计算开销。
CATP:用于保持准确性的多模态模型推理中的交叉注意力标记修剪
专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL、cs.AI
AI总结 CATP通过交叉注意力层优化标记修剪,显著提升多模态模型推理的准确性与效率。
多模态协调在线行为:权衡与策略
机构 * University of Pisa(比萨大学) ; Institute for Informatics and Telematics, National Research Council (IIT-CNR)(信息学与电信学研究院,国家研究理事会(IIT-CNR)) ; InfoLab, Department of Information Technology, Uppsala University(信息实验室,信息科技系,乌普萨拉大学)
专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI
AI总结 本研究探讨多模态协调在线行为的权衡与策略,通过比较不同方法揭示多模态分析在捕捉协调行为结构方面的优势。
Comments Postprint of the article published in the Information Sciences journal. Please, cite accordingly
强化注意力学习
机构 * UC Davis(加州大学戴维斯分校) ; Google(谷歌) ; DeepMind(深Mind) ; Google DeepMind(谷歌DeepMind) ; Princeton University(普林斯顿大学)
专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL
AI总结 强化注意力学习通过优化内部注意力分布提升多模态模型的感知能力,实验显示其在多模态后期训练中优于现有方法。
基于病理学和空间转录组的原型驱动融合用于可解释的生存预测
机构 * Department of Biostatistics, MD Anderson Cancer Center(生物统计学系,MD安德森癌症中心) ; Department of Translational Molecular Pathology, MD Anderson Cancer Center(转化分子病理学系,MD安德森癌症中心) ; The Institute for Data Science in Oncology (IDSO), MD Anderson Cancer Center(肿瘤学数据科学研究所(IDSO),MD安德森癌症中心)
专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 PathoSpatial通过整合病理学和空间转录组数据,实现可解释的生存预测,提升多模态学习的可解释性和有效性。
Easy-Poly: 一种易于使用的多目标跟踪三维多目标跟踪框架
机构 * East China Normal University(东华师范大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV
AI总结 Easy-Poly提出了一种基于过滤的三维多目标跟踪框架,通过四个创新方法提升小目标检测和跟踪精度,实现实时高性能表现。
Comments 8 pages, 4 figures, 6 tables
CRAFT: 通过力感知的课程微调适应接触密集的操纵
机构 * National Engineering Research Center of Robot Visual Perception and Control Technology, Hunan University(机器人视觉感知与控制技术国家工程研究中心,湖南大学) ; Beijing Innovation Center of Humanoid Robotics(人形机器人创新中心) ; Department of Electrical and Computer Engineering, National University of Singapore(新加坡国立大学电气与计算机工程系)
专题命中 多模态训练与对齐 :multimodal(abstract)
AI总结 CRAFT通过力感知课程微调提升机器人在接触密集任务中的表现,实现稳健且可推广的操纵能力。
探索人工智能增强的患者生成健康数据理解:一项结合定性与定量方法的医疗专业人员研究,用于心脏风险降低
机构 * Ludwig Boltzmann Institute for Digital Health and Prevention(数字健康与预防路德维希·玻尔兹曼研究所)
专题命中 其他多模态 :multimodal(abstract);分类 cs.AI
AI总结 本文探讨了大型语言模型如何通过自动摘要和对话界面支持医疗专业人员理解患者生成的健康数据,以提高心脏疾病风险降低的临床决策。
变分推断中的退火缓解模式崩溃:关于高斯混合物的理论研究
机构 * Departement d’Informatique, École Normale Supérieure, Université PSL, CNRS(信息学院,巴黎高等师范学院,巴黎理工大学,CNRS) ; Laboratoire de Physique de l’École Normale Supérieure, Université PSL, CNRS(巴黎高等师范学院物理实验室,巴黎理工大学,CNRS)
专题命中 其他多模态 :multimodal(abstract)
AI总结 本文通过理论分析证明退火策略能有效缓解变分推断中的模式崩溃问题,并验证其在神经网络模型中的适用性。