VibraVerse: A Large-Scale Geometry-Acoustics Alignment Dataset for Physically-Consistent Multimodal Learning
VibraVerse: 一个大规模的几何-声学对齐数据集,用于物理一致的多模态学习
机构 * Peking University(北京大学)
AI总结 VibraVerse通过构建几何-声学对齐数据集,实现了物理一致的多模态学习,支持几何到声音预测、声音引导的形状重建等任务。
高校专区
VibraVerse: 一个大规模的几何-声学对齐数据集,用于物理一致的多模态学习
机构 * Peking University(北京大学)
AI总结 VibraVerse通过构建几何-声学对齐数据集,实现了物理一致的多模态学习,支持几何到声音预测、声音引导的形状重建等任务。
用于自动化3D PET/CT报告生成的视觉-语言模型
机构 * Institute of Medical Technology and National Biomedical Imaging Center, Peking University(北京大学医学技术研究院和国家生物医学成像中心) ; Peking University People’s Hospital(北京大学人民医院) ; Peking University Third Hospital(北京大学第三医院) ; DAMO Academy, Alibaba Group(阿里巴巴集团达摩院) ; The Affiliated Hospital of Qingdao University(青岛大学附属医院) ; The First Affiliated Hospital of Henan Medical University(河南医科大学第一附属医院) ; Jiujiang City Key Laboratory of Cell Therapy, Jiu Jiang NO.1 People’s Hospital(九江市细胞治疗重点实验室,九江市第一人民医院)
AI总结 本文提出PETRG-3D模型,通过3D双分支框架和风格适应提示,提升PET/CT报告生成的自动化水平,实验显示其在自然语言和临床指标上均优于现有方法。
EHR-R1: 一种增强推理能力的基础语言模型用于电子健康记录分析
机构 * Shanghai Jiao Tong University(上海交通大学) ; Intelligence Healthcare Department, AntGroup(智能医疗部,蚂蚁集团) ; Intelligence Computing and Sensing Laboratory, Peking University(智能计算与感知实验室,北京大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Fudan University(复旦大学)
AI总结 EHR-R1是一种针对电子健康记录分析设计的增强推理能力的基础语言模型,通过大规模推理数据集和多阶段训练方法提升了EHR分析的准确性和鲁棒性。
ContextFlow: 无训练视频物体编辑通过自适应上下文增强
机构 * State Key Laboratory of General Artifical Intelligence, Peking University, Beijing, China(北京人工智能基础理论国家重点实验室,北京大学) ; The Hong Kong University of Science and Technology(香港科技大学)
AI总结 ContextFlow通过自适应上下文增强解决无训练视频物体编辑中的保真度和时间一致性问题,实现高精度编辑效果。
Comments The project page is at https://yychen233.github.io/ContextFlow-page
FlagEval Findings Report: 对大推理模型在自动可验证文本和视觉问题上的初步评估
机构 * BAAI FlagEval Team(百度人工智能研究院FlagEval团队) ; State Key Laboratory of Multimedia Information Processing(多媒体信息处理国家重点实验室) ; Peking University(北京大学)
AI总结 FlagEval报告对大推理模型在自动可验证文本和视觉问题上的初步评估进行了研究,提出了ROME基准以测试视觉线索推理能力。
Comments Project homepage: https://flageval-baai.github.io/LRM-Eval/ This work will also be presented at NeurIPS 2025 Workshop on Foundations of Reasoning in Language Models (FoRLM); update with trials on Gemini 3 Pro
统计流匹配在统计流形上的应用
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Peking University(北京大学)
AI总结 统计流匹配通过几何视角在统计流形上实现精确似然计算,提升复杂模式学习能力。
Comments Accepted to NeurIPS 2024 as a conference paper