UniMo: Unifying 2D Video and 3D Human Motion with an Autoregressive Framework
UniMo:基于自回归框架统一2D视频与3D人体运动
机构 * Tsinghua University(清华大学) ; Meituan(美团)
AI总结 UniMo通过自回归框架统一2D视频与3D人体运动,实现同时生成与理解,提升多模态联合建模能力。
Comments https://carlyx.github.io/UniMo/
高校专区
UniMo:基于自回归框架统一2D视频与3D人体运动
机构 * Tsinghua University(清华大学) ; Meituan(美团)
AI总结 UniMo通过自回归框架统一2D视频与3D人体运动,实现同时生成与理解,提升多模态联合建模能力。
Comments https://carlyx.github.io/UniMo/
从序列层面视角出发的扩散大语言模型原理化强化学习
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) ; Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大模型与智能治理研究重点实验室) ; Engineering Research Center of Next-Generation Intelligent Search and Recommendation, MOE(下一代智能搜索与推荐工程技术研究中心) ; Stanford University(斯坦福大学) ; Lambda, Inc(Lambda公司) ; Tsinghua University(清华大学)
AI总结 本文提出ESPO,一种基于序列级优化的原理化强化学习框架,用于提升扩散大语言模型的生成能力,通过ELBO作为似然代理,显著优于token级方法。
轨迹编码的起源条件:通过神经分解测量城市配置的不对称性
机构 * University College London(伦敦大学学院) ; Tsinghua University(清华大学) ; University of Sydney(悉尼大学)
AI总结 本文提出一种条件轨迹编码器,通过神经分解测量城市配置的不对称性,解决轨迹学习与空间嵌入方法的碎片化问题,揭示城市形态对认知不平等的影响。
AR-Med: 通过LLM驱动的信息增强实现医疗搜索的自动化相关性增强
机构 * Meituan Inc.(美团公司) ; Tsinghua University(清华大学) ; Independent Researcher(独立研究者)
AI总结 AR-Med通过LLM驱动的信息增强,实现医疗搜索的自动化相关性提升,提高了准确性和用户满意度。
ConvRot:基于旋转的插拔式4位量化用于扩散变换器
机构 * SIGS, Tsinghua University(清华大学信号与信息系) ; Central Media Technology Institute, Huawei(华为中央媒体技术研究所)
AI总结 ConvRot提出基于旋转的4位量化方法,通过正则Hadamard变换抑制异常值,实现扩散变换器的插拔式W4A4推理,提升速度和内存效率同时保持图像质量。
视觉语言模型能否检测并定位细粒度的人工智能编辑图像?
机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Ant Group(蚂蚁集团) ; Tsinghua University(清华大学) ; Shandong University(山东大学) ; Wuhan University(武汉大学)
AI总结 本文提出FragFake基准,首次系统研究VLMs在编辑图像分类和定位中的应用,发现微调模型在准确性上表现优异,同时探索了基于GRPO的RLVR训练方法。
Comments 14pages,19 figures
跨染色对比学习用于配对免疫组化和病理切片的表示学习
机构 * Communication University of China(通信大学) ; Tsinghua University(清华大学) ; Macquarie University(麦考瑞大学)
AI总结 本文提出CSCL方法,通过跨染色对比学习提升H&E与IHC特征的兼容性,实现高质量的切片级表示学习。
Comments 6 pages, 2 figures. Camera-ready version accepted for IEEE BIBM 2025
RoboScape-R: 通用机器人训练的统一奖励-观测世界模型
机构 * Tsinghua University(清华大学) ; Manifold AI
AI总结 RoboScape-R通过统一奖励-观测世界模型提升机器人训练的泛化能力,实现37.5%的性能提升。
GaussDetect-LiNGAM:无需高斯性检验的因果方向识别
机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳国际研究生院,清华大学,深圳,中国)
AI总结 GaussDetect-LiNGAM通过利用噪声高斯性与残差独立性的等价性,无需高斯性检验即可实现因果方向识别,提升因果推断的效率和实用性。
YOLOA:通过LLM适配器实现实时的可及性检测
机构 * School of Electronic Engineering, Xidian University(电子工程学院,西安电子科技大学) ; School of Software, Tsinghua University(软件学院,清华大学) ; School of Computer Science and Informatics, Cardiff University(计算机科学与信息学院,卡迪夫大学)
AI总结 YOLOA通过LLM适配器实现实时可及性检测,结合对象检测与可及性学习,取得高精度与高效率的平衡。
Comments 13 pages, 9 figures, conference
FireSentry: 一种多模态时空基准数据集用于细粒度野火蔓延预测
机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) ; College of Soil and Water Conservation, Southwest Forestry University(西南林业大学水土保持学院) ; College of Civil Engineering, Southwest Forestry University(西南林业大学土木工程学院)
AI总结 FireSentry提出了一种多模态野火数据集和FiReDiff双模态范式,用于细粒度野火预测和动态灾害模拟,显著提升了视频和火斑掩膜的预测精度。
LoVoRA: 基于文本引导和无掩码的视频对象移除与添加方法
机构 * Tsinghua University(清华大学) ; Huawei Inc.(华为公司) ; University of Science and Technology of China(中国科学技术大学)
AI总结 LoVoRA通过可学习的对象感知定位机制实现无掩码的视频对象移除与添加,结合图像到视频转换和光流传播,实现端到端视频编辑。
STCTS: 通过显式文本-语调-音色分解实现超低比特率语音的生成语义压缩
机构 * Fudan University(复旦大学) ; Tsinghua University(清华大学)
AI总结 STCTS通过显式分解语音为语言内容、语调和音色,实现80bps下的高质量超低比特率语音压缩,兼顾效率与质量。
Comments The complete source code and online speech reconstruction demo is publicly available at https://github.com/dywsy21/STCTS
ConfRover:通过自回归方法同时建模蛋白质构象与动力学
机构 * ByteDance Seed(字节跳动种子基金) ; School of Mathematical Sciences, Tongji University(同济大学数学科学学院) ; Department of Automation, Tsinghua University(清华大学自动化系)
AI总结 ConfRover通过自回归方法同时建模蛋白质构象与动力学,支持时间依赖和时间无关的采样,首次在单一框架内实现蛋白质构象和轨迹的生成。
Comments 35 pages, 17 figures; Camera ready for NeurIPS 2025; Website: https://bytedance-seed.github.io/ConfRover
IW-Bench: 评估大规模多模态模型的图像到网页转换能力
机构 * Beihang University(北京航空航天大学) ; Alibaba Group(阿里巴巴集团) ; Tsinghua University(清华大学) ; Nanyang Technological University(南洋理工大学) ; National University of Singapore(新加坡国立大学)
AI总结 IW-Bench提出了一种新的基准,用于评估大规模多模态模型在图像到网页转换中的性能,通过元素准确率和布局准确率以及五跳提示方法来提升评估效果。