Xiaomi-TabLDM: A Tabular Foundation Model Technical Report
Xiaomi-TabLDM:表格基础模型技术报告
机构 * Xiaomi(小米)
AI总结 本研究提出Xiaomi-TabLDM表格基础模型,仅在SCM生成的合成数据预训练,通过三阶段训练策略等技术,在多基准回归任务表现优异且效率高,还可通过测试时计算扩展提升性能。
大厂专区
Xiaomi-TabLDM:表格基础模型技术报告
机构 * Xiaomi(小米)
AI总结 本研究提出Xiaomi-TabLDM表格基础模型,仅在SCM生成的合成数据预训练,通过三阶段训练策略等技术,在多基准回归任务表现优异且效率高,还可通过测试时计算扩展提升性能。
让每一次工具调用都发挥作用:面向智能体视觉语言模型的必要工具-证据路径奖励
机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) ; Department of Machine Learning, Carnegie Mellon University(卡内基梅隆大学机器学习系) ; MiLM Plus, Xiaomi Inc.(小米公司MiLM Plus)
AI总结 针对智能体视觉语言模型工具调用监督不足的问题,提出NTEP标注方案与NTEP-R监督机制,在7个基准上验证了NTEP-8B可提升搜索准确率与工具使用效率。
TRACE:面向一致性、极限感知的自进化技能库
机构 * Xiaomi Inc.(小米公司) ; Nanjing University(南京大学) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Tsinghua University(清华大学)
AI总结 TRACE是一种无需修改模型权重的自进化技能库方法,通过轨迹对比进化优化技能,在CAR-bench任务上显著提升LLM智能体的一致性性能,缩小潜在与可靠性能的差距。
Comments 9 pages, 5 figures, 2 tables
RoGe:通过端到端隐式重建与生成实现新视角合成
机构 * Xiaomi EV(小米汽车) ; Northeastern University(东北大学)
AI总结 本文提出RoGe框架,通过端到端统一的隐式重建与生成实现新视角合成,在DL3DV数据集上,其性能优于各类基线,且联合训练及射线查询隐式特征均能提升效果。
先感知后推理:一种用于高效可靠主动移动代理的预推理感知框架
机构 * HyperAI Team, Xiaomi Corporation(HyperAI团队,小米公司) ; Zhongnan University of Economics and Law(中南财经政法大学) ; Jilin University(吉林大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
AI总结 提出预推理感知框架(PRPF),通过轻量级多模态主动感知器(MPP)进行干预门控和上下文压缩,仅在需要时激活主动代理推理器(PAR),以解决主动移动代理中干预时机与方式决策的目标错位和冗余推理问题。
GUI-PRA:面向GUI任务的过程奖励智能体
机构 * Zhejiang University(浙江大学) ; MiLM Plus, Xiaomi Inc.(小米公司)
AI总结 针对长程GUI自动化的错误累积与视觉歧义问题,本文提出GUI-PRA,通过主动调查式评估实现性能提升,在AndroidWorld等数据集上较标准PRM取得显著进步。
语义头专业化指导多模态大语言模型的混合视觉Transformer注意力机制
机构 * Peking University(北京大学) ; Xiaomi Corporation(小米公司) ; The University of Hong Kong(香港大学)
AI总结 该研究针对多模态LLM中混合ViT注意力设计不足的问题,提出语义头专业化(SHS)概念,据此设计Ariadne注意力机制,在22项图像视频任务上性能与全注意力相当,计算量降低6.5倍。
PersonaForge:面向智能体系统的逼真多轮用户模拟
机构 * Peking University(北京大学) ; Xiaomi(小米) ; The University of Hong Kong(香港大学) ; Renmin University of China(中国人民大学)
AI总结 该研究针对现有智能体系统训练评估中多轮用户交互数据不足的问题,提出PersonaForge模拟框架构建相关数据集与基准,实验证实其可提升智能体交互效率与任务表现。
绑定主体,释放场景:面向长时序自回归视频生成的查询感知记忆路由
机构 * Huazhong University of Science and Technology(华中科技大学) ; MiLM Plus, Xiaomi Inc.(小米公司MiLM Plus)
AI总结 针对流式自回归视频生成中记忆锚定的场景欠进展问题,提出无需训练的查询感知时空记忆路由器 TetherMem,分离主体与场景查询调节历史访问,在长视频生成的整体质量与场景进展指标上优于基线方法。
单一策略,多种具现体:面向异构具身操纵的以相机为中心的统一动作几何预训练
机构 * Xiaomi Embodied Intelligence Team(小米具身智能团队) ; University of Macau(澳门大学)
AI总结 该研究针对异构具身操纵数据的问题,提出UCAG-P预训练方法,通过以相机为中心的统一动作公式对齐数据,在多个基准任务上取得优异性能,无需特定微调。
Comments Technical Report,Project page: https://public-bots.github.io/UCAG-P
CoSTALA:基于多粒度层次对比学习的组合式时空音频-语言对齐
机构 * Xi’an Jiaotong Liverpool University(西交利物浦大学) ; MiLM Plus, Xiaomi Inc.(小米公司MiLM Plus) ; University of Oulu(奥卢大学) ; Institute of Acoustics, Chinese Academy of Sciences(中国科学院声学研究所)
AI总结 CoSTALA通过多粒度层次对比学习构建新型训练范式,解决传统ALM难以处理多事件音频序列的问题,为时空音频理解提供强大新框架。
面向GUI奖励建模的任务自适应评分规则
机构 * Zhejiang University(浙江大学) ; MiLM Plus, Xiaomi Inc.(小米公司MiLM Plus)
AI总结 针对现有GUI奖励验证器任务自适应不足的问题,提出AdaptRubric框架,经实验验证其在离线奖励评估和在线强化学习中均优于现有方法,提升了F1值与任务成功率。
Omanic:迈向大语言模型多跳推理的逐步评估
机构 * The University of Tokyo(东京大学) ; Yale University(耶鲁大学) ; Stanford University(斯坦福大学) ; Xiaomi EV(小米EV) ; Soongsil University(顺天大学)
AI总结 针对大语言模型在多跳问答中中间步骤推理失败难以诊断的问题,提出Omanic基准,通过分解为单跳子问题并分析步骤级错误,揭示后期跳数瓶颈、事实知识下限和错误传播,微调后提升多个推理基准性能。
Comments EMNLP 2026 Findings
GSAR:面向移动GUI智能体的目标-状态-锚点奖励,结合自进化数据合成技术
机构 * Wuhan University(武汉大学) ; Xiaomi Inc.(小米公司)
AI总结 本研究提出GSAR奖励框架,结合自进化数据合成与状态-锚点机制,解决VLM-GUI智能体训练中数据合成及奖励信号的问题,在多基准测试中表现优异,为GUI智能体训练提供可扩展方案。
GuardianBench:面向具身智能中潜在上下文风险的同场景指令对比基准
机构 * Shandong University(山东大学) ; National University of Singapore(新加坡国立大学) ; Nanjing University of Aeronautics and Astronautics(南京航空航天大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Xiaomi Corporation(小米公司)
AI总结 该研究提出基于国际安全标准的同场景指令对比基准GuardianBench,发现VLMs对指令不敏感,用轻量级目标VLOS可提升其安全推理性能。
Comments 21 pages, 4 figures
ReWorld:为世界动作模型学习更好的表示
机构 * Huazhong University of Science and Technology(华中科技大学) ; Xiaomi EV(小米汽车)
AI总结 提出ReWorld框架,通过优化中间表示(未来预测监督、跨模态对齐、难负样本监督)提升自动驾驶世界动作模型的规划性能,在nuScenes和NAVSIM上取得显著提升。
Comments 15 pages,5 figures
大规模高质量多类别音乐源分离数据集的自动整理
机构 * Xiaomi Inc.(小米公司) ; Central Conservatory of Music(中央音乐学院)
AI总结 本文提出ACMI数据集,通过网络爬取结合自动清洗生成含7类声部的大规模高质量音乐源分离数据集,实验表明其可提升MSS模型的SDR性能。
ViTacPhys:基于人类视觉-触觉演示的感知物体物理属性的抓取方法
机构 * Xiaomi Robotics(小米机器人)
AI总结 该研究提出ViTacPhys视觉-触觉框架,可从人类演示中估计物体物理属性,迁移至机器人后实现高抓取成功率,力曲线更贴合人类遥操作。
Comments 11 pages, 7 figures. Project page: https://vitacphys.github.io/ViTacPhys/
机器人学习中隐式动作的关键影响因素
机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) ; Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; Guangdong Provincial Key Laboratory of Computility Microelectronics, Faculty of Computility Microelectronics, Shenzhen University of Advanced Technology(深圳先进技术研究院计算机微科学与技术学院、广东省计算微电子重点实验室) ; School of Aeronautics and Astronautics, Sichuan University(四川大学航空航天学院) ; Suzhou Evans Intelligent Technology Co., Ltd.(苏州伊文斯智能科技有限公司) ; Morphi Intelligence Technology Co., Ltd.(墨飞智能科技有限公司) ; School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) ; Xiaomi EV(小米汽车)
AI总结 本研究通过统一框架整合代表性隐式动作模型,系统探究41种设计选择,发现用隐式动作微调视觉语言模型主干可为下游机器人操纵策略学习提供更强初始化。
Comments Project page: https://carldegio.github.io/latent_action.github.io
Doc-V*:多页文档视觉问答中的粗到细交互推理
机构 * School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件工程学院) ; MiLM Plus, Xiaomi Inc.(小米公司MiLM Plus团队) ; School of Computer Science and Technology, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院) ; School of Data Science, Fudan University(复旦大学数据科学学院)
AI总结 Doc-V*提出一种无OCR的智能框架,通过序列证据聚合解决多页文档VQA问题,结合语义检索和目标页面获取,提升回答准确性和证据收集效率,在五个基准测试中优于开源基线,提升领域外性能达47.9%。
Comments Accepted by Association for Computational Linguistics (ACL)
GRNEdit:生成式细化网络中基于二元证据视角的高效通用视频编辑
机构 * Xidian University(西安电子科技大学) ; Xiaomi Inc.(小米公司)
AI总结 GRNEdit是轻量级两阶段通用视频编辑框架,以二元证据视角建模编辑意图,仅用0.6M数据和少量参数训练,在OpenVE-Bench上表现优于或媲美同类开源编辑器。
从拒答到丰富:用于长文本幻觉强化学习的评分规则奖励
机构 * Peking University(北京大学) ; Xiaomi(小米)
AI总结 该研究针对长文本幻觉强化学习的「拒答-丰富度」权衡,提出用关键要点评分规则定义奖励,发现软组合依据、评分规则覆盖率与相关性的奖励能实现最佳平衡,提升了依据性与分布外迁移能力。
ControlFoley: 一种统一且可控的视频到音频生成方法,具有跨模态冲突处理
机构 * MiLM Plus, Xiaomi Inc.(小米MiLM Plus) ; MiLM Plus, Xiaomi Inc. Wuhan University(小米MiLM Plus 武汉大学) ; Wuhan University(武汉大学)
AI总结 ControlFoley通过联合视觉编码和时域-音域解耦提升视频到音频生成的可控性与同步性,在多种任务中表现优异。
MiDashengLM-Gen:基于大语言模型驱动的自回归流匹配的统一音频场景生成
机构 * MiLM Plus ; Xiaomi Inc.(小米公司) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 MiDashengLM-Gen是首个端到端训练的通用文本到音频生成模型,通过结合LLM与每token条件流匹配,在Seed-TTS等基准上大幅提升语音可懂度,且支持多语言场景。
从合成到去除:基于物理的反射模拟与基于扩散的视频去反射
机构 * Xiaomi Inc.(小米公司) ; MiLM Plus
AI总结 该研究针对视频反射去除数据与模型缺失问题,提出闭环框架S2R,含基于物理的反射模拟、首个扩散式视频去反射模型及专用基准,实现了更优性能与更快推理。
Comments Project page: https://codingwzp.github.io/VideoDereflection_S2R
面向多语言机器翻译的开源大语言模型无参考后训练
机构 * Xiaomi Inc.(小米公司)
AI总结 该研究针对多语言机器翻译,以开源大语言模型为对象,采用GRPO算法结合无参考质量评估奖励,通过检查点插值得到MiLMMT-46-v1.0,其翻译质量优于SFT模型及多款开源基线,在无参考评分上领先于谷歌翻译等专有系统,还发布了相关模型与代码。
超越统一恢复:利用像素级多模态引导赋能全场景恢复
机构 * Xiaomi Corporation(小米公司)
AI总结 针对全场景图像恢复现有方法采用统一策略忽略区域退化差异的问题,提出MGN-AIR框架,通过像素级多模态引导实现更精细恢复,在多任务基准上性能显著优于现有方法。
Comments Accepted by ACMMM2026 as Oral Paper
ActBench:协作智能体行为安全的自演进基准
机构 * City University of Hong Kong(香港城市大学) ; Zhejiang University(浙江大学) ; University College London(伦敦大学学院) ; Xiaomi Corporation(小米公司)
AI总结 该研究提出自演进行为安全基准ActBench,结合奖励引导束搜索与双证据验证机制,评估协作智能体风险,在24000条轨迹上测试15个LLM和6个开源智能体,发现模型间攻击成功率差异更大。
Comments Benchmark and Code is available https://github.com/zjuicsr/ActBench
保留更多细节:缓解真实世界图像超分辨率中的内容漂移
机构 * Xiaomi Corporation(小米公司)
AI总结 针对真实世界图像超分辨率中因低质量输入导致的内容漂移问题,提出双路径架构的新型单步扩散模型FSP-Diff,在标准基准上优于现有单步扩散方法。
Comments Accepted to ACM MM 2026. This is the author's accepted version. The definitive version is published in the Proceedings of ACM MM 2026
基于扩散模型图像生成先验的高质量曝光校正
机构 * Huazhong University of Science and Technology(华中科技大学) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; National University of Defense Technology(国防科技大学) ; Xiaomi Communications Company Ltd.(小米通讯有限公司)
AI总结 本文提出基于扩散先验的曝光校正框架DPEC,通过高效微调策略与联合交叉注意力模块,在多数据集上实现了优于现有方法的曝光校正性能。
Comments Accepted by IEEE Transactions on Multimedia (TMM)