arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Xiaomi(小米)

共收录 270
2609.03880 2026-09-04 cs.AI 新提交

Xiaomi-TabLDM: A Tabular Foundation Model Technical Report

Xiaomi-TabLDM:表格基础模型技术报告

TabLDM Team, Penghui Wang, Wei Liu, Hong Wang, Chengyue Huang, Yuxi Sun, Zirui Wang, Hongming Huang, Quan Wang, Chunxiao Liu, Erli Meng, Bin Wang

机构 * Xiaomi(小米)

AI总结 本研究提出Xiaomi-TabLDM表格基础模型,仅在SCM生成的合成数据预训练,通过三阶段训练策略等技术,在多基准回归任务表现优异且效率高,还可通过测试时计算扩展提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03493 2026-09-04 cs.AI 新提交

Making Every Tool Call Count: Necessary Tool-Evidence Path Rewards for Agentic Vision-Language Models

让每一次工具调用都发挥作用:面向智能体视觉语言模型的必要工具-证据路径奖励

Xingming Long, Yu Liu, Zhiwei Yang, Hanqi Feng, Shaojie Zhang, Barnabas Poczos, Chao Jiang, Zhenbo Luo, Lei Jiang, Pei Fu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) Department of Machine Learning, Carnegie Mellon University(卡内基梅隆大学机器学习系) MiLM Plus, Xiaomi Inc.(小米公司MiLM Plus)

AI总结 针对智能体视觉语言模型工具调用监督不足的问题,提出NTEP标注方案与NTEP-R监督机制,在7个基准上验证了NTEP-8B可提升搜索准确率与工具使用效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22793 2026-09-04 cs.CL cs.AI 版本更新

TRACE: A Self-Evolving Skill Bank for Consistent, Limit-Aware LLM Agents

TRACE:面向一致性、极限感知的自进化技能库

Wenhao Wu, Menghao Zhang, Xin Wang, Zhi Wang, Kun Shao, Jian Luan

机构 * Xiaomi Inc.(小米公司) Nanjing University(南京大学) Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学)

AI总结 TRACE是一种无需修改模型权重的自进化技能库方法,通过轨迹对比进化优化技能,在CAR-bench任务上显著提升LLM智能体的一致性性能,缩小潜在与可靠性能的差距。

Comments 9 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02847 2026-09-03 cs.CV 新提交

RoGe: Novel View Synthesis via End-to-End Implicit Reconstruction and Generation

RoGe:通过端到端隐式重建与生成实现新视角合成

Xiaolei Lang, Ze Kang, Zehao Huang, Naiyan Wang

机构 * Xiaomi EV(小米汽车) Northeastern University(东北大学)

AI总结 本文提出RoGe框架,通过端到端统一的隐式重建与生成实现新视角合成,在DL3DV数据集上,其性能优于各类基线,且联合训练及射线查询隐式特征均能提升效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03236 2026-09-01 cs.AI 版本更新

Perceive Before Reasoning: A Pre-Reasoning Perception Framework for Efficient and Reliable Proactive Mobile Agents

先感知后推理:一种用于高效可靠主动移动代理的预推理感知框架

Zhijie Ding, Weinan Hong, Zicheng Zhu, Lei Li, Dezhi Kong, Hao Wang, Peng Zhou, Xuchu Jiang, Jiaming Xu

机构 * HyperAI Team, Xiaomi Corporation(HyperAI团队,小米公司) Zhongnan University of Economics and Law(中南财经政法大学) Jilin University(吉林大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 提出预推理感知框架(PRPF),通过轻量级多模态主动感知器(MPP)进行干预门控和上下文压缩,仅在需要时激活主动代理推理器(PAR),以解决主动移动代理中干预时机与方式决策的目标错位和冗余推理问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23263 2026-09-01 cs.AI 版本更新

GUI-PRA: Process Reward Agent for GUI Tasks

GUI-PRA:面向GUI任务的过程奖励智能体

Tao Xiong, Xavier Hu, Yurun Chen, Yuhang Liu, Changqiao Wu, Pengzhi Gao, Wei Liu, Jian Luan, Shengyu Zhang

机构 * Zhejiang University(浙江大学) MiLM Plus, Xiaomi Inc.(小米公司)

AI总结 针对长程GUI自动化的错误累积与视觉歧义问题,本文提出GUI-PRA,通过主动调查式评估实现性能提升,在AndroidWorld等数据集上较标准PRM取得显著进步。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28383 2026-08-31 cs.CV cs.CL 新提交

Semantic Head Specialization Guides Hybrid ViT Attention for Multimodal LLMs

语义头专业化指导多模态大语言模型的混合视觉Transformer注意力机制

Chenhong He, Lei Li, Shicheng Li, Hanglong Lv, Lingpeng Kong, Qi Liu, Tong Yang, Shuhuai Ren

机构 * Peking University(北京大学) Xiaomi Corporation(小米公司) The University of Hong Kong(香港大学)

AI总结 该研究针对多模态LLM中混合ViT注意力设计不足的问题,提出语义头专业化(SHS)概念,据此设计Ariadne注意力机制,在22项图像视频任务上性能与全注意力相当,计算量降低6.5倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28378 2026-08-31 cs.CL 新提交

PersonaForge: Realistic Multi-Turn User Simulation for Agentic Systems

PersonaForge:面向智能体系统的逼真多轮用户模拟

Hanglong Lv, Dawei Zhu, Lei Li, Bowen Ye, Huaqiu Liu, Yifan Song, Bofei Gao, Weimin Xiong, Jinhao Dong, Chenhong He, Lingpeng Kong, Qi Liu, Tong Yang, Fuli Luo

机构 * Peking University(北京大学) Xiaomi(小米) The University of Hong Kong(香港大学) Renmin University of China(中国人民大学)

AI总结 该研究针对现有智能体系统训练评估中多轮用户交互数据不足的问题,提出PersonaForge模拟框架构建相关数据集与基准,实验证实其可提升智能体交互效率与任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26902 2026-08-28 cs.CV 新提交

Tether the Subject, Release the Scene: Query-Aware Memory Routing for Long-Horizon Autoregressive Video Generation

绑定主体,释放场景:面向长时序自回归视频生成的查询感知记忆路由

Chen Li, Peng Zhang, Hanyu Zhou, Jialong Zuo, Fei Wang, Daiguo Zhou, Nong Sang, Changxin Gao

机构 * Huazhong University of Science and Technology(华中科技大学) MiLM Plus, Xiaomi Inc.(小米公司MiLM Plus)

AI总结 针对流式自回归视频生成中记忆锚定的场景欠进展问题,提出无需训练的查询感知时空记忆路由器 TetherMem,分离主体与场景查询调节历史访问,在长视频生成的整体质量与场景进展指标上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26058 2026-08-27 cs.RO 新提交

One Policy, Many Embodiments: Unified Camera-Centric Action Geometry Pre-training for Heterogeneous Embodied Manipulation

单一策略,多种具现体:面向异构具身操纵的以相机为中心的统一动作几何预训练

Xiaomi Embodied Intelligence Team, University of Macau, :, Shaoqing Xu, Fang Li, Guozhi Zhan, Zhixiang Duan, Yuhan Wang, Yuechen Luo, Shengyin Jiang, Hanbing Li, Zhiying Du, Longlong Wang, Longmei Jiang, Weixiang Liang, Ying Gong, Yong Pan, Ziping Zhao, Zhiyuan Chen, Yangwei You, Kun Ma, Qinyuan Liu, Hangjun Ye, Zhi-xin Yang

机构 * Xiaomi Embodied Intelligence Team(小米具身智能团队) University of Macau(澳门大学)

AI总结 该研究针对异构具身操纵数据的问题,提出UCAG-P预训练方法,通过以相机为中心的统一动作公式对齐数据,在多个基准任务上取得优异性能,无需特定微调。

Comments Technical Report,Project page: https://public-bots.github.io/UCAG-P

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24374 2026-08-26 cs.SD 新提交

CoSTALA: Compositional Spatio-Temporal Audio-Language Alignment via Multi-Grain Hierarchical Contrastive Learning

CoSTALA:基于多粒度层次对比学习的组合式时空音频-语言对齐

Peiwei Ren, Jinbo Hu, Fang Kang, Shan Liang, Yin Cao

机构 * Xi’an Jiaotong Liverpool University(西交利物浦大学) MiLM Plus, Xiaomi Inc.(小米公司MiLM Plus) University of Oulu(奥卢大学) Institute of Acoustics, Chinese Academy of Sciences(中国科学院声学研究所)

AI总结 CoSTALA通过多粒度层次对比学习构建新型训练范式,解决传统ALM难以处理多事件音频序列的问题,为时空音频理解提供强大新框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24174 2026-08-26 cs.AI 新提交

Task-Adaptive Rubrics for GUI Reward Modeling

面向GUI奖励建模的任务自适应评分规则

Tao Xiong, Xavier Hu, Wenkai Wang, Qinzhuo Wu, Changqiao Wu, Pengzhi Gao, Wei Liu, Jian Luan, Shengyu Zhang

机构 * Zhejiang University(浙江大学) MiLM Plus, Xiaomi Inc.(小米公司MiLM Plus)

AI总结 针对现有GUI奖励验证器任务自适应不足的问题,提出AdaptRubric框架,经实验验证其在离线奖励评估和在线强化学习中均优于现有方法,提升了F1值与任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16654 2026-08-26 cs.CL cs.AI cs.LG 版本更新

Omanic: Towards Step-wise Evaluation of Multi-hop Reasoning in Large Language Models

Omanic:迈向大语言模型多跳推理的逐步评估

Xiaojie Gu, Sherry T. Tong, Aosong Feng, Sophia Simeng Han, Jinghui Lu, Yingjian Chen, Yusuke Iwasawa, Yutaka Matsuo, Chanjun Park, Rex Ying, Irene Li

机构 * The University of Tokyo(东京大学) Yale University(耶鲁大学) Stanford University(斯坦福大学) Xiaomi EV(小米EV) Soongsil University(顺天大学)

AI总结 针对大语言模型在多跳问答中中间步骤推理失败难以诊断的问题,提出Omanic基准,通过分解为单跳子问题并分析步骤级错误,揭示后期跳数瓶颈、事实知识下限和错误传播,微调后提升多个推理基准性能。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22847 2026-08-25 cs.AI 新提交

GSAR: Goal-State-Anchor Rewards for Mobile GUI Agents with Self-Evolving Data Synthesis

GSAR:面向移动GUI智能体的目标-状态-锚点奖励,结合自进化数据合成技术

Long Zhang, Yuhan Chen, Chaoran Zhang, Wanxia Cao, Kun Huang, Pengzhi Gao, Wei Liu, Jian Luan, Chenliang Li, Lixin Zou

机构 * Wuhan University(武汉大学) Xiaomi Inc.(小米公司)

AI总结 本研究提出GSAR奖励框架,结合自进化数据合成与状态-锚点机制,解决VLM-GUI智能体训练中数据合成及奖励信号的问题,在多基准测试中表现优异,为GUI智能体训练提供可扩展方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21928 2026-08-25 cs.AI cs.CL cs.RO 新提交

GuardianBench: A Same-Scene Instruction-Contrastive Benchmark for Latent Contextual Risk in Embodied AI

GuardianBench:面向具身智能中潜在上下文风险的同场景指令对比基准

Zhesheng Zhang, Jiahao Lu, Wei Liu, Cong Pan, Jianhua Yang, Yixiang Chen, Hongyuan Yu, Mengqi Zhang, Kailin Lyu, Zhumin Chen, Keji He

机构 * Shandong University(山东大学) National University of Singapore(新加坡国立大学) Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Xiaomi Corporation(小米公司)

AI总结 该研究提出基于国际安全标准的同场景指令对比基准GuardianBench,发现VLMs对指令不敏感,用轻量级目标VLOS可提升其安全推理性能。

Comments 21 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27504 2026-08-25 cs.CV 版本更新

ReWorld: Representation Learning for World Action Models

ReWorld:为世界动作模型学习更好的表示

Tianze Xia, Lijun Zhou, Kaixin Xiong, Jingfeng Yao, Zhenxin Zhu, Haiyang Sun, Bing Wang, Guang Chen, Wenyu Liu, Hangjun Ye, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Xiaomi EV(小米汽车)

AI总结 提出ReWorld框架,通过优化中间表示(未来预测监督、跨模态对齐、难负样本监督)提升自动驾驶世界动作模型的规划性能,在nuScenes和NAVSIM上取得显著提升。

Comments 15 pages,5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07840 2026-08-25 cs.SD eess.AS 版本更新

Automatic Curation of Large-Scale, High-Quality, Multi-Category Music Source Separation Dataset

大规模高质量多类别音乐源分离数据集的自动整理

Ji Yu, Yang shuo, Xu Yuetonghui, Liu Mengmei, Ji Qiang, Han Zerui

机构 * Xiaomi Inc.(小米公司) Central Conservatory of Music(中央音乐学院)

AI总结 本文提出ACMI数据集,通过网络爬取结合自动清洗生成含7类声部的大规模高质量音乐源分离数据集,实验表明其可提升MSS模型的SDR性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21355 2026-08-24 cs.RO 新提交

ViTacPhys: Physical Property-Aware Grasping from Human Visual-Tactile Demonstrations

ViTacPhys:基于人类视觉-触觉演示的感知物体物理属性的抓取方法

Yiwen Liu, Yujun Zhu, Kui Jia, Zhao Liao, Yangwei You, Shuaijun Wang

机构 * Xiaomi Robotics(小米机器人)

AI总结 该研究提出ViTacPhys视觉-触觉框架,可从人类演示中估计物体物理属性,迁移至机器人后实现高抓取成功率,力曲线更贴合人类遥操作。

Comments 11 pages, 7 figures. Project page: https://vitacphys.github.io/ViTacPhys/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19613 2026-08-21 cs.RO cs.CV 新提交

What Matters for Latent Actions in Robot Learning

机器人学习中隐式动作的关键影响因素

Xizhou Bu, Qingda Hu, Lei Zhou, Lingfeng Zhang, Yingbo Tang, Zihao Liu, Xinyi Tao, Zhiqiang Ma, Qingqiu Huang, Chufeng Tang, Hongbo Wang, Jing Zhang, Jiayi Ma, Hangjun Ye, Wei Li, Xiaoshuai Hao

机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Guangdong Provincial Key Laboratory of Computility Microelectronics, Faculty of Computility Microelectronics, Shenzhen University of Advanced Technology(深圳先进技术研究院计算机微科学与技术学院、广东省计算微电子重点实验室) School of Aeronautics and Astronautics, Sichuan University(四川大学航空航天学院) Suzhou Evans Intelligent Technology Co., Ltd.(苏州伊文斯智能科技有限公司) Morphi Intelligence Technology Co., Ltd.(墨飞智能科技有限公司) School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) Xiaomi EV(小米汽车)

AI总结 本研究通过统一框架整合代表性隐式动作模型,系统探究41种设计选择,发现用隐式动作微调视觉语言模型主干可为下游机器人操纵策略学习提供更强初始化。

Comments Project page: https://carldegio.github.io/latent_action.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13731 2026-08-21 cs.CL 版本更新

Doc-V*:Coarse-to-Fine Interactive Visual Reasoning for Multi-Page Document VQA

Doc-V*:多页文档视觉问答中的粗到细交互推理

Yuanlei Zheng, Pei Fu, Hang Li, Ziyang Wang, Yuyi Zhang, Wenyu Ruan, Xiaojin Zhang, Zhongyu Wei, Zhenbo Luo, Jian Luan, Wei Chen, Xiang Bai

机构 * School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件工程学院) MiLM Plus, Xiaomi Inc.(小米公司MiLM Plus团队) School of Computer Science and Technology, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院) School of Data Science, Fudan University(复旦大学数据科学学院)

AI总结 Doc-V*提出一种无OCR的智能框架,通过序列证据聚合解决多页文档VQA问题,结合语义检索和目标页面获取,提升回答准确性和证据收集效率,在五个基准测试中优于开源基线,提升领域外性能达47.9%。

Comments Accepted by Association for Computational Linguistics (ACL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16328 2026-08-18 cs.CV 新提交

GRNEdit: Efficient General Video Editing from a New Binary-Evidence Perspective in Generative Refinement Networks

GRNEdit:生成式细化网络中基于二元证据视角的高效通用视频编辑

Feng Xie, Jiagao Hu, Fuhao Li, Zepeng Wang, Yuxuan Chen, Dahua Gao, Fei Wang, Daiguo Zhou

机构 * Xidian University(西安电子科技大学) Xiaomi Inc.(小米公司)

AI总结 GRNEdit是轻量级两阶段通用视频编辑框架,以二元证据视角建模编辑意图,仅用0.6M数据和少量参数训练,在OpenVE-Bench上表现优于或媲美同类开源编辑器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12337 2026-08-14 cs.CL 新提交

From Refuse to Richness: Rubric Rewards for Long-Form Hallucination Reinforcement Learning

从拒答到丰富:用于长文本幻觉强化学习的评分规则奖励

Yudong Wang, Zhe Yang, Wenhan Ma, Rang Li, Qibin Yang, Weimin Xiong, Jiangshan Duo, Liang Zhao, Zhifang Sui

机构 * Peking University(北京大学) Xiaomi(小米)

AI总结 该研究针对长文本幻觉强化学习的「拒答-丰富度」权衡,提出用关键要点评分规则定义奖励,发现软组合依据、评分规则覆盖率与相关性的奖励能实现最佳平衡,提升了依据性与分布外迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15086 2026-08-14 cs.MM cs.CV cs.SD 版本更新

ControlFoley: Unified and Controllable Video-to-Audio Generation with Cross-Modal Conflict Handling

ControlFoley: 一种统一且可控的视频到音频生成方法,具有跨模态冲突处理

Jianxuan Yang, Xinyue Guo, Zhi Cheng, Kai Wang, Lipan Zhang, Jinjie Hu, Qiang Ji, Yihua Cao, Yihao Meng, Zhaoyue Cui, Mengmei Liu, Meng Meng, Jian Luan

机构 * MiLM Plus, Xiaomi Inc.(小米MiLM Plus) MiLM Plus, Xiaomi Inc. Wuhan University(小米MiLM Plus 武汉大学) Wuhan University(武汉大学)

AI总结 ControlFoley通过联合视觉编码和时域-音域解耦提升视频到音频生成的可控性与同步性,在多种任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11804 2026-08-13 eess.AS cs.SD 新提交

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching

MiDashengLM-Gen:基于大语言模型驱动的自回归流匹配的统一音频场景生成

Xingwei Sun, Heinrich Dinkel, Gang Li, Jiahao Mei, Yadong Niu, Zerui Han, Yuepeng Jiang, Jiahao Zhou, Lichun Fan, Jian Luan

机构 * MiLM Plus Xiaomi Inc.(小米公司) Shanghai Jiao Tong University(上海交通大学)

AI总结 MiDashengLM-Gen是首个端到端训练的通用文本到音频生成模型,通过结合LLM与每token条件流匹配,在Seed-TTS等基准上大幅提升语音可懂度,且支持多语言场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11562 2026-08-13 cs.CV cs.AI eess.IV 新提交

From Synthesis to Removal: Physics-Grounded Reflection Simulation and Diffusion-Based Video Dereflection

从合成到去除:基于物理的反射模拟与基于扩散的视频去反射

Zepeng Wang, Jiagao Hu, Fuhao Li, Yuxuan Chen, Fei Wang, Daiguo Zhou

机构 * Xiaomi Inc.(小米公司) MiLM Plus

AI总结 该研究针对视频反射去除数据与模型缺失问题,提出闭环框架S2R,含基于物理的反射模拟、首个扩散式视频去反射模型及专用基准,实现了更优性能与更快推理。

Comments Project page: https://codingwzp.github.io/VideoDereflection_S2R

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10812 2026-08-13 cs.CL cs.AI 版本更新

Reference-Free Post-Training of Open Large Language Models for Multilingual Machine Translation

面向多语言机器翻译的开源大语言模型无参考后训练

Chris Han, Pengzhi Gao, Pei Fu, Jian Luan

机构 * Xiaomi Inc.(小米公司)

AI总结 该研究针对多语言机器翻译,以开源大语言模型为对象,采用GRPO算法结合无参考质量评估奖励,通过检查点插值得到MiLMMT-46-v1.0,其翻译质量优于SFT模型及多款开源基线,在无参考评分上领先于谷歌翻译等专有系统,还发布了相关模型与代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09482 2026-08-11 cs.CV cs.AI 新提交

Beyond Uniform Restoration: Empowering All-in-One Restoration with Pixel-Level Multimodal Guidance

超越统一恢复:利用像素级多模态引导赋能全场景恢复

Chunxiao Liu, Wei Liu, Anbin Xiong, Erli Meng

机构 * Xiaomi Corporation(小米公司)

AI总结 针对全场景图像恢复现有方法采用统一策略忽略区域退化差异的问题,提出MGN-AIR框架,通过像素级多模态引导实现更精细恢复,在多任务基准上性能显著优于现有方法。

Comments Accepted by ACMMM2026 as Oral Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09476 2026-08-11 cs.CR cs.AI 新提交

ActBench: Self-Evolving Benchmark of Behavioral Safety in Cowork Agents

ActBench:协作智能体行为安全的自演进基准

Hongwei Yao, Yiming Liu, Meihui Chen, Jieling Chen, Zikun Chen, Yiling He, Wangze Ni, Cong Wang, Kui Ren

机构 * City University of Hong Kong(香港城市大学) Zhejiang University(浙江大学) University College London(伦敦大学学院) Xiaomi Corporation(小米公司)

AI总结 该研究提出自演进行为安全基准ActBench,结合奖励引导束搜索与双证据验证机制,评估协作智能体风险,在24000条轨迹上测试15个LLM和6个开源智能体,发现模型间攻击成功率差异更大。

Comments Benchmark and Code is available https://github.com/zjuicsr/ActBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09373 2026-08-11 cs.CV 新提交

Preserve More Details: Mitigating Content Drift in Real-World Image Super-Resolution

保留更多细节:缓解真实世界图像超分辨率中的内容漂移

Chunxiao Liu, Wei Liu, Anbin Xiong, Erli Meng

机构 * Xiaomi Corporation(小米公司)

AI总结 针对真实世界图像超分辨率中因低质量输入导致的内容漂移问题,提出双路径架构的新型单步扩散模型FSP-Diff,在标准基准上优于现有单步扩散方法。

Comments Accepted to ACM MM 2026. This is the author's accepted version. The definitive version is published in the Proceedings of ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08720 2026-08-11 cs.CV 新提交

High-Quality Exposure Correction with Diffusion-Based Image Generation Priors

基于扩散模型图像生成先验的高质量曝光校正

Ziwen Li, Meng Cao, Jinpu Zhang, Chunyang Li, Long Bao, Heng Sun, Yuehuan Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) National University of Defense Technology(国防科技大学) Xiaomi Communications Company Ltd.(小米通讯有限公司)

AI总结 本文提出基于扩散先验的曝光校正框架DPEC,通过高效微调策略与联合交叉注意力模块,在多数据集上实现了优于现有方法的曝光校正性能。

Comments Accepted by IEEE Transactions on Multimedia (TMM)

详情

展开后加载摘要…

URL PDF HTML 收藏