Unified Condition-Action Modeling for Accurate One-Step Action Generation
用于精准单步动作生成的统一条件-动作建模
机构 * NTU(南洋理工大学) ; HKU(香港大学)
专题命中 可控生成 :diffusion(abstract)
AI总结 该研究提出UCA-Flow统一条件-动作建模框架,通过共享令牌空间与改进双路监督方案,提升机器人单步动作生成的成功率与推理速度。
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
用于精准单步动作生成的统一条件-动作建模
机构 * NTU(南洋理工大学) ; HKU(香港大学)
专题命中 可控生成 :diffusion(abstract)
AI总结 该研究提出UCA-Flow统一条件-动作建模框架,通过共享令牌空间与改进双路监督方案,提升机器人单步动作生成的成功率与推理速度。
语义基质理论:几何语义漂移的算子理论框架
机构 * Intelligent Systems and Robotics Department(智能系统与机器人系)
专题命中 可控生成 :diffusion(abstract)
AI总结 本文提出语义基质理论,通过算子理论框架分析几何语义漂移,引入桥质量预测未来邻居重排,并提供理论与测试合同。
通过时间冗余掩码和潜在修复的自适应分词
机构 * Phronetic AI ; IISc Bangalore ; IIT Bombay
专题命中 图像修复 :inpainting(title,abstract);分类 cs.CV
AI总结 提出一种无参数的自适应视频分词机制,利用冻结连续分词器的潜在空间中的时间冗余,通过阈值丢弃冗余位置,并使用轻量级潜在修复变压器重建,实现内容驱动的令牌分配和高效推理。
Comments Accepted at BMVC 2026. Project page: https://apatkuri.github.io/adaptive-tokenisation-bmvc-2026/
连接恢复与生成流形的单步扩散在现实世界超分辨率中的应用
机构 * National Yang Ming Chiao Tung University, Hsinchu, Taiwan ; MediaTek Inc., Taiwan
专题命中 图像修复 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出IDaS-SR框架,通过Manifold Inversion Noise Estimator和CHARIOT机制,解决单步扩散中恢复与生成流形的匹配问题,提升现实世界超分辨率的性能。
推理与个性化结合:释放大型推理模型在个性化生成中的潜力
机构 * Dongguan University of Technology(东莞理工大学) ; City University of Hong Kong(香港城市大学) ; Tsinghua University(清华大学) ; Guangzhou University(广州大学)
专题命中 个性化与一致性 :personalized generation(title)
AI总结 本研究针对大型推理模型在个性化任务中存在的局限,提出强化推理框架及相关机制,经实验验证其性能显著优于现有技术。
降低艺术偏差以提高通用性的人工智能生成图像检测
机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS部门) ; Sangfor Technologies Inc.(Sangfor技术公司) ; China Mobile Financial Technology Co., Ltd.(中国移动金融科技有限公司) ; CAIR, HKSIS, Chinese Academy of Sciences(中国科学院CAIR、HKSIS部门) ; SCSE, FIE, M.U.S.T, Macau, China(澳门SCSE、FIE、M.U.S.T部门) ; Vast Intelligence Lab, Sydney, Australia(悉尼澳大利亚Vast Intelligence Lab)
专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV
AI总结 本文提出SEF框架,通过分离专家融合减少领域干扰,提升AI生成图像检测的通用性与鲁棒性,实验表明在13个基准上表现优异。
Comments preprint
临床感知的合成图像生成用于胸部X光模型的概念覆盖
机构 * University of Edinburgh(爱丁堡大学) ; NHS Lothian(洛锡安国家健康服务)
专题命中 图像生成评测 :image generation(title,abstract);分类 cs.CV
AI总结 提出CARPA框架,通过解剖约束的概念扰动生成合成胸部X光图像,扩展临床概念覆盖,提升模型性能与可靠性。
Comments Accepted for presentation at the IJCAI-ECAI 2026 RobustifAI workshop
QIRL:用于实现偏差鲁棒视觉问答的优化问答-图像关系学习
专题命中 图像生成评测 :image generation(abstract);分类 cs.CV
AI总结 该研究针对现有VQA偏差缓解方法的两大局限,提出QIRL框架,通过NIG与ISI模块结合生成驱动自监督学习,在VQA-CPv2和VQA-v2数据集上取得最优性能,可适配各类VQA架构。
StocBench:随机动力学生成建模基准
机构 * School of Computation, Information and Technology, Technical University of Munich(慕尼黑工业大学计算、信息与技术学院)
专题命中 图像生成评测 :diffusion(abstract)
AI总结 该研究构建StocBench基准,对比测试多种生成模型与少步方法在随机流体流动概率预测中的性能,明确不同模型在随机与确定性任务、不同推理预算下的表现差异。
Comments Code available at https://github.com/tum-pbs/stocbench
AdaptPrompt: 为通用深度伪造检测高效调整视觉语言模型参数
机构 * University of Waterloo(滑铁卢大学) ; University of Bergen(卑尔根大学)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 AdaptPrompt通过参数高效迁移学习框架,利用CLIP模型提升深度伪造检测的泛化能力,实现跨领域和少量样本下的高准确率识别。
Comments Accepted at DFF ACM Multimedia 2026
补丁的崩溃
机构 * School of Computer Science, The University of Sydney(计算机科学学院,悉尼大学)
专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV
AI总结 通过补丁崩溃视角提升图像建模效率,利用补丁依赖关系优化图像生成与分类
Comments 12 pages, 9 figures