arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 2420 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 2420 篇

2607.12379 2026-07-15 cs.CV 新提交 57%

SeamGen: Artist-Aligned UV Seam Generation via Graph Flow Matching

SeamGen:通过图流匹配生成与艺术家对齐的UV接缝

Hao Xu, Yuqing Zhang, Yiqian Wu, Xueqi Ma, Ding Liang, Yan-Pei Cao, Ying-Tian Liu, Xiaogang Jin

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室) VAST(未提及,可能是一个缩写,无法准确翻译)

专题命中 扩散模型 :inpainting(abstract);分类 cs.CV

AI总结 研究针对3D内容创作中UV接缝放置问题,提出SeamGen模型,通过流匹配从现有接缝布局学习,设计Mesh Transformer主干,利用流模型修复能力,能生成更符合艺术家偏好的UV布局,提升感知质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12171 2026-07-15 cs.CV cs.AI cs.LG 新提交 57%

Self-Consistent Flow: Unifying Velocity and Endpoint Prediction for Rectified Flow Models

自洽流:统一整流流模型的速度和端点预测

Xu Han, Jiajing Hu, Li-Ping Liu

机构 * Tufts University(塔夫茨大学)

专题命中 扩散模型 :image generation(abstract);分类 cs.CV

AI总结 研究基于整流流的生成模型中不同参数化预测目标的问题,提出自洽流方法,通过轻量级一致性损失联合训练网络预测速度和端点,提升模型性能,在图像生成任务中显著优于标准整流流基线。

Comments Published in Transactions on Machine Learning Research

Journal ref Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11836 2026-07-14 cs.CV 新提交 57%

Cycle-World: Mitigating Error Accumulation in Long-term Video World Models via Reverse-Prediction Cycle Consistency

循环世界:通过反向预测循环一致性减轻长期视频世界模型中的误差累积

Zihan Su, Teng Hu, Jiangning Zhang, Ruiyan Wang, Ran Yi, Lizhuang Ma, Dacheng Tao

机构 * School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(上海交通大学计算机科学学院) Institute of Cyber-Systems and Control, Zhejiang University, Hangzhou, China(浙江大学控制系统研究所) Nanyang Technological University, Singapore(新加坡南洋理工大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对自回归扩散模型在长视频生成中误差累积问题,提出循环世界框架,通过训练和推理阶段的时间可逆性及反向预测模型抑制误差,实验证明其在VBench基准测试中显著减轻误差漂移,提升生成质量和时间一致性。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11364 2026-07-14 cs.LG cs.AI cs.MM 新提交 57%

BackgroundMellow: A Multi-Modal Cohesive Framework for Narrative-Driven Rich Cinematic Soundscape Generation

BackgroundMellow:一种用于叙事驱动的丰富电影音效生成的多模态凝聚框架

Ajitesh Jamulkar, Aritra Hazra

机构 * Indian Institute of Technology Kharagpur(印度理工学院卡拉格布尔分校)

专题命中 扩散模型 :diffusion(abstract);分类 cs.MM

AI总结 多模态AI中为文本叙事生成电影音效困难,BackgroundMellow框架将其视为编排与信号处理问题,通过主 - 专家架构、Tango2模型、背景音乐检索器及NLP模块实现,经实验验证在时间同步等方面有效。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10781 2026-07-14 cs.CV cs.RO 新提交 57%

Is Energy Guidance All You Need? Training-Free Norm Injection for Driving World Models

你所需要的只是能量引导吗?用于驱动世界模型的无训练规范注入

Xiyan Su, Frank Diermeyer, Markus Lienkamp

机构 * Institute of Automotive Technology, Technical University of Munich(慕尼黑工业大学汽车技术研究所)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究基于大型视频扩散主干的驾驶世界模型难以控制的问题,提出通过可微能量函数在采样时操控规划轨迹,无需重新训练主干,以Open-Sora 2.0 MM-DiT主干模型为例验证,指出跨流耦合是端到端可控关键。

Comments Accepted to Robotics: Science and Systems 2026 Robot World Models Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10706 2026-07-14 cs.RO cs.AI cs.CV cs.LG 新提交 57%

Action Map Policy: Learning 3D Closed-loop Manipulation via Pixel Classification

动作映射策略:通过像素分类学习3D闭环操作

Haojie Huang, Zhang Ye, Linfeng Zhao, Boce Hu, Mingxi Jia, Yu Qi, Ahmed Agha, Dian Wang, Robert Platt, Robin Walters

机构 * Northeastern University(东北大学) Stanford University(斯坦福大学) Brown University(布朗大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究针对机器人学习中动作空间的挑战,提出动作映射策略(AMP),将3D闭环操作策略学习转为图像空间分类问题,通过投影动作到图像平面,以像素为类别控制维度,实现高精度、快速推理,实验证明其优于基线。

Comments Project Website: https://haojhuang.github.io/amp_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10695 2026-07-14 cs.CV cs.CR 新提交 57%

Effective Synthetic Image Detection via Noise Residual Clustering

通过噪声残差聚类实现有效的合成图像检测

Caihui Yan, Gang Cao, Huawei Tian, Zhen Li, Yuhang Zhai

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对合成图像检测问题,提出一种无训练方法,先提取噪声残差指纹,再经视觉Transformer提取多尺度特征并融合,用少量真实图像样本初始化聚类中心,在四个基准数据集上平均准确率达82.2%,泛化能力优于现有检测器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10329 2026-07-14 cs.CV 新提交 57%

Imperceptible and Reversible Adversarial Examples against Vision-Language Models for Privacy Protection

用于隐私保护的针对视觉语言模型的不可察觉且可逆的对抗性示例

Qi Lu, Ziqi Zhou, Yufei Song, Zijing Li, Lulu Xue, Minghui Li, Shengshan Hu, Leo Yu Zhang

机构 * School of Cyber Science and Engineering, Huazhong University of Science and Technology(华中科技大学网络空间安全学院) College of Computer Science, Chongqing University(重庆大学计算机科学学院) School of Software and engineering, Huazhong University of Science and Technology(华中科技大学软件工程学院) School of Information and Communication Technology, Griffith University(格里菲斯大学信息与通信技术学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究针对视觉语言模型基于文本的隐私攻击问题,提出CloakDiff框架,结合扩散对抗编辑与可逆网络生成不可察觉的对抗性示例,设计EDM启发式采样提高保真度,实验证明该框架能实现多模态隐私保护且具高视觉质量和可逆性。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09818 2026-07-14 cs.RO cs.AI cs.CV 新提交 57%

TS-Mask VLA: 2D Temporal-Spatial Masking for Vision-Language-Action Model with Effective Bridging

TS-Mask VLA:用于视觉-语言-动作模型的具有有效桥接的二维时空掩码

Shengzhuo Yang, Ronghao Yu, Chuanjie Lv, Linpeng Peng, Hang Yu, Jie Ren, Jiajun Lv, Yong Liu

机构 * Institute of Cyber-Systems and Control, Zhejiang University(浙江大学网络系统与控制研究所) Tongji University(同济大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究针对视觉-语言-动作模型问题,提出TS-Mask VLA框架,基于离散扩散动作专家和时空二维掩码策略,在模拟基准和现实任务实验中表现出色,验证了设计有效性。

Comments 9 pages, 5 figures, accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09193 2026-07-13 cs.CV 新提交 57%

YeTI: You Only Need Two Noisy Images for Real-World sRGB Noise Generation

YeTI:仅需两张噪声图像即可生成真实世界的sRGB噪声

Jaekyun Ko, Byung Wan Lim, Soomin Lee, Dongjin Kim, Tae Hyun Kim

机构 * Department of Computer Science, Hanyang University(汉阳大学计算机科学系) Mobile Experience (MX) Division, Samsung Electronics(三星电子移动体验部门)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对真实世界sRGB图像去噪难题,提出YeTI框架,仅从同一场景两张噪声图像学习,利用重构自编码器和条件扩散Transformer分离场景与噪声特征,生成逼真噪声,经实验验证其有效性及在下游去噪任务中的实用价值。

Comments Accepted to ECCV 2026. Includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09125 2026-07-13 cs.CV 新提交 57%

4D Human-Scene Reconstruction from Low-Overlap Captures

从低重叠度捕获中进行4D人体场景重建

Minhyuk Hwang, Sangmin Kim, Seunguk Do, Daneul Kim, Jaesik Park

机构 * Seoul National University(首尔国立大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对现实场景中低重叠度相机的4D人体场景重建问题,提出StudioRecon方法,通过解耦背景和人体,利用视频扩散模型强化背景监督,结合跨视图关联等初始化人体,经递归增强模块避免伪影,实现了高水准新视图合成及相关应用。

Comments Accepted to SIGGRAPH Conference Papers '26. First two authors contributed equally. Project page: https://sisyphm.github.io/studiorecon-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09081 2026-07-13 cs.CV 新提交 57%

Adaptive Latent Trajectory Anchoring for Action Segmentation Dataset Condensation

用于动作分割数据集压缩的自适应潜在轨迹锚定

Artheme Gauthier-Villar, Guodong Ding, Angela Yao

机构 * National University of Singapore(新加坡国立大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 该研究针对动作分割数据集压缩问题,提出利用去噪扩散隐式模型,将动作段表示为噪声流形中由稀疏潜在点锚定连续轨迹的方法,并引入自适应分配机制。实验表明,该框架显著优于现有方法,在保持低压缩率时实现与真实数据训练相当的性能。

Comments 16 pages, 5 figures, accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08270 2026-07-10 cs.CV 新提交 57%

Progression as Latent Drift: Generative Forecasting of Slow-Evolving Pathologies

作为潜在漂移的进展:缓慢演变病理的生成预测

Yuxiang Feng, Juncheng Wang, Chao Xu, Wenlong Hou, Huihan Wang, Yijie Qian, Yang Liu, Baigui Sun, Yong Liu, Shujun Wan

机构 * Zhejiang University(浙江大学) The Hong Kong Polytechnic University(香港理工大学) IROOTECH TECHNOLOGY(IROOTECH技术) Wolf 1069 b Lab, Sany Group(Wolf 1069 b实验室,三一集团)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究针对缓慢演变神经退行性疾病未来解剖结构预测难题,提出潜在漂移的渐进生成框架,在压缩语义表示中学习变化,结合有限标量量化抑制干扰波动,实验表明该方法在神经预测上优于基线。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07880 2026-07-10 cs.CV 新提交 57%

GIRAF: Towards Generalizable Human Interactions with Articulated Objects

GIRAF:迈向与关节物体的可泛化人类交互

Xiaohan Zhang, Sebastian Starke, Alexander Winkler, Federica Bogo, Samir Aroudj, Yuting Ye

机构 * Meta

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对合成与关节物体的逼真全身人类交互难题,现有模型有局限。本文提出文本条件扩散模型,通过以物体为中心的表示、混合域训练策略和基于接触的增强方案应对挑战,实验证明其对未见物体配置泛化能力强,超越现有方法。

Comments 12 pages, 6 figures, 3 tables. Accepted at the Third Workshop on Human Motion Generation (HuMoGen), CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07192 2026-07-09 cs.CV 新提交 57%

Prototype-Anchored Generalized Manifold Regression for Unknown-Domain Object Detection

用于未知域目标检测的原型锚定广义流形回归

Zihao Zhang, Aming Wu, Yang Li, Yahong Han

机构 * School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机与信息工程学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究单域广义目标检测,提出MR-DCoT方法,通过视觉-文本双思维链生成离群示例,利用类特定原型锚定学习校正算子,将未知域泛化建模为流形回归问题,实验验证了该方法在多场景下的有效性和通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07027 2026-07-09 cs.LG cs.AI cs.CV 新提交 57%

Latent graph encoding of multimodal neuroimaging features with generative AI architectures

基于生成式人工智能架构的多模态神经影像特征的潜在图编码

Ishaan Batta, Meenu Ajith, Vince Calhoun

机构 * Center for Translational Research in Neuroimaging and Data Science (TReNDS)(转化神经影像与数据科学研究中心)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究旨在设计多模态生成框架用于神经影像特征分析,通过评估多种策略和模型,利用GMV和sFNC特征分析多个生成框架,提出的gMMVAE在多指标上超替代变体,有潜力用于稳健的多模态神经影像分析。

Comments 6 pages, accepted in IEEE International Conference on Image Processing (ICIP) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04653 2026-07-09 cs.CV 新提交 57%

Enhancing Video Physical Consistency via Role-aware Joint Training and Modality-decoupled Denoising

通过角色感知联合训练和模态解耦去噪增强视频物理一致性

Guangting Zheng, Haojing Chen, Hao Li, Jingtao Zhang, Zhen Yang, Xiaosong Jia, Xue Yang, Shaofeng Zhang, Yanyong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) University of Electronic Science and Technology of China(电子科技大学) Fudan University(复旦大学) Georgia Institute of Technology(佐治亚理工学院) Shanghai Jiao Tong University(上海交通大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究针对视频扩散模型长程物理一致性挑战,提出VPT微调框架。通过角色感知信号清晰建模不同物理角色,采用模态解耦去噪策略及损失权重衰减,引入跨步自动引导,增强物理动力学,提升物理一致性与视觉质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06516 2026-07-08 cs.CV 新提交 57%

Point as Skeleton: Accumulated Point Cloud Enhanced Autoregressive Generation for Closed-Loop Autonomous Driving Simulation

点作为骨架:累积点云增强自回归生成用于闭环自动驾驶模拟

Songbur Wong, Xiaosong Jia, Junqi You, Bo Zhang, Pei Xu, Renqiu Xia, Yuping Qiu, Shaofeng Zhang, Zelin Zhao, Xuechao Yan, Yuchen Zhou, Yurui Chen, Wen Guo, Hang Xu, Junchi Yan

机构 * Shanghai Jiao Tong University(上海交通大学) Yinwang Intelligent Technology Co., Ltd.(银望智能科技有限公司) Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对自动驾驶模拟难题,提出“点作为骨架”框架,通过自回归生成器结合多种条件合成视频,引入Reset-and-Roll支持闭环,用点云骨架稳定误差,实现基于nuPlan的闭环生成接口,实验证明其提升了闭环自回归生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06281 2026-07-08 cs.CV 新提交 57%

Straight-Path Flow Matching for Incomplete Multi-View Clustering

用于不完整多视图聚类的直线路径流匹配

Yiteng Yuan, Junyan Wang, Zheyuan Liu, Hong Jia, Lei Fan, Zhulin Tao, Lianbo Guo

机构 * School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件工程学院) Australian Institute for Machine Learning, Adelaide University(澳大利亚机器学习研究所,阿德莱德大学) University of Auckland(奥克兰大学) University of New South Wales(新南威尔士大学) Communication University of China(中国通信大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究不完整多视图聚类问题,提出基于直线路径流匹配的框架,通过线性插值路径用概率流替代扩散,集成视图完成与聚类对齐,实验证明该框架在标准基准上达最优性能。

Comments Accepted to ECCV 2026. 28 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05850 2026-07-08 cs.CV 新提交 57%

Breaking Spurious Correlations via Generative Randomization and Cross-Variant Self-Supervised Learning

通过生成式随机化和跨变体自监督学习打破虚假相关性

Suraj Yadav, Anjaneya Sharma, Siddharth Yadav

机构 * Indraprastha Institute of Information Technology Delhi(德里英迪拉甘地信息技术学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究针对深度神经网络在分布转移时因利用虚假相关性而失败的问题,提出两阶段框架,先通过生成式干预分离前景对象并生成变体,再引入跨变体自监督学习,经微调后在多个基准测试中取得优异最差组性能。

Comments Accepted at CVPR Workshop 2026 GCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05733 2026-07-08 cs.CV 新提交 57%

ARMS: Anchor-Relational Motion Streaming for Seamless Solo-Social Motion Transitions

ARMS:用于无缝单人-社交运动转换的锚定关系运动流

Huakun Liu, Qing Yu, Kent Fujiwara, Hideaki Uchiyama, Kiyoshi Kiyokawa

机构 * Nara Institute of Science and Technology(奈良科学技术研究所) LY Corporation(LY 公司)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究旨在从文本生成连续且连贯的人类运动。提出ARMS框架,统一单人运动和人际互动,引入动态不对称表示,用因果关系扩散模型及关系门控实现。实验表明其提升了转换平滑度与社会连贯性,在互动基准测试中表现良好。

Comments Accepted by ECCV 2026. Project page: https://hkliu.com/arms

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05352 2026-07-08 cs.CV cs.AI cs.LG 新提交 57%

Multiplayer Interactive World Models with Representation Autoencoders

基于表示自编码器的多智能体交互世界模型

Anthony Hu, Václav Volhejn, Adrien Ramanana Rahary, Chris Mulder, Aditya Makkar, Alyx Liao, Amélie Royer, Manu Orsini, Adam Jelley, Eloi Alonso, Florian Laurent, Fredrik Norén, James Swingos, Jan Hünermann, Kent Rollins, Lucas Hosseini, Matthieu Le Cauchois, Maxim Peter, Pim de Witte, Tim Brown, Vincent Micheli, Moritz Böhle, Gabriel de Marmiesse, Viktoriia Sharmanska, Lucia Specia, Michael Black, Patrick Pérez

机构 * Epic Games École nationale des ponts et chaussées(法国国家桥梁与道路学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对复杂物理交互的高动态环境,该研究提出首个多智能体世界模型,以多智能体动作流为条件训练隐扩散模型,可实时生成稳定长时四智能体对局,开源相关资源。

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05373 2026-07-07 cs.CV 新提交 57%

PixWorld: Unifying 3D Scene Generation and Reconstruction in Pixel Space

PixWorld:在像素空间中统一3D场景生成与重建

Sensen Gao, Zhaoqing Wang, Qihang Cao, Dongdong Yu, Changhu Wang, Jia-Wang Bian

机构 * Nanyang Technological University(南洋理工大学) AISphere(人工智能领域)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对3D场景生成与重建原有范式存在信息损失等缺陷,提出像素空间统一扩散框架PixWorld,引入几何感知损失,无需预训练自编码器,性能优于现有方法。

Comments Project page: https://sensengao.github.io/PixWorld/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05133 2026-07-07 cs.CV 新提交 57%

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation

UNIVERSE:面向自动驾驶的基于灵活掩码调制模态生成的统一视频动作模型

Mengmeng Liu, Diankun Zhang, Jiuming Liu, Jianfeng Cui, Hongwei Xie, Guang Chen, Hangjun Ye, Francesco Nex, Hao Cheng, Michael Ying Yang

机构 * University of Twente(特温特大学) Xiaomi EV(小米汽车) University of Cambridge(剑桥大学) University of Bath(巴斯大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对现有方案难以将视频建模收益迁移至轨迹生成的问题,提出单掩码调制扩散Transformer的统一模型,通过模态解耦掩码实现直接的视频监督,大幅提升跨域动作泛化与推理效率。

Comments 18 pages, 7 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05056 2026-07-07 cs.CV 新提交 57%

Consistent and Editable: A Balanced Framework for Text-Guided Video Editing

一致且可编辑:文本引导视频编辑的平衡框架

Tao Jin, Li Xiao

机构 * USTC(中国科学技术大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对视频编辑中时间一致性和可编辑性难以平衡的问题,提出EquiEdit框架。通过时间Mamba模块增强时间一致性,设计基于频谱变换的噪声注入策略提升可编辑性,实验证明该方法有效。

Comments 9 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04553 2026-07-07 cs.MM cs.AI 新提交 57%

Lights, Camera, Carbon: Architectural Scaling Laws for Video Generation Energy Consumption

灯光、相机、碳:视频生成能耗的架构缩放定律

Nidhal Jegham, Boris Gamazaychikov, Sasha Luccioni

机构 * University of Rhode Island, Sustainable AI Group(罗德岛大学,可持续人工智能小组) Sustainable AI Group(可持续人工智能小组)

专题命中 扩散模型 :diffusion(abstract);分类 cs.MM

AI总结 提出双向框架,从架构原理和生成参数估算文本到视频等模型能耗。正向预测能耗,反向从推理时间恢复架构缩放行为,基于视频扩散模型性质证明能耗服从缩放定律,为模型可持续性基准测试提供框架。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03875 2026-07-07 cs.CV 新提交 57%

MACRO: Training-free Multi-plane Attention for Closeup Render Optimization

MACRO:用于特写渲染优化的免训练多平面注意力

Nitzan Hodos, Roy Amoyal, Lior Fritz, Ianir Ideses, Sagie Benaim, Netalee Efrat

机构 * Amazon Prime Video(亚马逊Prime视频) Technion, Israel Institute of Technology(以色列理工学院) Ben Gurion University(本古里安大学) Hebrew University of Jerusalem(耶路撒冷希伯来大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对特写渲染难题,分析现有方法失败原因,提出MACRO,利用场景3D结构解决比例差距,无需架构改变和额外训练,贡献新基准和评估协议,取得领先成果。

Comments Project page: https://nitzanhod.github.io/MACRO

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02638 2026-07-07 cs.CV q-bio.QM 新提交 57%

CLABTOOLKIT: An Open-Source Toolkit for Routine Processing, Manipulation, and Visualization of Neuroimaging Data

CLABTOOLKIT:用于神经影像数据常规处理、操作和可视化的开源工具包

Yasser Alemán-Gómez, Nino Hervé, Patric Hagmann

机构 * Connectomics Lab, Department of Radiology, Lausanne University Hospital (CHUV)(洛桑大学医院(CHUV)放射科连接组学实验室) University of Lausanne (UNIL)(洛桑大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 神经影像研究面临数据结构多样、工具接口和格式不兼容问题。CLABTOOLKIT将相关操作整合为统一框架,核心数据结构可处理多种格式数据,还有多个模块支持多种分析及可视化,其配置系统方便定制工作流程。

Comments Presented at OHBM 2026 in Bordeaux, France. Submitted to Aperture Neuro

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02596 2026-07-07 cs.CV cs.LG 新提交 57%

CIPHER: Causal Intervention Pathways for Healthcare Equity and Robustness

CIPHER:用于医疗公平性和稳健性的因果干预路径

Xinyu Jia, Weidong Guo, Wangyuan Zhao, Yi Guo, Zeju Li, Yuanyuan Wang

机构 * College of Biomedical Engineering, Fudan University(复旦大学 生物医学工程学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究医疗诊断深度学习模型在敏感亚组间表现差异问题,基于结构因果模型揭示敏感属性影响图像内容的四条路径,引入CIPHER框架干预因果路径,提升诊断准确性并减少差异。

Comments 8 pages, 2 figures. Accepted by MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02516 2026-07-03 cs.CV 新提交 57%

Alignment Is All You Need For X-to-4D Generation

对齐即一切:X到4D生成

Qiaowei Miao, Kehan Li, Yawei Luo, Yi Yang

机构 * Zhejiang University(浙江大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出Align4D框架,通过物体距离对齐、运动-几何联合对齐和异步优化,实现任意模态输入到4D视频-3D对的生成,在X4D和Consistent4D数据集上达到最先进水平。

详情

展开后加载摘要…

URL PDF HTML 收藏