arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 3280 信号源:cs.CV, cs.GR, cs.MM

1. 个性化与一致性 76 篇

2607.12592 2026-07-15 cs.CV 新提交 57%

WanToFight: Real-Time Generative Game Engine for Multi-Player Combat Interaction

WanToFight:用于多人战斗交互的实时生成游戏引擎

Li Hu, Guangyuan Wang, Peng Zhang, Bang Zhang

机构 * Alibaba Tongyi Lab(阿里巴巴通义实验室)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 WanToFight是用于多人战斗交互的实时生成游戏引擎,基于Wan-1.3B视频扩散变换器构建三个组件,解决了先前引擎未共同处理的问题,能结合多种玩法,在特定配置下维持30FPS,是首个此类集成系统。

Comments Project Page: https://humanaigc.github.io/wantofight/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11919 2026-07-15 cs.NE cs.AI cs.CV cs.LG 新提交 57%

Do You Remember? Toward Memory-Centric Multimodal AI

你还记得吗?迈向以记忆为中心的多模态人工智能

Xuguang Yu, Weigang Zheng, Minyue Yu

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 研究针对当前多模态语言模型缺乏重建性记忆的问题,提出DoYouRemember三阶段架构,通过VQ-VAE、LoRA微调语言模型和扩散解码器实现,经实验发现语言模型隐藏状态视觉信息少,还解决了共享记忆矩阵训练问题,统一相关发现于信息论框架。

Comments 43 pages, 8 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04677 2026-07-07 cs.CV 新提交 57%

AnyStyle: A Single LoRA is Sufficient for Image-Guided Style Transfer

AnyStyle:单个LoRA足以实现图像引导的风格迁移

Yongwen Lai, Chaoqun Wang

机构 * School of Artificial Intelligence, South China Normal University(华南师范大学人工智能学院)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 研究图像引导风格迁移,指出基于扩散方法存在内容与风格解缠难题。提出AnyStyle框架,采用统一单适配器范式,结合无训练结构引导,提升可控性与稳定性,实验显示性能优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02957 2026-07-07 cs.CV 新提交 57%

ReLo-IRR: Reflection-Guided LoRA Framework for Image Reflection Removal

ReLo-IRR:用于图像反射去除的反射引导LoRA框架

Chaoqun Wang, Yuehuan Wei, Haoxiang Cao, Shaobo Min

机构 * School of Artificial Intelligence, South China Normal University(南方科技大学人工智能学院) University of Science and Technology of China(中国科学技术大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 针对单图像反射去除问题,提出基于整流流模型的ReLo-IRR框架。设计轻量级估计器预测反射强度描述符,引入时间条件机制,联合建模反射强度和去噪动态,有效抑制不同反射条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01442 2026-07-03 cs.CR cs.CV 新提交 57%

From Forgeries to Foundation Models: A Systematic Survey of Identity Document Attack and Detection

从伪造到基础模型:身份证件攻击与检测的系统性综述

Gourab Das, Pavan Kumar C, Raghavendra Ramachandra

专题命中 个性化与一致性 :inpainting(abstract);分类 cs.CV

AI总结 本文系统综述了身份证件伪造攻击(物理呈现、数字注入、生成式合成)及检测方法,揭示了基准与现实间的差距,并发现最强模型在零样本场景下APCER超25%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14746 2026-07-03 cs.CV 新提交 57%

Style-CCL: Content-Preserving Style Transfer via Curriculum Continual Learning

Style-CCL:通过课程持续学习实现内容保持的风格迁移

Shiwen Zhang, Haoyuan Wang, Xianghao Zang, Haibin Huang, Chi Zhang, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究院)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 针对扩散变换器在风格迁移中内容与风格特征纠缠的问题,提出多阶段课程持续学习框架Style-CCL,通过从语义到纹理风格、从干净到合成数据的分阶段训练,并采用随机记忆排练防止灾难性遗忘,在风格相似性、内容一致性和美学质量上达到最优。

Comments code and models of QwenStyle are released at https://github.com/witcherofresearch/Qwen-Image-Style-Transfer/ and https://github.com/Tele-AI/TeleStyle/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27880 2026-06-29 cs.CV 新提交 57%

OrthoTryOn: Geometric Orthogonalization for Conflict-Free Unified Fashion Generation

OrthoTryOn:面向无冲突统一时尚生成的几何正交化

Zhaotong Yang, Ying Tai, Jiahui Zhan, Yu Zheng, Jianjun Qian, Jian Yang

机构 * PCA Lab, School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院PCA实验室) PCA Lab, School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院PCA实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 提出OrthoTryOn框架,通过正交子空间投影和Fisher引导负向引导解决统一时尚生成中任务间梯度冲突,实现多任务协同优化。

Comments Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23950 2026-06-24 cs.CV 新提交 57%

DivRL: Disentangled Self-Similarity Rewards for Diverse Subject-Driven Generation

DivRL: 解耦自相似性奖励用于多样化主题驱动生成

Qian Wang, Zhenyu Li, Abdelrahman Eldesokey, Peter Wonka

机构 * KAUST(阿卜杜拉国王科技大学)

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV

AI总结 提出DivRL框架,通过解耦视觉特征中的负自相似性度量(nSSM)和视觉语义匹配(VSM),采用“探索-抑制”策略联合优化身份一致性与结构多样性,解决主题驱动生成中的身份-多样性悖论。

Comments Accepted to ECCV 2026. Project page: https://qianwangx.github.io/DivRL/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23254 2026-06-23 cs.CV cs.AI 新提交 57%

SteerVTE: Seamless Video Text Editing with Style and Glyph Control

SteerVTE: 具有风格和字形控制的无缝视频文本编辑

Kai Zeng, Moran Li, Zhengwei Wang, Yingchen Yu, Yiheng Lin, Ruichuan An, Ming Lu, Qi She, Wentao Zhang

机构 * Peking University(北京大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 提出SteerVTE框架,通过风格编码器和双粒度字形编码器控制冻结视频扩散模型,结合字形感知空间焦点损失和三阶段渐进训练,实现精确、连贯的视频文本编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18753 2026-06-18 cs.CV 新提交 57%

SMART: A Flexible, Interpretable, and Scalable Spatio-temporal Brain Atlas from High-Resolution Imaging Data

SMART:一种灵活、可解释且可扩展的高分辨率成像数据时空脑图谱

John Kalkhof, Boris Gutman, Emile d'Angremont, Daniel C. Alexander, Marco Lorenzi

机构 * Illinois Institute of Technology(伊利诺伊理工学院) Amsterdam University Medical Center(阿姆斯特丹大学医学中心) University College London(伦敦大学学院)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 提出SMART框架,通过解耦全局疾病动态与患者特定解剖表现,学习连续疾病时间图谱,实现高分辨率3D医学图像中时空变化的灵活、可解释和可扩展建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18156 2026-06-17 cs.CV cs.AI 新提交 57%

ReAge3D: Re-Aging 3D Faces with View Consistency

ReAge3D:具有视角一致性的3D人脸回龄

Libing Zeng, Li Ma, Mingming He, Ning Yu, Paul Debevec, Nima Khademi Kalantari

机构 * Texas A&M University(德克萨斯农工大学) Netflix Eyeline Studios

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 提出ReAge3D框架,通过2D扩散模型DiffReaging和中心向外编辑传播策略,实现多视角一致的3D人脸回龄,保持身份和细节,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17296 2026-06-17 cs.CV 新提交 57%

Pareto LoRA: Mitigating Modality Imbalance in Unified Multimodal Models via Pareto-Optimal Gradient Integration

Pareto LoRA:通过帕累托最优梯度集成缓解统一多模态模型中的模态不平衡

Xiwen Wei, Mark Nutter, Madhusudhanan Srinivasan, Radu Marculescu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Advanced Micro Devices, Inc.(超威半导体公司)

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV

AI总结 针对统一多模态模型在LoRA微调中语言梯度主导优化导致图像生成质量下降的问题,提出帕累托最优梯度集成策略Pareto LoRA,通过调节梯度方向和强度平衡文本与图像目标,在CoMM基准上显著提升图像感知质量达44.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14162 2026-06-15 cs.CV 新提交 57%

VideoWeave: Unlocking Geometric Consistency in Video Generation via Joint Geometry-Video Modeling

VideoWeave: 通过联合几何-视频建模解锁视频生成中的几何一致性

Xunzhi Xiang, Zixuan Duan, Yabo Chen, Zhengxuan Wei, Guiyu Zhang, Zixiao Gu, Zhe Gao, Haibin Huang, Chi Zhang, Qi Fan, Xuelong Li

机构 * Nanjing University(南京大学) Institute of Artificial Intelligence, China Telecom (TeleAI)(中国电信人工智能研究院(TeleAI)) Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 提出VideoWeave,一种在潜在空间后训练框架,利用隐式几何模型特征约束生成分布,缓解几何重建误差,提升视频几何一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11783 2026-06-11 cs.CV 新提交 57%

A Comprehensive Ecosystem for Open-Domain Customized Video Generation

开放域定制视频生成的综合生态系统

Jingxu Zhang, Yuqian Hong, Daneul Kim, Kai Qiu, Qi Dai, Jianmin Bao, Yifan Yang, Xiaoyan Sun, Chong Luo

机构 * University of Science and Technology of China(科学技术大学) Microsoft Research Asia(微软亚洲研究院) Seoul National University(首尔国立大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 提出百万级数据集PexelsCustom-1M和参数高效框架CustoMDiT,仅用8%额外参数实现定制视频生成,并构建千类基准OpenCustom,开源整个生态系统。

Comments 5 pages, 3 figures, 4 tables. Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11670 2026-06-11 cs.CV cs.AI 新提交 57%

ARGUS: Stacked Multi-View Identity Mosaic Injection for Subject-Preserving Video Generation

ARGUS: 堆叠多视角身份马赛克注入用于主体保持的视频生成

Zijie Meng, Jiwen Liu, Yufei Liu, Chengzhuo Tong, Xiaoqiang Liu, Yuanxing Zhang, Yulong Xu, Pengfei Wan

机构 * Peking University(北京大学) Kuaishou Technology(快手科技) Xiamen University(厦门大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 提出ARGUS框架,通过堆叠多视角身份马赛克注入(SMII)将身份表示为紧凑动态分布,结合MLLM身份导演、无交叉对反事实训练等模块,在主体保持视频生成中达到SOTA。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10620 2026-06-10 cs.CV cs.AI 新提交 57%

Can Image Models Imagine Time? ImageTime: A Novel Benchmark for Probing Visual World Modeling Through Spatiotemporal Consistency

图像模型能想象时间吗?ImageTime:通过时空一致性探究视觉世界建模的新基准

Xinrui Wu, Lichen Huang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV

AI总结 提出ImageTime基准,通过四关键帧协议(初始状态、动作开始、过渡状态、最终状态)评估图像生成模型在时空一致性上的表现,揭示模型在维持连贯视觉世界状态方面的能力与不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08780 2026-06-09 cs.CV 新提交 57%

Beyond Consistency: Preserving Temporal Structure in Zero-Shot Video Editing

超越一致性:在零样本视频编辑中保留时间结构

Deyin Liu, Yisheng Ding, Zhe Jin, Xiatian Zhu, Anjan Dutta, Lin Wu

机构 * Anhui University(安徽大学) University of Surrey(萨里大学) University of Warwick(华威大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 提出一种零样本视频编辑方法,通过自适应分割视频片段、选取锚帧和令牌合并策略,首次显式保留源视频的时间结构,平衡编辑保真度与计算效率。

Journal ref Pattern Recognition, Vol. 180, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07185 2026-06-08 cs.CV 新提交 57%

AdaTok: Self-Budgeting Image Tokenization with Quality-Preserving Dynamic Tokens

AdaTok: 具有质量保持动态令牌的自预算图像令牌化

Xiaocheng Lu, Yuxi Chen, Jie Zhang, Jian Liu, Jingcai Guo, Fangqi Zhu, Tao Han, Song Guo

机构 * The Hong Kong University of Science and Technology(香港科技大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV

AI总结 提出AdaTok,一种自预算离散一维令牌化器,通过表示-分配协同设计(优先表示学习和自适应令牌分配)实现图像自适应令牌数量,在保持重建质量的同时减少平均令牌数。

Comments Preprint; 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13925 2026-08-17 cs.LG cs.AI cs.CL 新提交 50%

CForce: Boosting Parallel Decoding for dLLMs via Consistency Forcing

CForce:通过一致性强制提升扩散大语言模型(dLLMs)的并行解码性能

Yuji Ren, Chenkai Xu, Zhuocheng Gong, Jianguo Li, Zhijie Deng

机构 * Shanghai Jiao Tong University(上海交通大学) Ant Group(蚂蚁集团)

专题命中 个性化与一致性 :diffusion(abstract)

AI总结 本文提出CForce方法,通过一致性强制提升dLLMs的并行解码性能,在LLaDA模型上实验证实其在高并行解码预算下可优化速度-质量权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02828 2026-08-05 math.ST math.PR q-fin.ST stat.TH 新提交 50%

Proper-score observation-driven filters: local geometry, estimation, and continuous-time limits

恰当评分观测驱动滤波器:局部几何、估计与连续时间极限

Giulia Livieri, Gianluca Palmari

专题命中 个性化与一致性 :diffusion(abstract)

AI总结 该研究提出基于恰当评分规则的观测驱动滤波器,推导其局部动力学、渐近性质与连续时间极限,通过实验验证其在金融收益数据中的应用,为误设下的观测驱动滤波提供准则框架。

Comments 88 pages, 12 figures, 25 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27512 2026-07-31 cs.CL cs.MA cs.SI 新提交 50%

Belief Coevolution in a Social Network of Generalist and Specialist Large Language Models

通用型与专家型大语言模型组成的社交网络中的信念协同演化

Germans Savcisens, Samantha Dies, Courtney Maynard, Tina Eliassi-Rad

机构 * Khoury College of Computer Sciences, Northeastern University(东北大学库尔计算机科学学院) Network Science Institute, Northeastern University(东北大学网络科学研究所) Santa Fe Institute(圣塔菲研究所)

专题命中 个性化与一致性 :diffusion(abstract)

AI总结 该研究提出CoevolveSim框架,模拟通用型与专家型LLM组成的社交网络中信念扩散,发现专家型LLM可显著提升共识转变幅度,模拟多智能体LLM系统信念扩散需多样化底层LLM。

Comments 33 pages (14 pages of main text), 7 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22637 2026-07-28 cs.AI cs.IT math.IT 新提交 50%

Fast Cross-Scenario Adaptation of CSI Models via Channel Conditional Parameter Generation

通过信道条件参数生成实现CSI模型的快速跨场景自适应

Xudong Zou, Siyu Wu, Zunlei Feng, Jie Song, Yuanyu Wan, Mingli Song, Jiacong Hu

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) State Key Laboratory of Blockchain and Data Security, Zhejiang University Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(浙江大学杭州高新技术产业开发区(滨江)区块链与数据安全国家重点实验室)

专题命中 个性化与一致性 :diffusion(abstract)

AI总结 研究针对CSI模型在不同场景适应性差的问题,提出CCPG方法,通过组件冻结实验识别瓶颈,生成轻量级LoRA权重,经多种技术处理实现快速跨场景自适应,实验表明该方法能高效部署CSI模型用于6G通信。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21620 2026-07-27 cs.AI 新提交 50%

From Profiles to Steering Vectors: Global Sparse Priors and Local Semantic Calibration for Personalized Text Generation

从概要到导向向量:用于个性化文本生成的全局稀疏先验和局部语义校准

Liuji Chen, Zeyu Zhang, Xinyuan Zhang, Shuai Nie, Qiang Liu, Shu Wu, Liang Wang

机构 * NLPR, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别国家重点实验室) Xiaomi(小米)

专题命中 个性化与一致性 :personalized generation(abstract)

AI总结 研究个性化文本生成问题,提出无训练框架GLASS,通过全局-局部激活导向与稀疏先验实现。利用稀疏自动编码器提取全局先验、构建局部向量,推理时注入模型层。实验证明其性能优于基线,能更好分离风格与语义信息。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20127 2026-07-23 cs.CL 新提交 50%

Back to Back with a Copy: A Computational Analysis of AI-Generated Visual Contemporary Art Pastiches

与仿作并肩:人工智能生成的视觉当代艺术模仿作品的计算分析

Anca Dinu, Andreiana Mihail, Andra-Maria Florescu, Claudiu Creanga, Liviu Dinu

机构 * University of Bucharest(布加勒斯特大学)

专题命中 个性化与一致性 :image generation(abstract)

AI总结 本文研究更新的生成模型模仿当代艺术作品的能力及不同语言模型中风格评估的多维度一致性。利用五个计算机视觉模型,通过余弦距离捕捉多种特征,对比新旧模型。结果显示新模型语义对齐改进、多样性增加,但浅层特征表现稍弱,还通过艺术家反馈进行情境化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15643 2026-07-20 math.NA cs.NA 新提交 50%

Penalty-scaling effects in nonsymmetric interior-penalty DG discretizations of viscous rotating shallow-water equations

粘性旋转浅水方程非对称内罚 DG 离散化中的罚标度效应

Xue Zhang, Jingmin Xia, Xu Qian

专题命中 个性化与一致性 :diffusion(abstract)

AI总结 研究粘性旋转浅水方程非对称内罚 DG 离散化中内罚参数标度的影响,通过局部 Lax--Friedrichs 通量近似双曲项,比较$\beta = 1$和$\beta = 3$,建立相关性质,经测试表明标准标度在精度-成本折衷上表现更好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10820 2026-07-14 stat.ME 新提交 50%

Causal Estimation of Share-Induced Engagement with Flywheel Effects

基于飞轮效应的分享诱导参与度的因果估计

Weitao Cheng, Yilin Li, Yong Wang, Nian Si

专题命中 个性化与一致性 :diffusion(abstract)

AI总结 研究在线平台分享功能的飞轮效应,开发考虑干扰的实验框架,提出基于流量平衡恒等式的估计器,降低偏差,建立A/A测试程序,扩展到用户级指标,并用真实平台验证方法。

Comments Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25169 2026-07-02 math.ST cs.LG stat.TH 新提交 50%

Laplace-Fisher Gate Identities for Optimal Matrix-Gated Blended Score Estimation

Laplace--Fisher 门恒等式用于最优矩阵门控混合得分估计

Alois Duston, Tan Bui-Thanh

机构 * The Oden Institute for Computational Engineering and Sciences(奥登计算工程与科学研究院) The University of Texas at Austin(德克萨斯大学奥斯汀分校) The Department of Aerospace Engineering & Engineering Mechanics(航空航天工程与机械系)

专题命中 个性化与一致性 :diffusion(abstract)

AI总结 针对非归一化目标采样中的得分估计问题,提出矩阵值门控混合得分估计方法,推导出方差最优门公式(Laplace-Fisher 门恒等式),并证明有限参考一致性,应用于贝叶斯逆问题的归一化密度评估。

Comments Provisional report

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26618 2026-06-26 cs.CL 新提交 50%

Closing the Quality Gap in Low-Resource Text-to-Speech: LoRA Fine-Tuning of VoxCPM2 for Khmer and Korean

缩小低资源文本转语音的质量差距:针对高棉语和韩语的VoxCPM2 LoRA微调

Phannet Pov, Sovandara Chhoun, Hyun Woo Park, Wan-Sup Cho, Saksonita Khoeurn

机构 * Department of Big Data, Chungbuk National University(Chungbuk National University大数据系) Institute of Digital Research and Innovation, Cambodia Academy of Digital Technology(柬埔寨数字技术研究院) Department of Management Information Systems, Chungbuk National University(Chungbuk National University管理信息系) BigData Labs Co., Ltd.(BigData Labs公司)

专题命中 个性化与一致性 :diffusion(abstract)

AI总结 针对高棉语和韩语,使用LoRA微调VoxCPM2模型,在仅训练0.19%-3.03%参数的情况下,高棉语MOS从3.85提升至4.23,而韩语无提升,表明适配主要帮助基础模型表现差的语言。

Comments 5 pages, 1 figure, 4 tables. IEEE conference format (IEEEtran)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20532 2026-06-19 cs.AI 新提交 50%

How Do Instructions Shape Speech? Cross-Attention Attribution for Style-Captioned Text-to-Speech

指令如何塑造语音?面向风格描述文本到语音的交叉注意力归因

Nityanand Mathur, Hamees Sayed, Wasim Madha, Apoorv Singh, Sameer Khurana, Akshat Mandloi, Sudarshan Kamath

专题命中 个性化与一致性 :diffusion(abstract)

AI总结 提出交叉注意力归因方法,分析风格描述文本到语音系统中单词对声学输出的影响,发现风格标记在早期步骤和深层注意力峰值,且与基频和能量相关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15148 2026-06-17 cs.RO cs.AI 新提交 50%

MimicIK: Real-Time Generative Inverse Kinematics from Teleoperation with FK Consistency

MimicIK: 基于遥操作且保持正运动学一致性的实时生成式逆运动学

Jiahao Yang, Shenhao Yan, Fan Feng, Chengsi Yao, Ge Wang, Zhixin Mai, Yiming Zhao, Yatong Han

机构 * Ising AI CUHK-Shenzhen(香港中文大学(深圳))

专题命中 个性化与一致性 :diffusion(abstract)

AI总结 提出MimicIK框架,利用条件流匹配从遥操作数据学习平滑鲁棒的关节空间运动先验,通过两阶段迭代优化和正运动学一致性损失实现实时逆运动学求解,在6-DOF机器人数据集上达到4.65mm位置误差和92.01%成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏