A Hierarchical Approach to Imitation Learning for Manipulation Tasks Requiring Time Varying Forces
针对需要时变力的操作任务的模仿学习的分层方法
专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI
AI总结 该研究针对接触密集拆卸任务中扩散策略的延迟问题,提出DPA-FTG分层方法,解耦高低频控制,在双手电池拆卸任务上性能优于RDP等基线。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
针对需要时变力的操作任务的模仿学习的分层方法
专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI
AI总结 该研究针对接触密集拆卸任务中扩散策略的延迟问题,提出DPA-FTG分层方法,解耦高低频控制,在双手电池拆卸任务上性能优于RDP等基线。
野外环境下的大语言模型服务:框架、方法与系统设计的实证研究
专题命中 多模态生成 :multimodal(abstract);分类 cs.AI
AI总结 本研究通过实证分析开源软件系统中5种LLM服务框架的应用情况,明确了框架使用特点、常用服务方法及应用场景,为相关人员提供了实践见解。
学习局部感知并与病理学语义临床对齐的放射学报告生成方法
专题命中 多模态生成 :image-text(abstract);分类 cs.CV
AI总结 针对放射学视觉-语言模型的图像-文本对齐缺陷,提出病理学感知对齐框架PALM,结合共享病理学原型与掩码证据建模,在多数据集上提升报告生成与异常鲁棒性
PosterMELD:面向可编辑打印就绪输出的可控设计多样性多智能体论文转海报生成
专题命中 多模态生成 :multimodal(abstract);分类 cs.AI
AI总结 PosterMELD是模板条件化多智能体海报生成流水线,可导出可编辑PPTX和PNG,在621篇论文实验中PRR达81.3%,成本仅为Codex+Skill的3.5%,性能优于P2P、PosterGen等方法。
Comments 9 pages, 5 figures, and 4 tables. Code and resources are available at https://github.com/Shannon4Science/PosterMELD
GeoCore-9B:面向地球观测的地理感知生成基础模型
专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV
AI总结 本文针对现有EO生成模型的地理空间约束冲突问题,推出90亿参数的GeoCore-9B,采用Flow Matching的DiT与地理空间元数据条件生成,结合地理空间语义对齐损失,在多项EO任务上实现最优性能。
Comments Please visit our project page at https://kaist-viclab.github.io/GeoCore-9B_site/
Remember-R1:通过强化学习缓解长上下文视觉遗忘
机构 * Northwestern Polytechnical University(西北工业大学) ; Hong Kong University of Science and Technology(香港科技大学) ; Zhejiang University(浙江大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 该研究针对多模态大语言模型的长上下文视觉遗忘问题,提出强化学习框架Remember-R1,通过过程级监督优化视觉依赖与注意力,提升了多模态推理性能。
Comments Accepted by ACM Multimedia 2026
Chimera:设计与遵循Chinchilla缩放规律的混合视觉扩散Transformer
机构 * Adobe Research(奥多比研究院)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 Chimera是一款混合视觉扩散骨干网络,结合KDA、MLA等模块与HeteroP缩放方案,训练出11B参数(2B激活)的模型,在计算效率、视频泛化等方面优于基线,为长上下文扩散架构设计提供基础。
Comments 40 pages
一次思考足矣:面向高分辨率视觉问答的中间层证据路由
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 本文针对高分辨率视觉问答提出无需训练的Thinking-Once证据路由方法,通过利用中间层留存的细粒度证据,在多个基准上提升性能并降低内存与推理时间。
StatePlay:用于机制一致性生成的状态感知游戏世界模型
机构 * Tencent(腾讯)
专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV
AI总结 本文提出StatePlay,一种状态感知游戏世界模型,采用混合Transformer架构联合预测视觉内容与游戏状态,经实验验证可提升游戏生成的机制保真度。
Comments Project Page: https://jimntu.github.io/stateplay_page/
$π\mathbf{R}^2$:反应式实时流策略
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI
AI总结 研究通用操作策略反应性和实时性问题,提出$\pi\mathbf{R}^2$方法,将条件分快速和慢速通道,采用延迟自适应流调度,能在保留大型主干等的同时,让策略实时反应并提高成功率。
Comments Preprint(20 pages). Under Review
凝视到文本生成:超越人类注意力的分类解码
机构 * Stony Brook University(纽约州立大学石溪分校) ; Australian Institute for Machine Learning(澳大利亚机器学习研究所) ; Adelaide University(阿德莱德大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 该研究提出将凝视解码为自然语言描述人类目标的新问题,构建Gazette框架,基于多模态大语言模型,利用新颖策略合成出声思考转录本并指令调优,使其在多任务凝视解码中达最优性能,能推断多样场景下人类目标意图。
Comments To appear in European Conference on Computer Vision (ECCV) 2026
Twins:使用焦点损失学习预测统一表示
机构 * Tencent-Hunyuan(腾讯混元)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 研究统一多模态模型潜在空间不匹配问题,提出Twins统一连续令牌空间。因联合建模有优化不平衡,采用焦点回归目标解决,在ImageNet上有gFID增益,在多模态理解基准测试中表现好,还提高了重建保真度。
Comments ICML 2026. Code: https://github.com/Tencent-Hunyuan/Twins
GroupVideo:多身份定制文本到视频生成
机构 * University of Chinese Academy of Sciences(中国科学院大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Ant Group(蚂蚁集团)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 研究多身份定制文本到视频生成问题,提出GroupVideo框架,融合多模态身份对齐及相关模块,构建高质量数据集,在生成多角色视频时能保持身份一致且动作自然,优于现有方法。
MagicMakeup:用于高保真妆容转移的区域可控扩散Transformer
机构 * Zhejiang University(浙江大学) ; State Key Lab of CAD&CG(计算机辅助设计与图形学国家重点实验室) ; vivo Mobile Communication Co., Ltd.(维沃移动通信有限公司) ; vivo BlueImage Lab(vivo蓝图像实验室)
专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV
AI总结 研究妆容转移中区域可控性等难题,提出MagicMakeup框架,基于空间约束和概念解缠结,用令牌对齐区域门控和跨模态感知指导实现精确编辑与概念澄清,设计数据生成管道并建立基准,提升了多方面性能和鲁棒性。
超越基于结构的药物设计:多药理学和多靶点药物设计中的几何深度学习
专题命中 多模态生成 :multimodal(abstract);分类 cs.AI
AI总结 研究针对多因素疾病治疗中传统药物设计的不足,将几何深度学习作为有力方法,综述其架构、应用于三个核心维度的情况,强调新兴算法,评估相关要素作用,阐明药物发现从偶然探索到理性、结构驱动的多药理学分子工程的范式转变。
SHFormer:用于自适应MRI重建的动态频谱滤波卷积神经网络和高通内核生成变压器
机构 * Indian Institute of Technology Madras (IITM)(印度理工学院马德拉斯分校) ; Healthcare Technology Innovation Centre(医疗技术创新中心) ; GE John F Welch Technology Center(通用电气约翰·F·韦尔奇技术中心)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 针对基于注意力机制的MRI重建模型在高频表示和多模态数据处理上的不足,提出含频谱滤波CNN和动态高通内核生成变压器的网络进行可扩展MRI重建,在未见场景下有良好重建效果,提升了PSNR和SSIM。
Comments Published in Neural Networks (Elsevier), Vol. 187, Article 107334, July 2025. DOI: 10.1016/j.neunet.2025.107334
Journal ref Neural Networks, Vol. 187, Article 107334, July 2025
STEREOFLOW:基于StereoDiT和过渡流匹配的渐进式立体匹配
机构 * School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) ; University of California, Berkeley(加州大学伯克利分校) ; University of Southern California(南加州大学) ; Google(谷歌公司) ; State Key Laboratory of Intelligent Manufacturing Equipment and Technology, Huazhong University of Science and Technology(华中科技大学智能制造装备与技术国家重点实验室) ; Tencent(腾讯公司) ; GigaAI(未知(可能是公司或组织,由于未找到确切对应中文名,按原文保留))
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 研究针对立体匹配问题,提出先验引导的生成框架StereoFlow,通过两阶段渐进级联匹配网络、像素扩散变压器StereoDiT和过渡流匹配实现高效优化,在多基准测试中取得多个最新结果,提升了立体匹配效果。
Comments 10 pages, 6 figures, submitted to TVCG
基于智能识别与生成的电子元件符号与引脚封装数据库
机构 * Ningbo Institute of Digital Twin, Eastern Institute of Technology(宁波数字孪生研究院,东方理工大学) ; Shanghai Jiao Tong University(上海交通大学) ; BTD Technology(BTD科技)
专题命中 多模态生成 :multimodal(abstract);分类 cs.AI
AI总结 研究利用多模态大语言模型开发电子元件符号和引脚封装智能识别与生成流程SFgen,其符号生成准确率86%,引脚封装生成准确率80%,并用此创建含1000个元件的SFnet数据库,为PCB设计自动生成奠定基础。
Comments Accepted by PRCV 2025
用于前列腺组织病理学的病理学家注意力对齐报告生成
机构 * Department of Computer Science, Stony Brook University(纽约州立大学石溪分校计算机科学系) ; Department of Biomedical Informatics, Stony Brook University(纽约州立大学石溪分校生物医学信息学系) ; Université Paris-Saclay, CentraleSupélec, Gustave Roussy, INSERM, IHU PRISM, Cancer Data Science Unit(巴黎萨克雷大学、中央理工高等电力学院、古斯塔夫·鲁西研究所、法国国家健康与医学研究院、PRISM综合大学医院、癌症数据科学单元) ; Université Paris-Saclay, CentraleSupélec, MICS Laboratory(巴黎萨克雷大学、中央理工高等电力学院、MICS实验室) ; Department of Pathology and Laboratory Medicine, Northwell Health Laboratories(诺斯韦尔健康实验室病理与检验医学部) ; Department of Pathology, University of Utah School of Medicine(犹他大学医学院病理系) ; Department of Psychology, Stony Brook University(纽约州立大学石溪分校心理学系)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 研究将人类注意力引入前列腺病理报告生成模型训练,收集多模态数据集,通过注意力对齐损失微调模型,在两个模型上评估,在报告生成和视觉问答任务中取得较好效果,模型注意力图与病理学家注意力更对齐。
Comments 11 pages, 4 figures, accepted for publication at the 29th International Conference on Medical Image Computing and Computer-Assisted Intervention (MICCAI 2026)
后验采样是医学图像翻译中缺失模态的生成器
机构 * Sungkyunkwan University(成均馆大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 针对医学图像因时间和协议限制存在缺失模态的问题,提出统一框架,将缺失模态生成视为联合分布下的线性逆问题,通过后验采样及流匹配模型解决,在多数据集实验中性能优于基线,下游肿瘤分割表现更好。
Comments ECCV 26
FlowMimic:基于像素对扭曲流场的无掩码视觉编辑与生成,用于在线视频编辑数据生成及模态模仿
专题命中 多模态生成 :MLLM(abstract);分类 cs.CV
AI总结 研究探索在单一模型中整合视频和图像模态的生成与编辑能力,开发像素对时间扭曲流场实时生成视频编辑样本,设计模态模仿损失对齐模态能力,引入相关任务及损失让模型内化基于语言的视觉编辑能力。
Comments Due to file size constraints, the figures in the arXiv file have been heavily lossy-compressed. Please visit the uncompressed file at: https://huggingface.co/datasets/FlowMimic/Uncompressed/blob/main/main.pdf
ST-Veto:通过泰勒预测和视觉基础实现用于扩散多模态语言模型的时空令牌否决
专题命中 多模态生成 :multimodal(abstract);分类 cs.AI
AI总结 研究针对扩散多模态大语言模型推理不足问题,提出无需训练的ST-Veto方法,利用二阶泰勒预测和图像注意力质量否决不稳定及弱基础令牌,与更安全候选交换,在多基准测试中优于其他方法,提升准确率且无额外成本。
Comments ICML 2026 - main
动态防御剖析实现文本到图像模型的认知越狱
机构 * Alibaba Tongyi Lab(阿里巴巴通义实验室)
专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI
AI总结 研究文本到图像模型易受对抗性滥用问题,提出MIND认知越狱框架,将对抗提示生成重构为信念状态推理,集成多模态判断器等组件,经实验验证其在多个防御设置下显著优于现有方法,有效实现越狱生成。
Comments 12 pages, 3 figures
VecFontLLM:基于锚点引导的中文矢量字体直接合成
机构 * Fuzhou University(福州大学) ; Peking University(北京大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 研究旨在解决直接生成中文矢量字体的难题,提出VecFontLLM这一基于锚点引导的多模态大语言模型,通过锚点预测、细化及贝塞尔控制点完成来合成矢量字形,实现高质量少样本合成,实验显示其相比现有方法有显著优势。
Comments 12 pages
STBridge:用于在统一多模态模型中弥合理解与生成的共享目标对齐
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 研究统一多模态模型中理解与生成的对齐差距,提出STBridge共享目标对齐框架,通过共同目标状态连接二者,采用对齐然后优化策略,经实验验证该框架能缩小模型描述与生成间差距,有效弥合理解与生成。
UniNDM:文本到图像生成中针对性内容的统一噪声驱动检测与缓解框架
机构 * Institute of Artificial Intelligence, State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北京航空航天大学虚拟现实技术与系统国家重点实验室人工智能研究院) ; College of Artificial Intelligence, Tsinghua University(清华大学人工智能学院) ; Security Department, Alibaba Group(阿里巴巴集团安全部) ; School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-Sen University(中山大学深圳校区网络科学与技术学院)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 针对文本到图像生成易受隐式性提示影响的问题,提出UniNDM统一噪声驱动框架。利用早期预测噪声的可分离性开发轻量级检测器,引入噪声增强自适应负引导缓解问题,扩展到扩散变压器架构,实验显示比现有方法有显著改进。
Comments 18 pages, 10 figures, accepted by TPAMI
尽管语言模型在努力时会出错:用于自我纠正科学生成的共形预测
专题命中 多模态生成 :multimodal(abstract);分类 cs.CL
AI总结 研究针对大语言模型生成技术内容常违反科学原理的问题,提出图结构共形预测框架SFC,将科学推理分解为单元,考虑逻辑依赖,通过实时验证和动态分支纠错,在多基准测试中表现出色,提升准确率、有效性并减少定律违反。
Comments 25 pages
FedDP-PALD:一种用于医学数据合成的具有原型聚合的隐私保护联邦潜在扩散框架
机构 * BRAC University(BRAC大学) ; York University(约克大学) ; University of Maryland(马里兰大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 针对医学数据合成中隐私保护及合成数据预测结构问题,提出FedDP-PALD框架,通过带掩码的门控多头注意力联合处理多模态数据,引入DP-PMA维持差分隐私,实验表明该框架能生成隐私合成表示,保持决策性能并抵抗成员推理。
通过基于 SAM 的伪标注和基于状态空间交互的扩散进行弱监督 RGB-D 显著目标检测
机构 * School of Communication and Information Engineering, Shanghai University(上海大学通信与信息工程学院) ; School of Computer Science and Engineering, Nanyang Technological University(南洋理工大学计算机科学与工程学院)
专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV
AI总结 研究弱监督 RGB-D 显著目标检测,提出由 SAM-PAG 和 $S^2$Diff 组成的方法,前者扩展稀疏涂鸦为伪标注,后者在条件信息引导下细化显著图,二者合作使方法性能优异。
Comments 13 pages, 9 figures, accepted by IEEE TMM
VQ-Touch:一种跨传感器和场景的数据高效触觉生成框架
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 研究旨在解决现有触觉生成方法依赖特定传感器数据集且泛化能力不足的问题。提出VQ-Touch框架,含DM-VQGAN提取特征及离散扩散解码器支持多模态生成,经少样本混合训练增强泛化能力,实验显示其在多任务中超越现有方法。
Comments 6 pages, 5 figures