arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 3280 信号源:cs.CV, cs.GR, cs.MM

1. 图像生成评测 68 篇

2608.04349 2026-08-06 cs.CV 新提交 57%

Poly-OPD: Heterogeneous Multi-Teacher On-Policy Distillation for Capability-Selectable Flow Models

Poly-OPD:用于能力可选流模型的异构多教师在线策略蒸馏

Siming Fu, Haojun Xu, Ruizhe He, Zheming Fu, Hualiang Wang, Jie Huang, Xiaoxiao Ma, Mingchen Zhong, Weihu Huang, Xiaoxuan He, Linjiang Huang, Si Liu

专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV

AI总结 Poly-OPD框架通过异构多教师在线策略蒸馏,将FLUX.1-dev和Z-Image的互补优势整合到25亿参数的SD3.5-Medium模型,提升了文本到图像生成的GenEval与DrawBench指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01848 2026-08-04 cs.CV 新提交 57%

Decoupling semantics from vision: A framework for faithful visual-text compression evaluation

将语义与视觉解耦:一种用于可靠视觉-文本压缩评估的框架

Yonghan Gao, Zehong Chen, Lijian Xu, Jingzhi Chen, Jingwei Guan, Xingyu Zeng

机构 * Shenzhen University of Advanced Technology(深圳先进技术大学) Shenzhen Technology University(深圳技术大学)

专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV

AI总结 本研究针对现有视觉-文本压缩评估依赖下游任务性能的缺陷,提出解耦语义与视觉的评估框架,引入ZeroSense基准消除文本依赖,实验证实VTC质量与下游任务准确率存在显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29679 2026-08-03 cs.CV 新提交 57%

Scaling Properties of Text Conditioning in Visual Generation

视觉生成中文本条件的缩放特性

Zilong Chen, Chaorui Deng, Kunchang Li, Hongyi Yuan, Haoqi Fan

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 该研究探究视觉生成中文本条件的缩放特性,采用GPG、ED量化结构化语言,据此构建结构化提示并训练提示生成器,所得系统在多基准上超越多数开放权重模型、匹配或超越最强封闭权重模型。

Comments Code: https://github.com/heheyas/context-scaling Models: https://huggingface.co/collections/heheyas/context-scaling Demo: https://heheyas-context-scaling.hf.space/ Project page: https://heheyas.github.io/context-scaling

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24560 2026-07-28 cs.CV cs.AI 新提交 57%

EgoPlay: Event-Triggered Video Editing for Egocentric Streams

EgoPlay:用于第一人称视角视频流的事件触发式视频编辑

Jinjie Mai, Gordon Guocheng Qian, Willi Menapace, Arpit Sahni, Chaoyang Wang, Ashkan Mirzaei, Runjia Li, Sergey Tulyakov, Bernard Ghanem, Peter Wonka, Rameen Abdal

机构 * Snap Inc.(Snap公司) King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 研究第一人称视角视频流编辑问题,提出EgoPlay,通过微调预训练模型,在单个端到端模型中联合学习事件识别等,构建数据集训练双向视频扩散编辑器,在Ego4D基准测试中表现出色,优于现有基线。

Comments Accepted to SIGGRAPH Asia 2026 as a Conference Paper. Project page: https://egoplay2026.github.io/egoplay

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22745 2026-07-28 cs.CV cs.AI 新提交 57%

AI-generated Images Challenge Visual Trust in High-risk Scenarios

人工智能生成的图像在高风险场景中挑战视觉信任

Yi-Zhi Wang, Yichen Xiao, Linan Yue, Weibo Gao, Yichao Du, Pengfei Fang, Shimin Di, Min-Ling Zhang

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 研究聚焦人工智能生成图像在高风险场景下对视觉信任的挑战,提出SafeIMG基准,涵盖12个安全场景。评估专门探测器和视觉语言模型,发现它们检测可靠性不足,模型解释覆盖低,表明当前探测器在多方面欠缺,难以可靠评估此类图像。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22352 2026-07-27 cs.CV cs.AI eess.IV 新提交 57%

Time-Reversed Imaging: A Multimodal Benchmark and Framework for Reconstructing Past Human-Environment Interactions

时间反转成像:用于重建过去人类与环境交互的多模态基准和框架

Jorge Bacca, Kebin Contreras, Luis Toscano-Palomino, Mauro Dalla Mura

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 研究提出时间反转成像范式,通过TRACE-HEI数据集及多模态推理方法,从热、紫外和可见光谱中残余物理印记推断过去人类与环境交互,为时间反转成像奠定基础,开辟场景理解新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19923 2026-07-23 cs.CV 新提交 57%

WearWow: Native 2K Multi-Garment Virtual Try-On via Adaptive Token Packing and Preference Alignment

WearWow:通过自适应令牌打包和偏好对齐实现原生2K多服装虚拟试穿

Xujie Zhang, Runyan Du, Song Chang, Jiang Li, Dongliang Shao, Liping Wu, Wei Luo, Xiaochao Qu, Luoqi Liu, Xiaodan Liang

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Meitu Lab(美图实验室)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 研究针对原生2K多服装虚拟试穿难题,提出WearWow框架。用自适应2D令牌打包减轻内存爆炸,多维试穿奖励系统纠正纹理退化,还构建高质量数据集。实验证明该框架在原生2K多服装合成上达新水平,超越现有商业基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14194 2026-07-17 cs.CV cs.LG 新提交 57%

Inference-Time Concept Suppression and Video-Centric Evaluation for Text-to-Video Models

文本到视频模型的推理时概念抑制和以视频为中心的评估

Wenxuan Chen, Wenjie Feng

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV

AI总结 研究文本到视频模型中可控去除目标概念的问题,提出无训练推理时框架SIRUS,通过定位目标相关提示证据抑制目标表达,引入视频导向评估框架,在多个概念上实验表现出色,能在不同骨干上泛化。

Comments 29 pages, 9 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08497 2026-07-10 cs.CV cs.AI cs.CL cs.LG 新提交 57%

Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing

用于多模态理解、生成和编辑的认知结构多模态智能体

Feng Wang, Canmiao Fu, Zhipeng Huang, Chen Li, Jing Lyu, Ge Li

机构 * Peking University(北京大学) Tencent Inc(腾讯公司)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 研究针对统一多模态模型在长时多模态对话中的局限,提出认知结构多模态智能体,通过外化视觉信息等方式改进。开发统一场景引擎,构建评估基准。实验显示该智能体检索准确率高、推理时间减半,还介绍了工具包,为长时多模态智能体提供新范式。

Comments 16 pages, 7 figures, 8 tables. Project page: https://caseclose.github.io/cma-harness/ Code: https://github.com/caseclose/cma-harness

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04796 2026-07-07 cs.GR 新提交 57%

Glare Mitigation using a Differentiable Unified Glare Rating

使用可微统一眩光评级减轻眩光

Linas Beresna, Eugene Fiume

专题命中 图像生成评测 :image generation(abstract);分类 cs.GR

AI总结 研究利用可微光传输,引入连续可微的UGR代理,解决低样本密度下蒙特卡洛方差导致的优化不稳定,通过可调Sigmoid边界替换离散UGR阶梯函数,在多领域减轻眩光,提供优化视觉舒适度的管道。

Comments 15 pages, 16 figures. Published in Proceedings of the Eurographics Symposium on Rendering (EGSR) 2026, Symposium Track. This is the authors' version; the definitive version is available at the Eurographics Digital Library

Journal ref Eurographics Symposium on Rendering 2026 (Symposium Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00378 2026-07-02 cs.CV q-bio.PE 新提交 57%

Radial Interaction Tomography: Recognizing Non-Transitive Evolutionary Games from One Range-Expansion Image

径向相互作用断层扫描:从一次范围扩张图像识别非传递演化博弈

Faruk Alpay, Baris Basaran

机构 * Department of Computer Engineering, Bahçeşehir University(巴赫切希尔大学计算机工程系)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 提出计算机视觉逆问题,从单张端点图像恢复径向边界流场,并检验视觉模式是否与传递标量适应度层级兼容,通过几何信号提取和统计检验实现非传递循环检测。

Comments 17 pages, 10 figures. Ancillary files include computational diagnostics, benchmark code, and supplementary proofs

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25445 2026-06-25 cs.CV cs.AI 新提交 57%

C3-Bench: A Context-Aware Change Captioning Benchmark

C3-Bench:一种上下文感知的变化描述基准

Jae-Woo Kim, Hyeongbeom Kim, Ue-Hwan Kim

机构 * Gwangju Institute of Science and Technology(光州科学技术院)

专题命中 图像生成评测 :image editing(abstract);分类 cs.CV

AI总结 提出C3-Bench基准,包含51种真实变化场景的4996对图像,并首次引入LLM-as-Judge评估框架,揭示现有模型在非训练分布场景下的系统性盲点。

Comments ECCV 2026 Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23835 2026-06-24 cs.CV eess.IV 新提交 57%

ABACUS: Adapting Unified Foundation Model for Bridging Image Count Understanding and Generation

ABACUS: 自适应统一基础模型,桥接图像计数理解与生成

Anindya Mondal, Sauradip Nag, Anjan Dutta

机构 * University of Surrey(萨里大学) Simon Fraser University(西蒙菲莎大学)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 提出ABACUS统一视觉语言模型,通过密度感知自适应缩放、边界感知计数策略和循环一致性GRPO,无需特定训练即可处理多种计数任务并生成计数忠实图像,在七个基准上达到最优。

Comments Under review, webpage: https://mondalanindya.github.io/ABACUS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20536 2026-06-19 cs.CV 新提交 57%

The FID Lottery: Quantifying Hidden Randomness in Generative-Model Evaluation

FID 彩票:量化生成模型评估中的隐藏随机性

Nicolas Dufour, Alexei A. Efros, Patrick Pérez

机构 * Kyutai UC Berkeley(加州大学伯克利分校)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 研究FID作为随机变量在训练和生成种子上的方差,发现重训练比重采样导致更大FID波动,提出新评估协议:使用每类最优引导、报告多个训练种子的误差条。

Comments Website: https://kyutai.org/fid-lottery

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19184 2026-06-18 cs.CV cs.LG 新提交 57%

When AUC Misleads: Polarization-Aware Evaluation of Deepfake Detectors under Domain Shift

当AUC误导:域偏移下深度伪造检测器的极化感知评估

Dat Nguyen, Cosmin Radoi, Romain Hermary, Marcella Astrid, Nesryne Mejri, Enjie Ghorbel, Djamila Aouada

机构 * CVI$^2$(CVI²实验室) SnT, University of Luxembourg(SnT,卢森堡大学) Cristal Laboratory, National School of Computer Sciences, University of Manouba(Cristal实验室,马努巴国家计算机科学学院)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 针对现有AUC评估无法反映真实场景中混合数据源和不同伪影类型的问题,提出Cross-dataset AUC(Cross-AUC)指标,通过平均每域AUC并引入预测极化度量(Wasserstein距离)来评估域偏移鲁棒性,实验证明其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17030 2026-06-18 cs.CV 新提交 57%

Qwen-RobotWorld Technical Report: Unifying Embodied World Modeling through Language-Conditioned Video Generation

Qwen-RobotWorld技术报告:通过语言条件视频生成统一具身世界模型

Jie Zhang, Xiaoyue Chen, Anzhe Chen, Dayiheng Liu, Deqing Li, Gengze Zhou, Hale Yin, Haoqi Yuan, Haoyang Li, Jiahao Li, Jiazhao Zhang, Jingren Zhou, Kaiyuan Gao, Kun Yan, Lihan Jiang, Ningyuan Tang, Pei Lin, Qihang Peng, Shengming Yin, Tianhe Wu, Tianyi Yan, Xiao Xu, Yan Shu, Yanran Zhang, Ye Wang, Yi Wang, Yilei Chen, Yixian Xu, Yiyang Huang, Yuxiang Chen, Zekai Zhang, Zhendong Wang, Zixing Lei, Zhixuan Liang, Zihao Liu, Zikai Zhou, Chenxu Lv, Xiong-Hui Chen, Chenfei Wu

机构 * Qwen Team(Qwen团队)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 提出Qwen-RobotWorld,一种以自然语言为统一动作接口的语言条件视频世界模型,通过双流MMDiT、大规模具身世界知识语料和渐进式课程训练,在机器人操作、自动驾驶等任务中实现物理一致的未来视觉轨迹预测,在多个基准上取得最优结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13345 2026-06-12 cs.CV 新提交 57%

JointEdit3D: Feed-Forward 3D Scene Editing in a Unified Latent Space

JointEdit3D:统一潜在空间中的前馈3D场景编辑

Xinnan Zhu, Ruijie Xu, Jiayu Ying, Daoguo Dong, Jiachen Xu, Yuan Xie, Xin Tan

机构 * East China Normal University(华东师范大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Tencent(腾讯)

专题命中 图像生成评测 :inpainting(abstract);分类 cs.CV

AI总结 提出JointEdit3D,在统一RGB-几何重建生成潜在空间中通过非对称潜在修复实现前馈3D场景编辑,引入SceneAnchor分支和编辑/背景感知损失,并构建SceneEdit3D-15K数据集和SceneEdit3D-Bench基准,显著提升编辑区域质量和3D结构完整性。

Comments Preprint. Project page: https://xinnan-zhu.github.io/JointEdit3D-Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22309 2026-08-25 cs.LG 新提交 50%

StocBench: A Benchmark for Generative Modeling of Stochastic Dynamics

StocBench:随机动力学生成建模基准

Sebastian Pfister, Benjamin Holzschuh, Nils Thuerey

机构 * School of Computation, Information and Technology, Technical University of Munich(慕尼黑工业大学计算、信息与技术学院)

专题命中 图像生成评测 :diffusion(abstract)

AI总结 该研究构建StocBench基准,对比测试多种生成模型与少步方法在随机流体流动概率预测中的性能,明确不同模型在随机与确定性任务、不同推理预算下的表现差异。

Comments Code available at https://github.com/tum-pbs/stocbench

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18701 2026-08-20 cs.RO 新提交 50%

SoftVTBench: A Deformation-Aware Visuo-Tactile Dataset and Benchmark for Deformable-Object Manipulation

SoftVTBench:面向可变形物体操作的形变感知视觉-触觉数据集与基准

Bowen Jing, Mingxin Wang, Ruiyang Hao, Chenchen Ge, Hanwen Shen, Junjie He, Yang Cui, Yiming Hou, Weitao Zhou, Jiawei Wang, Minglei Li, Dandan Zhang, Ding Zhao, Houde Liu, Xiaofan Li, Si Liu, Ping Luo, Haibao Yu

机构 * Tuojing Intelligence(拓境智能) Tsinghua University(清华大学) Southeast University(东南大学) Stevens Institute of Technology(斯蒂文斯理工学院) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Manchester(曼彻斯特大学) Simple AI Imperial College London(帝国理工学院) Carnegie Mellon University(卡内基梅隆大学) Zhejiang University(浙江大学) Beihang University(北京航空航天大学) The University of Hong Kong(香港大学)

专题命中 图像生成评测 :diffusion(abstract)

AI总结 本研究推出SoftVTBench视觉-触觉数据集与基准,定义形变感知成功率(DSR),发现触觉信息本身未必提升多模态融合,为可变形物体操作的物理交互研究提供资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12987 2026-08-14 cs.IR cs.AI 新提交 50%

Generative Universal Multimodal Retrieval with Dual-role Identifiers

基于双角色标识符的生成式通用多模态检索

Kaipeng Li, Haitao Yu, Xuanchen Zhou

机构 * Institute of Library, Information and Media Science, University of Tsukuba(筑波大学图书馆、信息与媒体科学研究所) College of Knowledge and Library Sciences, University of Tsukuba(筑波大学知识与图书馆科学学院)

专题命中 图像生成评测 :text-to-image(abstract)

AI总结 本文针对生成式信息检索的三大挑战,提出具备双角色标识符的DrIG框架,经实验验证其在多模态检索任务中性能优于现有基线,且能平衡效率与效果。

Comments This paper is under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12937 2026-08-14 math-ph cs.NA math.AP math.MP math.NA 新提交 50%

Transparent Boundary Conditions for the Heat Equation on Metric Graphs

度量图上热方程的透明边界条件

Jasur Matrasulov, Jambul Yusupov, Matthias Ehrhardt

专题命中 图像生成评测 :diffusion(abstract)

AI总结 该研究针对度量星形图建模的分支准一维区域的时变热方程,结合透明边界条件与网络偏微分方程理论,推导了消除热回流的精确顶点条件,经数值方法验证,为低维结构热扩散控制提供了数学框架。

Comments 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06967 2026-08-10 cs.CL 新提交 50%

Can Language Models Imagine Without Seeing? Ekphrasis: Measuring Visual Creative Ideation in Text-Only LLMs

语言模型无需视觉输入即可进行想象?Ekphrasis:测量仅文本大型语言模型的视觉创意构想能力

Hongyu Luo, He Wang, Huihao Jing, Hong Ting Tsang, Yuxuan Liu, Wuganjing Song, Yauwai Yim, Chunyang Li, Yangqiu Song

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 图像生成评测 :image generation(abstract)

AI总结 本研究推出基准Ekphrasis,测量仅文本大型语言模型的视觉创意构想能力,发现该能力与流畅度分离,且其排序可跨模态稳定存在。

Comments 25 pages, 4 main figures, with appendices. Code and data: https://github.com/Imhongyu/Ekphrasis

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04838 2026-08-06 math.ST math.PR stat.TH 新提交 50%

Exchangeable Testing Against an Unknown Benchmark

针对未知基准的可交换检验

Alexander Gnedin

专题命中 图像生成评测 :diffusion(abstract)

AI总结 本研究针对未知基准的序贯检验,提出基于组合秩的更新机制,建立贝叶斯框架下可显式计算的预测概率,分析了相关马尔可夫链的渐近行为。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24871 2026-07-29 cond-mat.mtrl-sci 新提交 50%

A flexible kinetic Monte Carlo framework for GaN molecular beam epitaxy with adaptive on-the-fly barrier evaluation

用于 GaN 分子束外延的具有自适应实时势垒评估的灵活动力学蒙特卡罗框架

Sajid Ali, Norbert Krause, Carla Verdi

专题命中 图像生成评测 :diffusion(abstract)

AI总结 该研究提出基于晶格的 KMC 框架模拟 GaN(0001)分子束外延生长,捕捉关键微观过程,支持自适应实时势垒评估,能再现岛形成等现象,为 GaN 外延及化合物半导体非平衡生长提供了灵活的原子尺度预测模拟平台。

Journal ref Applied Surface Science, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16268 2026-07-21 cs.LG 新提交 50%

PsiLogic: Chaos-Aware Active Cancellation for Adam with a Fair Cross-Domain Benchmark

PsiLogic:用于Adam的混沌感知主动抵消及公平跨域基准测试

Ali Sultonov

专题命中 图像生成评测 :diffusion(abstract)

AI总结 研究针对自适应优化器在不同训练阶段更新规则相同的问题,提出PsiLogic优化器,通过双指数移动平均控制主动抵消项,经FairBench基准测试,在多个领域表现优异,还发布开源实现等支持验证。

Comments 9 pages, 4 figures; code at https://github.com/Troxter222/psilogic

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09973 2026-07-14 cs.SD cs.AI cs.SY eess.AS eess.SP eess.SY 新提交 50%

A Production-Oriented Framework for Evaluation of SFX Generation

一种面向生产的声效生成评估框架

Mélodie Desbos, Yara Bahram, Eric Granger, Mohammadhadi Shateri

专题命中 图像生成评测 :inpainting(abstract)

AI总结 针对工业声音设计中声效生成评估问题,提出面向生产的评估框架,通过确定生产要求、两阶段协议及结合客观指标与人类研究,揭示不同基线的优势权衡,为声效变化评估建立协议并为设计音频生成管道提供基础。

Comments 8 pages main paper, 7 pages appendix, Proceedings of the 29th International Conference on Digital Audio Effects (DAFx26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11335 2026-07-14 q-fin.MF math.OC 新提交 50%

Minimizing Benchmark-Relative Drawdown Duration via Occupation Time Penalization

通过占用时间惩罚最小化基准相对回撤持续时间

Jun Sekine, Marcus Wunsch

专题命中 图像生成评测 :diffusion(abstract)

AI总结 研究连续时间投资组合优化问题,投资者相对不可复制基准评估,引入基准相对回撤持续时间标准,通过推导方程、建立定理等,得到基于投影的最优控制特征及相关结果,为基准跟踪提供新方案和风险管理新结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08751 2026-07-10 cs.RO 新提交 50%

DexVerse: A Modular Benchmark for Multi-Task, Multi-Embodiment Dexterous Manipulation

DexVerse:用于多任务、多实体灵巧操作的模块化基准测试

Yunchao Yao, Zhuxiu Xu, Tianqi Zhang, Zixian Liu, Sikai Li, Zhenyu Wei, Feng Chen, Dihong Huang, Kechang Wan, Chenyang Ma, Shuqi Zhao, Shenghua Gao, Masayoshi Tomizuka, Yi Ma, Mingyu Ding

机构 * UNC-Chapel Hill(北卡罗来纳大学教堂山分校) The University of Hong Kong(香港大学) UC Berkeley(加州大学伯克利分校)

专题命中 图像生成评测 :diffusion(abstract)

AI总结 DexVerse是用于多任务、多实体灵巧操作的模块化基准测试,含100个任务,支持多种机器人手臂和手,可扩展且提供视觉变化等。通过对多种方法的基准测试,揭示任务泛化和视觉运动鲁棒性挑战,为通用灵巧操作提供测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31700 2026-07-01 cs.LG cs.NE 新提交 50%

Diffusing Blame: Task-Dependent Credit Assignment in Biologically Plausible Dual-Stream Networks

扩散责任:生物合理双流网络中的任务依赖信用分配

Yutaro Yamada, Luca Grillotti, Rujikorn Charakorn, Sebastian Risi, David Ha, Robert Tjarko Lange

机构 * Sakana AI

专题命中 图像生成评测 :diffusion(abstract)

AI总结 提出模误差路由扩展误差扩散法,在严格遵循戴尔原则的双流兴奋/抑制网络中,实现MNIST 96.7%和CIFAR-10 61.7%的分类性能,并集成PPO在强化学习任务中取得竞争性结果。

Comments ALIFE2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26498 2026-06-26 math.OC cs.LG 新提交 50%

Mean-Field PhiBE: Continuous-Time Mean-Field Reinforcement Learning from Discrete-Time Data

平均场 PhiBE:基于离散时间数据的连续时间平均场强化学习

Erhan Bayraktar, Martin Hernandez, Qinxin Yan, Yuhua Zhu

机构 * Department of Mathematics, University of Michigan, Ann Arbor, MI, USA(密歇根大学数学系,安阿伯,密歇根州,美国) Department of Statistics and Data Science, University of California, Los Angeles, CA, USA(加州大学洛杉矶分校统计与数据科学系,加利福尼亚州,美国) Program in Applied and Computational Mathematics, Princeton University, Princeton, NJ, USA(普林斯顿大学应用与计算数学项目,普林斯顿,新泽西州,美国)

专题命中 图像生成评测 :diffusion(abstract)

AI总结 针对仅离散时间数据可用但种群连续演化的模型无关连续时间平均场控制问题,提出平均场PhiBE方法,将离散时间信息融入Wasserstein空间上的连续时间PDE,并推导策略梯度定理,实现模型无关的演员-评论家算法,证明一阶一致性估计。

详情

展开后加载摘要…

URL PDF HTML 收藏