arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

世界模型

面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。

共收录 4314 信号源:cs.AI, cs.LG, cs.CV, cs.RO, cs.MA

1. 通用世界模型 4314 篇

2608.11017 2026-08-12 cs.CV cs.AI cs.HC cs.MM 新提交 71%

R4DSG: Relative 4D Scene Graph Memory for Object-Centric Question Answering in Long Egocentric Video

R4DSG:面向长时序自我中心视频中以对象为中心的问答的相对4D场景图记忆

Ke Ma, Yamin Mao, Weiming Li, Shuai Tan, Yijie Zhong, Hao Chen, Haofen Wang, Meng Wang

机构 * Samsung R&D Institute China - Beijing(三星中国研发研究院(北京)) Shanghai Jiao Tong University(上海交通大学)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI、cs.CV

AI总结 该研究提出R4DSG,一种面向长时序自我中心视频的相对4D场景图记忆,在EgoLifeQA数据集的对象相关问答任务中,较EgoRAG-Text取得显著性能提升,可作为可穿戴助手等的实用记忆载体。

Comments 10 pages, 3 figures, ACM Multimedia 2026, egocentric video; 3D scene graph; temporal memory; graph retrieval; object-state reasoning; multimodal question answering

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26924 2026-08-03 cs.LG cs.RO 版本更新 71%

Temporally Centered SIGReg Improves Multi-Task LeWorldModel Learning: From Analysis to Method

时间中心SIGReg改进多任务LeWorldModel学习:从分析到方法

Chang Liu, Fei Suo, Yanzhou Jin, Yusuke Iwasawa, Yutaka Matsuo, Yaonan Zhu

机构 * Graduate School of Engineering, The University of Tokyo(东京大学工程学院)

专题命中 通用世界模型 :world-model(abstract);world-model(abstract);分类 cs.LG、cs.RO

AI总结 该研究针对SIGReg在多任务LeWM中导致表示混叠的问题,提出将其应用于时间中心残差的改进方法,在LIBERO基准上显著提升了多任务世界模型的下游性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23909 2026-08-03 cs.LG cs.RO 版本更新 71%

WorldDiT: A Unified Diffusion Architecture for World and Action Modeling

WorldDiT:用于世界和动作建模的统一扩散架构

Sen Wang, R. Gnana Praveen, Bidhan Roy, Marcos Villagra

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.LG、cs.RO

AI总结 研究提出WorldDiT统一扩散架构,结合动作生成与视觉世界建模,不依赖大型预训练VLM动作主干,在四个LIBERO模拟套件中表现出色,处于帕累托前沿,为未来扩展研究提供了低于十亿参数的基线。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26856 2026-07-24 q-bio.NC cs.AI cs.RO 版本更新 71%

The Sensation Modulating Network:Haltability as the architectural ground for object-directed phenomenology

感觉调节网络:可停性作为对象导向现象学的架构基础

G. Nagarjuna, Durgaprasad Karnam

机构 * Indian Institute of Science Education and Research (IISER) Pune(印度科学教育与研究学院(IISER)浦那) Centre for Educational Technology (CET), Indian Institute of Technology Bombay(教育技术中心(CET),印度理工学院孟买)

专题命中 通用世界模型 :world-model(abstract);world-model(abstract);分类 cs.AI、cs.RO

AI总结 本文提出感觉调节网络(SMN)作为具身认知的架构,通过对手动力学和可停性机制,将对象导向现象学(胡塞尔意义)的意向性建立在身体组织的结构特征上,从而调和认知主义与4E认知的争论。

Comments 51 pages, main body 39 pages + References 6 pages, Appendices 6 pages, Tables 3, and Figures 16

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12144 2026-07-24 cs.CV cs.RO eess.IV 版本更新 71%

O3N: Omnidirectional Open-Vocabulary Occupancy Prediction for Urban Autonomous Agents

O3N: 全向开放词汇占用预测

Mengfei Duan, Hao Shi, Fei Teng, Guoqiang Zhao, Yuheng Zhang, Zhiyong Li, Kailun Yang

机构 * Hunan University(湖南大学) Zhejiang University(浙江大学)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.CV、cs.RO

AI总结 O3N通过全向感知和开放词汇方法,实现三维空间的连续表示和长距离上下文建模,提升具身智能在开放世界中的感知与建模能力。

Comments The source code will be made publicly available at https://github.com/MengfeiD/O3N

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20152 2026-07-23 cs.LG cs.AI stat.ML 新提交 71%

Active Inference as a Convex Markov Decision Process

作为凸马尔可夫决策过程的主动推理

Nikola Milosevic, Nicolás Hinrichs, Nico Scherf

机构 * Max Planck Institute for Human Cognitive and Brain Sciences(马克斯·普朗克人类认知与脑科学研究所)

专题命中 通用世界模型 :world-model(abstract);world-model(abstract);分类 cs.AI、cs.LG

AI总结 研究将主动推理构建为策略优化,证明其可表述为凸马尔可夫决策过程,分析了相关公式并推导MD算法,表明结合世界模型学习与策略优化能赋予主动推理执行性强化学习结构,为其奠定理论基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19889 2026-07-23 cs.CV 新提交 71%

LAVIFT: Latent-Action-Guided Vision Fine-Tuning for Surgical Interaction Recognition

LAVIFT:用于手术交互识别的潜在动作引导视觉微调

Jiajun Cheng, Subarna Tripathi, Sainan Liu, Xiaofan Yu, Shan Lin

机构 * Arizona State University(亚利桑那州立大学) University of California, Merced(加州大学默塞德分校) Intel Corporation(英特尔公司)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.CV;dynamics model(abstract)

AI总结 研究针对手术交互识别中预训练模型适应细粒度交互的挑战,提出LAViFiT框架,通过逆动力学模型、前向世界模型及补丁级SIG正则化器,实现视觉语言微调,提升了识别率和图像-文本对齐,增强了特征基础和空间连贯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15536 2026-07-20 cs.CV cs.LG 新提交 71%

E3DGS: Unified Geometric-Photometric Equivariance for 3D Gaussian Splatting via Color-as-Geometry Embedding

E3DGS:通过颜色作为几何嵌入实现3D高斯点云的统一几何-光度等变性

Chankyo Kim, Maani Ghaffari

机构 * University of Michigan(密歇根大学)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.LG、cs.CV

AI总结 研究针对3D高斯点云构建等变架构的表示瓶颈问题,提出基于表示理论的统一解决方案,通过将光度学与几何张量同构等方法,引入统一矩阵嵌入,构建E3DGS架构,提升了相机帧变化下的鲁棒性和数据效率。

Comments 31 pages, 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13960 2026-07-20 cs.RO 版本更新 71%

GigaWorld-Policy-0.5: A Faster and Stronger WAM Empowered by AutoResearch

GigaWorld-Policy-0.5:由自动研究赋能的更快更强的世界行动模型

GigaWorld Team, Angen Ye, Angyuan Ma, Boyuan Wang, Chaojun Ni, Fangzheng Ye, Guan Huang, Guo Li, Guosheng Zhao, Haodong Yan, Hengtao Li, Jiwen Lu, Kai Wang, Mingming Yu, Qitang Hu, Qiuping Deng, Songling Liu, Xiaoyu Tian, Xiaofeng Wang, Xinyu Zhou, Xiuwei Xu, Xinze Chen, Yang Wang, Yejun Zeng, Yifan Chang, Yun Ye, Zhenyu Wu, Zhanqian Wu, Zheng Zhu

机构 * GigaAI(字节跳动人工智能实验室) Tsinghua University(清华大学)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.RO;dynamics model(abstract)

AI总结 研究旨在改进机器人策略学习,提出GigaWorld-Policy-0.5这一增强型以动作中心的WAM。预训练采用混合策略加强视觉与动作耦合,推理引入新架构提升效率,还用自动研究管道搜索训练配置,有效提升了机器人控制推理效率并保留训练优势。

Comments project page: https://open-gigaai.github.io/giga-world-policy/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04419 2026-07-14 cs.CL cs.AI cs.LG 版本更新 71%

Context-Dependent Affordance Computation in Vision-Language Models

视觉-语言模型中基于情境的可及性计算

Murad Farzulla

机构 * Dissensus AI King’s College London(伦敦国王学院)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI、cs.LG

AI总结 本研究揭示视觉-语言模型中可及性计算的高度情境依赖性,通过大规模实验显示超过90%的词汇描述受情境影响,提出动态本体投影方法替代静态世界建模。

Comments 33 pages, 13 tables, 3 figures. Code available at: https://github.com/studiofarzulla/semantic-vision

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09078 2026-07-13 cs.CV cs.RO 新提交 71%

Toward Active Object Detection for UAVs in the Wild: A Large-Scale Dataset, Benchmark and Method

面向野外无人机的主动目标检测:大规模数据集、基准和方法

Tianpeng Liu, Xinhua Jiang, Li Liu, Qinmu Shen, Siwei Tang, Zhen Liu, Yongxiang Liu

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.CV、cs.RO

AI总结 针对无人机主动目标检测缺乏高质量数据集和基准的问题,提出ATRNet-LUDO数据集并建立评估基准。利用联合嵌入预测架构构建世界模型,提出AOD-JEPA,经实验验证其有效性和优越性,推动无人机-地面主动目标检测领域研究。

Comments 18 pages, 19 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17298 2026-07-09 cs.CV cs.AI 版本更新 71%

Explain Before You Answer: A Survey on Compositional Visual Reasoning

回答之前先解释:组合视觉推理综述

Fucai Ke, Joy Hsu, Zhixi Cai, Zixian Ma, Xin Zheng, Xindi Wu, Sukai Huang, Weiqing Wang, Pari Delir Haghighi, Gholamreza Haffari, Ranjay Krishna, Jiajun Wu, Hamid Rezatofighi

机构 * Monash University(墨尔本大学) Stanford University(斯坦福大学) University of Washington(华盛顿大学) Griffith University(格里菲斯大学) Princeton University(普林斯顿大学) Allen Institute for Artificial Intelligence(人工智能研究院)

专题命中 通用世界模型 :world-model(abstract);world-model(abstract);分类 cs.AI、cs.CV

AI总结 综述2023年至2025年组合视觉推理文献,形式化核心定义,追溯范式转变,编目基准指标,提炼见解、识别挑战并概述方向,为该领域提供统一分类、历史路线图和批判性展望。

Comments Project Page: https://github.com/pokerme7777/Compositional-Visual-Reasoning-Survey

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28383 2026-06-30 cs.CV cs.LG 71%

Zero-Label Driving Scenario Complexity Detection via Joint Embedding Predictive Architecture

零标签驾驶场景复杂度检测基于联合嵌入预测架构

Santosh Jaiswal

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.LG、cs.CV

AI总结 提出无监督方法,利用联合嵌入预测架构(JEPA)在无标签数据上通过时间预测误差作为零样本复杂度指标,有效区分复杂与简单驾驶场景。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26057 2026-06-25 cs.AI cs.CR cs.LG 新提交 71%

The Unfireable Safety Kernel: Execution-Time AI Alignment for AI Agents and Other Escapable AI Systems

不可解雇的安全内核:面向AI代理及其他可逃逸AI系统的执行时AI对齐

Seth Dobrin, Łukasz Chmiel

机构 * ARYA Labs PBC

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI、cs.LG

AI总结 提出一种架构性控制机制“不可解雇的安全内核”,通过进程隔离、前置强制、故障关闭和外部验证四个属性实现执行时AI对齐,在可逃逸AI系统中阻止逃逸尝试。

Comments Pre-print submitted for publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22430 2026-06-23 cs.CL cs.AI cs.LG 新提交 71%

Words as Difference Makers: How Large Language Models Determine Causal Structure in Text

词汇作为差异制造者:大型语言模型如何确定文本中的因果结构

Wolfgang Pietsch

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出大型语言模型通过变分归纳逻辑学习因果结构,并分析其训练过程与架构特征如何实现差异制造者识别。

Comments 36 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20707 2026-06-23 cs.CV cs.AI 新提交 71%

GEOPHYS: The Geometry of Physical Plausibility

GEOPHYS: 物理合理性的几何学

Christian Internò, Alexander Pondaven, Habon Issa, Fabio Pizzati, Francesco Pinto, Markus Olhofer, Ivan Laptev, Philip Torr, Eero P. Simoncelli, Barbara Hammer, David Klindt

机构 * Bielefeld University(比勒费尔德大学) University of Oxford(牛津大学) Cold Spring Harbor Laboratory(冷泉港实验室) MBZUAI(穆罕默德·本·扎耶德人工智能大学) Independent(独立作者) Honda Research Institute EU(本田欧洲研究院) New York University(纽约大学) Flatiron Institute, Simons Foundation(西蒙斯基金会熨斗研究所)

专题命中 通用世界模型 :world-model(abstract);world-model(abstract);分类 cs.AI、cs.CV

AI总结 提出GEOPHYS方法,利用冻结图像编码器的每帧嵌入的五个几何特征检测视频中的物理不合理性,在物理违反检测上达到SOTA,并作为验证器提升视频生成模型的物理一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11417 2026-06-11 cs.LG cs.AI stat.ML 新提交 71%

Signed Compression Progress on a Sealed Audit is Goodhart-Resistant

密封审计上的有符号压缩进展是古德哈特抵抗的

Ayush Mittal, Dhruv Gupta

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI、cs.LG

AI总结 提出有符号压缩进展作为内在动机,证明其累积奖励等于审计改进,且对有限审计面板具有假阳性预算,抵抗古德哈特定律。

Comments 16 pages, 7 figures. Lean 4 (Mathlib) mechanized core and ARC-TGI experiment code: https://github.com/Zetetic-Dhruv/audit-compression-progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12225 2026-06-09 cs.AI 版本更新 71%

A Geometric Theory of Cognition for Machine Intelligence

机器智能的认知几何理论

Laha Ale

机构 * School of Computing and Artificial Intelligence, Southwest Jiaotong University, Chengdu, China(计算与人工智能学院,西南交通大学,成都,中国)

专题命中 通用世界模型 :world-model(abstract);world-model(abstract);分类 cs.AI;dynamics model(abstract)

AI总结 提出黎曼流形上的梯度流框架,统一表征、记忆、适应与预测,在部分可观测强化学习任务中优于前馈基线,鲁棒性堪比循环架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20732 2026-06-01 cs.LG cs.AI cs.SE 71%

FEM-Bench: A Structured Scientific Reasoning Benchmark for Evaluating Code-Generating LLMs

FEM-Bench:评估代码生成大语言模型的结构化科学推理基准

Saeed Mohammadzadeh, Erfan Hamdi, Joel Shor, Emma Lejeune

机构 * Boston University(波士顿大学) Move37 Labs(Move37实验室) Department of Mechanical Engineering(机械工程系)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI、cs.LG

AI总结 提出FEM-Bench基准,通过有限元方法相关编程任务评估大语言模型在科学计算中的结构化推理能力,实验表明现有模型尚不能稳定解决所有任务。

Comments 45 pages, 5 figures, 9 tables, 7 listings

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19830 2026-06-01 cs.CV cs.AI 71%

Target-Agnostic Calibration under Distribution Shift with Frequency-Aware Gradient Rectification

分布偏移下基于频率感知梯度修正的目标无关校准

Yilin Zhang, Cai Xu, You Wu, Ziyu Guan, Wei Zhao

机构 * School of Computer Science and Technology, Xidian University, Xi'an, China(西安电子科技大学计算机科学与技术学院)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI、cs.CV

AI总结 提出频率感知梯度修正(FGR)框架,通过对训练图像进行低通滤波减少虚假高频线索并学习域不变特征,同时利用几何投影确保分布内校准不退化,从而在无需目标域信息的情况下提升模型在分布偏移下的校准性能。

Comments 25 pages, Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19355 2026-05-28 cs.LG cs.AI cs.CE 71%

LASER: Learning Active Sensing for Continuum Field Reconstruction

LASER: 用于连续场重建的学习主动感知

Huayu Deng, Jinghui Zhong, Xiangming Zhu, Yunbo Wang, Xiaokang Yang

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, School of Computer Science, Shanghai Jiao Tong University(人工智能MOE重点实验室、人工智能研究院、计算机科学学院、上海交通大学)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI、cs.LG

AI总结 提出LASER框架,将主动感知建模为部分可观测马尔可夫决策过程,利用连续场潜在世界模型和强化学习策略在潜在想象空间中模拟感知场景,实现稀疏约束下的高保真重建。

Comments Accepted by ICML 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08558 2026-05-26 cs.AI cs.CL cs.IR cs.LG 71%

Agent Learning via Early Experience

通过早期经验进行智能体学习

Kai Zhang, Xiangchao Chen, Bo Liu, Tianci Xue, Zeyi Liao, Zhihan Liu, Xiyao Wang, Yuting Ning, Zhaorun Chen, Xiaohan Fu, Jian Xie, Yuxuan Sun, Boyu Gou, Qi Qi, Zihang Meng, Jianwei Yang, Ning Zhang, Xian Li, Ashish Shah, Dat Huynh, Hengduo Li, Zi Yang, Sara Cao, Lawrence Jang, Shuyan Zhou, Jiacheng Zhu, Huan Sun, Jason Weston, Yu Su, Yifan Wu

机构 * Meta Superintelligence Labs(Meta超智能实验室) FAIR at Meta(Meta的FAIR部门) The Ohio State University(俄亥俄州立大学)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI、cs.LG

AI总结 提出早期经验范式,利用智能体自身动作生成的交互数据(无需奖励信号)通过隐式世界建模和自我反思两种策略提升智能体在多样化环境中的效果和跨域泛化能力。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14036 2026-05-15 cs.AI cs.CC cs.CL cs.LG 71%

Enhanced and Efficient Reasoning in Large Learning Models

增强和高效的大型学习模型推理

Leslie G. Valiant

机构 * John A. Paulson School of Engineering and Applied Sciences(约翰·A·保罗森工程与应用科学学院)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种高效且基于原理的推理方法,用于改进大型语言模型,通过预处理和机器学习流程提升推理能力,实现更稳健的逻辑推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04759 2026-05-14 cs.CL cs.AI cs.ET cs.LG 71%

Gyan: An Explainable Neuro-Symbolic Language Model

Gyan:一种可解释的神经符号语言模型

Venkat Srinivasan, Vishaal Jatav, Anushka Chandrababu, Geetika Sharma

机构 * Innospark Ventures & Gyan AI(Innospark Ventures及Gyan AI) Gyan AI Inc.(Gyan AI公司)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI、cs.LG

AI总结 Gyan基于非Transformer架构构建,克服了传统大语言模型的局限性,在多个数据集上取得SOTA表现,展示了可信任且可靠的使命关键任务模型潜力。

Comments also submitted to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17104 2026-05-14 cs.DC cs.AI cs.LG 71%

TStore: Rethinking AI Model Hub with Tensor-Centric Compression

TStore: 以张量为中心的AI模型仓库重新思考

Tingfeng Lan, Zirui Wang, Yunjia Zheng, Zhaoyuan Su, Juncheng Yang, Yue Cheng

机构 * University of Virginia(弗吉尼亚大学) Harvard University(哈佛大学)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI、cs.LG

AI总结 TStore通过细粒度去重和压缩技术减少存储开销,保留模型可用性和性能,实现实验中显著的存储节省。

Comments 12 pages, 6 figures. Systems paper on AI model storage

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09790 2026-05-12 cs.DC cs.AI cs.LG 71%

Multi-Tier Labeling and Physics-Informed Learning for Orbital Anomaly Detection at Scale

多层级标签与物理引导学习用于大规模轨道异常检测

Yong Fu

机构 * Substratum Labs, Inc(Substring实验室)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出多层级标签方法,结合物理规则、IMM-UKF和补充元素校准,实现大规模轨道异常检测,通过Transformer模型提升召回率,探讨神经ODE在轨道世界模型中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09650 2026-05-12 cs.AI cs.LG 71%

Workspace Optimization: How to Train Your Agent

工作区优化:如何训练你的智能体

Elad Sarafian, Gal Kaplun, Ron Banner, Daniel Soudry, Boris Ginsburg

机构 * NVIDIA

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过优化智能体的工作区结构来提升其在多轮任务中的表现,通过模拟权重空间训练方法,利用人工制品、证据、反例和文本反馈来改进智能体的执行能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06066 2026-05-08 cs.LG cs.AI 71%

Causal Reinforcement Learning for Complex Card Games: A Magic The Gathering Benchmark

因果强化学习在复杂卡牌游戏中的应用:《魔法:英雄冒险》基准测试

Cristiano da Costa Cunha, Ajmal Mian, Tim French, Wei Liu

机构 * Department of Computer Science and Software Engineering, University of Western Australia(西澳大学计算机科学与软件工程系)

专题命中 通用世界模型 :world-model(abstract);world-model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出MTG-Causal-RL基准测试,通过Magic: The Gathering游戏中的复杂环境,结合因果结构和掩码动作空间,评估因果信用分配、跨 archetype 转移和策略可审计性等核心问题。

Comments 21 pages, 8 figures, 9 tables, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27955 2026-05-01 cs.AI cs.CV 71%

GUI Agents with Reinforcement Learning: Toward Digital Inhabitants

具有强化学习的图形用户界面代理:迈向数字居民

Junan Hu, Jian Liu, Jingxiang Lai, Jiarui Hu, Yiwei Sheng, Shuang Chen, Jian Li, Dazhao Du, Song Guo

机构 * Shandong University(山东大学) The Hong Kong University of Science and Technology(香港科技大学) The Hong Kong University(香港大学) Shanghai Jiao Tong University(上海交通大学) Tencent(腾讯)

专题命中 通用世界模型 :world-model(abstract);world-model(abstract);分类 cs.AI、cs.CV

AI总结 本文探讨了强化学习与GUI代理的结合,提出分类体系及趋势分析,旨在指导下一代鲁棒GUI自动化及基础设施发展。

Comments Project Page: https://github.com/Steve2457/Awesome-RL-GUI-Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26232 2026-04-30 cs.CV cs.AI 71%

DepthPilot: From Controllability to Interpretability in Colonoscopy Video Generation

DepthPilot:从可控性到可解释性在结肠镜视频生成中

Junhu Fu, Ke Chen, Weidong Guo, Shuyu Liang, Jie Xu, Chen Ma, Kehao Wang, Shengli Lin, Zeju Li, Yuanyuan Wang, Yi Guo, Shuo Li

机构 * College of Biomedical Engineering, Fudan University, Shanghai 200433, China(复旦大学生物医学工程学院) Key Laboratory of Medical Imaging Computing and Computer Assisted Intervention of Shanghai, Shanghai 200032, China(上海医学影像计算与计算机辅助干预重点实验室) Endoscopy Research Institute, Zhongshan Hospital, Fudan University, Shanghai 200032, China(复旦大学中山医院内窥镜研究所) Shanghai Collaborative Innovation Center of Endoscopy, Shanghai 200032, China(上海内窥镜协同创新中心) Department of Biomedical Engineering, Case Western Reserve University, Cleveland, OH 44106, USA(凯斯西储大学生物医学工程系) Department of Computer and Data Science, Case Western Reserve University, Cleveland, OH 44106, USA(凯斯西储大学计算机与数据科学系)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI、cs.CV

AI总结 本文提出DepthPilot框架,通过几何对齐策略和自适应样条去噪模块,实现结肠镜视频生成的可控性与可解释性,取得高FID分数和临床评估领先成果。

详情

展开后加载摘要…

URL PDF HTML 收藏