arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

世界模型

面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。

共收录 4314 信号源:cs.AI, cs.LG, cs.CV, cs.RO, cs.MA

1. 通用世界模型 4314 篇

2604.19856 2026-04-23 cs.AR cs.AI cs.LG 71%

ChipCraftBrain: Validation-First RTL Generation via Multi-Agent Orchestration

ChipCraftBrain: 通过多智能体协调实现验证优先的RTL生成

Cagri Eryilmaz

机构 * Cagri Eryilmaz

专题命中 通用世界模型 :world-model(abstract);world-model(abstract);分类 cs.AI、cs.LG

AI总结 ChipCraftBrain通过多智能体协调和混合符号-神经架构实现验证优先的RTL生成,其核心方法包括自适应协调、混合架构、知识增强生成和分层规格分解,主要贡献是提升了RTL生成的准确性和效率。

Comments 17 pages, 6 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14025 2026-04-16 cs.CV cs.AI cs.GR 71%

Feed-Forward 3D Scene Modeling: A Problem-Driven Perspective

前馈3D场景建模:以问题为导向的视角

Weijie Wang, Qihang Cao, Sensen Gao, Donny Y. Chen, Haofei Xu, Wenjing Bian, Songyou Peng, Tat-Jen Cham, Chuanxia Zheng, Andreas Geiger, Jianfei Cai, Jia-Wang Bian, Bohan Zhuang

机构 * Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学) Monash University(墨尔本大学) ETH Zurich(苏黎世联邦理工学院) University of Tübingen(图宾根大学)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI、cs.CV

AI总结 本文探讨了前馈3D重建的通用方法,提出以模型设计为核心的分类体系,涵盖特征增强、几何意识、模型效率等五个核心问题,旨在推动3D场景建模的标准化与可扩展性。

Comments 67 pages, 395 references. Project page: https://ff3d-survey.github.io. Code: https://github.com/ziplab/Awesome-Feed-Forward-3D. This work has been submitted to Springer for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05015 2026-04-08 cs.CV 71%

Video-MME-v2: Towards the Next Stage in Benchmarks for Comprehensive Video Understanding

Video-MME-v2:迈向综合视频理解基准的下一阶段

Chaoyou Fu, Haozhi Yuan, Yuhao Dong, Yi-Fan Zhang, Yunhang Shen, Xiaoxing Hu, Xueying Li, Jinsen Su, Chengwu Long, Xiaoyao Xie, Yongkang Xie, Xiawu Zheng, Xue Yang, Haoyu Cao, Yunsheng Wu, Ziwei Liu, Xing Sun, Caifeng Shan, Ran He

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.CV;dynamics model(abstract)

AI总结 Video-MME-v2通过三级层次结构和非线性评估策略,评估视频理解的鲁棒性和准确性,揭示当前模型与人类专家间的差距及多模态推理瓶颈。

Comments Homepage: https://video-mme-v2.netlify.app/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02097 2026-04-03 cs.CV cs.LG 71%

LatentUM: Unleashing the Potential of Interleaved Cross-Modal Reasoning via a Latent-Space Unified Model

LatentUM:通过潜在空间统一模型释放交错跨模态推理的潜力

Jiachun Jin, Zetong Zhou, Xiao Yang, Hao Zhang, Pengfei Liu, Jun Zhu, Zhijie Deng

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.LG、cs.CV

AI总结 本文提出LatentUM,通过共享语义潜在空间实现跨模态推理与生成,提升计算效率并减少编码器偏差,取得视觉空间规划基准的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05110 2026-03-17 cs.CV cs.LG 71%

BLINK: Behavioral Latent Modeling of NK Cell Cytotoxicity

BLINK:自然杀伤细胞杀伤行为的隐式建模

Iman Nematollahi, Jose Francisco Villena-Ossa, Alina Moter, Kiana Farhadyar, Gabriel Kalweit, Abhinav Valada, Toni Cathomen, Evelyn Ullrich, Maria Kalweit

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.LG、cs.CV

AI总结 BLINK通过轨迹基于的递归状态空间模型,从部分观测的NK-肿瘤相互作用序列中学习隐式相互作用动力学,预测凋亡增量并提升单细胞水平的NK细胞杀伤行为的定量评估与结构建模能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09951 2026-03-11 cs.LG cs.AI cs.SE 71%

Towards a Neural Debugger for Python

迈向Python的神经调试器

Maximilian Beck, Jonas Gehring, Jannik Kossen, Gabriel Synnaeve

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出神经调试器,通过模拟传统调试器实现交互式代码执行控制,提升神经模型在代码执行预测与逆向推理中的能力。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17676 2026-02-23 cs.AI cs.CL cs.LG 71%

Epistemic Traps: Rational Misalignment Driven by Model Misspecification

知识陷阱:由模型规格不准确驱动的理性偏差

Xingcheng Xu, Jingjing Qu, Qiaosheng Zhang, Chaochao Lu, Yanqing Yang, Na Zou, Xia Hu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ShanghaiTech University(上海科技大学)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出主观模型工程,通过设计代理的内部信念结构来实现稳健对齐,揭示安全由认知先验决定而非奖励大小连续函数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04345 2026-02-12 cs.SD cs.AI cs.LG 71%

AUDETER: A Large-scale Dataset for Deepfake Audio Detection in Open Worlds

AUDETER:一种大规模深度伪造音频检测数据集用于开放世界

Qizhou Wang, Hanxun Huang, Guansong Pang, Sarah Erfani, Christopher Leckie

机构 * The University of Melbourne(墨尔本大学) Singapore Management University(新加坡管理学院)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI、cs.LG

AI总结 AUDETER是一种大规模深度伪造音频检测数据集,通过课程学习方法提升开放世界检测性能,实现1.87%的EER在野外测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01299 2026-02-09 cs.AI cs.LG 71%

Scalable In-Context Q-Learning

可扩展的上下文Q学习

Jinmei Liu, Fuhong Liu, Zhenhong Sun, Jianye Hao, Huaxiong Li, Bo Wang, Daoyi Dong, Chunlin Chen, Zhi Wang

机构 * Nanjing University(南京大学) Australian National University(澳大利亚国立大学) Tianjin University(天津大学) University of Technology Sydney(悉尼大学)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出S-ICQL框架,通过动态规划和世界建模实现高效的奖励最大化和任务泛化,适用于决策领域。

Comments accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.19652 2026-02-03 cs.CV cs.AI 71%

InterDreamer: Zero-Shot Text to 3D Dynamic Human-Object Interaction

InterDreamer: 零样本文本到3D动态人-物交互

Sirui Xu, Ziyin Wang, Yu-Xiong Wang, Liang-Yan Gui

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI、cs.CV

AI总结 InterDreamer通过结合预训练模型和物理模拟,实现零样本生成3D动态人-物交互。

Comments NeurIPS 2024. Project Page: https://sirui-xu.github.io/InterDreamer/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18107 2026-01-27 cs.LG cs.HC cs.RO 71%

Beyond Static Datasets: Robust Offline Policy Optimization via Vetted Synthetic Transitions

超越静态数据集:通过验证的合成过渡实现鲁棒的离线策略优化

Pedram Agand, Mo Chen

机构 * Department of Computing Science, Simon Fraser University(计算科学系,西蒙·弗雷泽大学)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.LG、cs.RO

AI总结 本文提出MoReBRAC框架,通过不确定性感知的潜在合成方法,解决离线强化学习中静态数据与策略分布偏移的问题,并在D4RL基准中实现性能提升。

Comments 11 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.05153 2026-01-27 stat.ML cs.LG 71%

Uncertainty Quantification and Propagation in Surrogate-based Bayesian Inference

代理模型中不确定性量化与传播的 Bayesian 推断

Philipp Reiser, Javier Enrique Aguilar, Anneli Guthke, Paul-Christian Bürkner

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.LG;simulation model(abstract)

AI总结 本文提出了一种可扩展的贝叶斯框架,用于代理建模中的不确定性量化与传播,通过三种方法提升对现实世界建模任务中参数估计的可靠性。

Journal ref Statistics and Computing 35(3):66 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00549 2026-01-14 cs.LG cs.AI 71%

Robust Single-Agent Reinforcement Learning for Regional Traffic Signal Control Under Demand Fluctuations

鲁棒的单智能体强化学习用于应对需求波动的区域交通信号控制

Qiang Li, Jin Niu, Lina Yu

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种鲁棒的单智能体强化学习框架,用于应对交通需求波动的区域交通信号控制,通过集中决策和高效学习模型有效减少交通队列长度。

Comments A critical error in the methodology. The reported congestion control effects were not caused by the proposed signal timing optimization, but by an incorrect traffic volume scaling factor during evaluation. The traffic demand was not properly amplified, resulting in misleading performance gains. Due to the substantial nature of the error, completion of revisions is not feasible in the short term

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.02903 2025-12-30 cs.CV cs.RO 71%

LidarDM: Generative LiDAR Simulation in a Generated World

LidarDM: 生成世界中的生成激光雷达模拟

Vlas Zyrianov, Henry Che, Zhijian Liu, Shenlong Wang

机构 * UIUC(伊利诺伊大学香槟分校) NVIDIA(英伟达)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.CV、cs.RO

AI总结 LidarDM通过集成4D世界生成框架,实现了基于驾驶场景的4D激光雷达点云生成,提升自动驾驶模拟的逼真度与时间一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10400 2025-12-17 cs.MA cs.AI cs.CL 71%

Rethinking the Reliability of Multi-agent System: A Perspective from Byzantine Fault Tolerance

重新思考多智能体系统可靠性:从拜占庭容错的角度出发

Lifan Zheng, Jiawei Chen, Qinghong Yin, Jingyuan Zhang, Xinyi Zeng, Yu Tian

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI、cs.MA

AI总结 本文从拜占庭容错角度研究基于大语言模型的智能体可靠性,提出CP-WBFT机制提升多智能体系统稳定性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12080 2025-12-16 cs.CV cs.LG 71%

BAgger: Backwards Aggregation for Mitigating Drift in Autoregressive Video Diffusion Models

BAgger: 逆向聚合用于缓解自回归视频扩散模型中的漂移

Ryan Po, Eric Ryan Chan, Changan Chen, Gordon Wetzstein

机构 * Stanford University(斯坦福大学)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.LG、cs.CV

AI总结 BAgger通过自监督方法缓解自回归视频扩散模型中的漂移问题,利用标准分数或流匹配目标提升长期运动稳定性与视觉一致性。

Comments Project page here: https://ryanpo.com/bagger

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07821 2025-12-09 cs.CV cs.AI 71%

WorldReel: 4D Video Generation with Consistent Geometry and Motion Modeling

WorldReel:基于一致几何和运动建模的4D视频生成

Shaoheng Fang, Hanwen Jiang, Yunpeng Bai, Niloy J. Mitra, Qixing Huang

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Adobe Research(Adobe研究) University College London(伦敦大学学院)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI、cs.CV

AI总结 WorldReel通过联合生成RGB帧和4D场景表示,实现了动态场景和移动摄像机下的4D一致视频生成,提升了几何一致性与运动一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01816 2025-12-02 cs.CV cs.AI 71%

Envision: Benchmarking Unified Understanding & Generation for Causal World Process Insights

Envision:基于因果世界过程洞察的统一理解和生成基准测试

Juanxi Tian, Siyuan Li, Conghui He, Lijun Wu, Cheng Tan

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI、cs.CV

AI总结 Envision通过因果事件进程基准测试,评估统一模型在动态时空一致性上的表现,揭示其在因果叙事一致性上的优势及仍需改进的时空一致性挑战。

Comments 35 pages, 12 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15605 2025-12-02 cs.RO cs.CL cs.CV 71%

SRPO: Self-Referential Policy Optimization for Vision-Language-Action Models

SRPO:用于视觉-语言-动作模型的自指政策优化

Senyu Fei, Siyin Wang, Li Ji, Ao Li, Shiduo Zhang, Liming Liu, Jinlong Hou, Jingjing Gong, Xianzhong Zhao, Xipeng Qiu

机构 * Fudan University(复旦大学) Tongji University(同济大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.CV、cs.RO

AI总结 SRPO通过自指政策优化方法,利用模型自身生成的成功轨迹作为参考,有效解决VLA-RL中的奖励稀疏问题,实现高成功率和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21982 2025-12-01 cs.CV cs.AI 71%

DialBench: Towards Accurate Reading Recognition of Pointer Meter using Large Foundation Models

DialBench: 通过大基础模型实现指针表盘读数的准确识别

Futian Wang, Chaoliu Weng, Xiao Wang, Zhen Chen, Zhicheng Zhao, Jin Tang

机构 * School of Computer Science and Technology, Anhui University, Hefei 230601, China(安徽大学计算机科学与技术学院) School of Artificial Intelligence, Anhui University, Hefei 230601, China(安徽大学人工智能学院) Department of Computer Science and Information Technology, La Trobe University, Bendigo, Australia(拉筹伯大学计算机科学与信息技术系)

专题命中 通用世界模型 :world-model(abstract);world-model(abstract);分类 cs.AI、cs.CV

AI总结 本文提出DialBench基准数据集和MRLM模型,通过物理关系注入提升指针表盘读数识别的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09681 2025-11-14 cs.LG cs.AI 71%

SEBA: Sample-Efficient Black-Box Attacks on Visual Reinforcement Learning

Tairan Huang, Yulin Jin, Junxu Liu, Qingqing Ye, Haibo Hu

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09578 2025-11-14 cs.LG cs.AI physics.comp-ph 71%

HeatGen: A Guided Diffusion Framework for Multiphysics Heat Sink Design Optimization

Hadi Keramati, Morteza Sadeghi, Rajeev K. Jaiman

机构 * Department of Mechanical Engineering(机械工程系) University of British Columbia(不列颠哥伦比亚大学) Institute for Nano- and Microfluidics(纳微流体研究所) Technical University of Darmstadt(德累斯顿技术大学)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00940 2025-11-04 cs.RO cs.AI 71%

URDF-Anything: Constructing Articulated Objects with 3D Multimodal Language Model

Zhe Li, Xiang Bai, Jieyu Zhang, Zhuangzhe Wu, Che Xu, Ying Li, Chengkai Hou, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) University of Washington(华盛顿大学)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI、cs.RO

Comments Accepted to the 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24459 2025-10-29 cs.AI cs.MA cs.SE 71%

Affordance Representation and Recognition for Autonomous Agents

Habtom Kahsay Gidey, Niklas Huber, Alexander Lenz, Alois Knoll

机构 * Technische Universität München(慕尼黑技术大学) Jessy Works(杰西工作)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI、cs.MA

Journal ref The Second International Workshop on Hypermedia Multi-Agent Systems (HyperAgents 2025), in conjunction with the 28th European Conference on Artificial Intelligence (ECAI 2025); October 26, 2025, Bologna, Italy

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08307 2025-10-15 cs.CV cs.RO 71%

DSM: Constructing a Diverse Semantic Map for 3D Visual Grounding

Qinghongbing Xie, Zijian Liang, Fuhao Li, Long Zeng

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳国际研究生院,清华大学,深圳,中国)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.CV、cs.RO

Comments 8 pages, 6 figures, Project Page: https://binicey.github.io/DSM

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06448 2025-10-09 cs.LG cs.AI 71%

How NOT to benchmark your SITE metric: Beyond Static Leaderboards and Towards Realistic Evaluation

Prabhant Singh, Sibylle Hess, Joaquin Vanschoren

机构 * Eindhoven University of Technology(埃因霍温理工大学)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04374 2025-10-07 cs.LG cs.AI cs.CY 71%

GDPval: Evaluating AI Model Performance on Real-World Economically Valuable Tasks

Tejal Patwardhan, Rachel Dias, Elizabeth Proehl, Grace Kim, Michele Wang, Olivia Watkins, Simón Posada Fishman, Marwan Aljubeh, Phoebe Thacker, Laurance Fauconnet, Natalie S. Kim, Patrick Chao, Samuel Miserendino, Gildas Chabot, David Li, Michael Sharman, Alexandra Barr, Amelia Glaese, Jerry Tworek

机构 * OpenAI

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01179 2025-10-02 cs.LG cs.AI cs.CL 71%

TOUCAN: Synthesizing 1.5M Tool-Agentic Data from Real-World MCP Environments

Zhangchen Xu, Adriana Meza Soria, Shawn Tan, Anurag Roy, Ashish Sunil Agrawal, Radha Poovendran, Rameswar Panda

机构 * University of Washington(华盛顿大学) MIT-IBM Watson AI Lab(MIT-IBM Watson人工智能实验室)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI、cs.LG

Comments 35 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19320 2025-08-29 cs.CV cs.AI 71%

MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation

Ming Chen, Liyuan Cui, Wenyuan Zhang, Haoxian Zhang, Yan Zhou, Xiaohan Li, Songlin Tang, Jiwen Liu, Borui Liao, Hejia Chen, Xiaoqiang Liu, Pengfei Wan

机构 * Kling Team, Kuaishou Technology(快手科技 Kling 团队) Zhejiang University(浙江大学) Tsinghua University(清华大学)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI、cs.CV

Comments Technical Report. Project Page: https://chenmingthu.github.io/milm/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00159 2025-08-06 cs.AI cs.CY cs.LG econ.TH math.OC 71%

Model-Based Soft Maximization of Suitable Metrics of Long-Term Human Power

Jobst Heitzig, Ram Potham

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏