arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Peking University(北京大学)

2026-01-08 至 2026-01-08 共收录 14
2601.04137 2026-01-08 cs.RO cs.AI cs.CV

Wow, wo, val! A Comprehensive Embodied World Model Evaluation Turing Test

哇,哇,val!一个综合的具身世界模型评估图灵测试

Chun-Kai Fan, Xiaowei Chi, Xiaozhu Ju, Hao Li, Yong Bao, Yu-Kai Wang, Lizhang Chen, Zhiyuan Jiang, Kuangzhi Ge, Ying Li, Weishi Mi, Qingpo Wuwu, Peidong Jia, Yulin Luo, Kevin Zhang, Zhiyuan Qin, Yong Dai, Sirui Han, Yike Guo, Shanghang Zhang, Jian Tang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) Beijing Innovation Center of Humanoid Robotics(人形机器人创新中心) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文提出Wow-wo-val基准测试,评估视频基础模型在具身人工智能中的生成能力,发现其在长期规划和物理一致性上表现有限,揭示了现实世界与生成视频之间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03956 2026-01-08 cs.RO

CoINS: Counterfactual Interactive Navigation via Skill-Aware VLM

基于技能感知的反事实交互导航:通过技能感知视觉语言模型

Kangjie Zhou, Zhejia Wen, Zhiyong Zhuo, Zike Yan, Pengying Wu, Ieng Hou U, Shuaiyang Li, Han Gao, Kang Ding, Wenhan Cao, Wei Pan, Chang Liu

机构 * School of Advanced Manufacturing and Robotics, Peking University(北京大学先进制造与机器人学院) Department of Mechanical and Automation Engineering, The Chinese University of Hong Kong(香港中文大学机械与自动化工程系) College of Design and Engineering, National University Of Singapore(新加坡国立大学设计与工程学院) Department of Computer Science, The University of Manchester(曼彻斯特大学计算机科学系)

AI总结 CoINS通过整合技能感知推理与稳健执行,提升机器人在复杂环境中的交互导航能力。

Comments 17 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03908 2026-01-08 cs.CL

Decide Then Retrieve: A Training-Free Framework with Uncertainty-Guided Triggering and Dual-Path Retrieval

决定后再检索:一种无训练框架,结合不确定性引导触发和双路径检索

Wang Chen, Guanqiang Qi, Weikang Li, Yang Li, Deguo Xia, Jizhou Huang

机构 * Baidu Inc(百度公司) The University of Hong Kong(香港大学) Peking University(北京大学)

AI总结 DTR通过不确定性引导触发和双路径检索,提升问答性能并减少冗余检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17347 2026-01-08 cs.CV

Semantic-E2VID: a Semantic-Enriched Paradigm for Event-to-Video Reconstruction

语义增强的事件到视频重建范式:Semantic-E2VID

Jingqian Wu, Yunbo Jia, Shengpeng Xu, Edmund Y. Lam

机构 * organization= Department of Electrical Electronic Engineering, The University of Hong Kong , city= Hong Kong , country= China organization= School of Artificial Intelligence, Beijing University of Posts organization= State Key Laboratory of Multimedia Information Processing National Engineering Research Center of Visual Technology, School of Computer Science, Peking University , city= Beijing , postcode= 100871 , country= China

AI总结 Semantic-E2VID通过引入语义学习和融合机制,提升事件到视频重建的准确性与语义完整性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11830 2026-01-08 cs.CV cs.AI

VISTA: Mitigating Semantic Inertia in Video-LLMs via Training-Free Dynamic Chain-of-Thought Routing

VISTA: 通过无训练动态推理路由缓解视频大语言模型中的语义惯性

Hongbo Jin, Jiayu Ding, Siyi Xie, Guibo Luo, Ge Li

机构 * School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学)

AI总结 VISTA通过动态推理路由和潜在推理共识机制,缓解视频大语言模型中的语义惯性问题,提升视频理解性能。

Comments 19 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18484 2026-01-08 cs.CV cs.CL

PM4Bench: Benchmarking Large Vision-Language Models with Parallel Multilingual Multi-Modal Multi-task Corpus

PM4Bench: 通过平行多语言多模态多任务语料库对大型视觉-语言模型进行基准测试

Junyuan Gao, Jiahe Song, Jiang Wu, Runchuan Zhu, Guanlin Shen, Shasha Wang, Xingjian Wei, Haote Yang, Songyang Zhang, Weijia Li, Bin Wang, Dahua Lin, Lijun Wu, Conghui He

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) Sun Yat-Sen University(中山大学) Chinese University of Hong Kong(香港中文大学)

AI总结 PM4Bench通过平行多语言多模态多任务语料库评估大型视觉-语言模型,揭示跨语言性能差异与OCR能力的关系。

Comments Equal contribution: Junyuan Gao, Jiahe Song, Jiang Wu; Corresponding author: Conghui He

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18414 2026-01-08 cs.CV

U-REPA: Aligning Diffusion U-Nets to ViTs

U-REPA: 对齐扩散U-Net与ViT

Yuchuan Tian, Hanting Chen, Mengyu Zheng, Yuchen Liang, Chao Xu, Yunhe Wang

机构 * State Key Lab of General AI, School of Intelligence Science and Technology, Peking University(人工智能通用基础理论国家重点实验室,智能科学与技术学院,北京大学) Huawei Noah’s Ark Lab(华为诺亚实验室) The University of Sydney(悉尼大学) School of Mathematical Sciences, Peking University(数学科学学院,北京大学)

AI总结 U-REPA通过改进的表示对齐方法,提升扩散模型在U-Net架构中的生成质量和收敛速度。

Comments 22 pages, 8 figures

Journal ref NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03723 2026-01-08 cs.LG

ETR: Outcome-Guided Elastic Trust Regions for Policy Optimization

ETR: 以结果为导向的弹性信任区域用于策略优化

Shijie Zhang, Kevin Zhang, Zheyuan Gu, Xiang Guo, Rujun Guo, Shaoyu Liu, Guanjun Jiang, Xiaozhao Wang

机构 * Alibaba Group(阿里巴巴集团) Peking University(北京大学)

AI总结 ETR通过动态信任区域机制,提升策略优化的信号利用效率和探索稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03701 2026-01-08 cs.LG cs.AI

Inference Attacks Against Graph Generative Diffusion Models

针对图生成扩散模型的推断攻击

Xiuling Wang, Xin Huang, Guibo Luo, Jianliang Xu

机构 * Hong Kong Baptist University(香港 Baptist 大学) Peking University(北京大学)

AI总结 本文针对图生成扩散模型提出三种推断攻击,并设计防御机制以减少信息泄露风险。

Comments This work has been accepted by USENIX Security 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03649 2026-01-08 cs.CL

SyncThink: A Training-Free Strategy to Align Inference Termination with Reasoning Saturation

SyncThink: 一种无需训练的策略,用于将推理饱和与推理终止对齐

Gengyang Li, Wang Cai, Yifeng Gao, Yunfang Wu

机构 * National Key Laboratory for Multimedia Information Processing, Peking University(北京大学多媒体信息处理国家级重点实验室) School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) School of Computer Science, Peking University(北京大学计算机科学学院)

AI总结 SyncThink是一种无需训练的解码方法,通过监控模型自身的推理过渡信号来终止推理,从而减少CoT的开销并提高推理效率。

Comments 14 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23163 2026-01-08 cs.CL cs.AI

Beyond Direct Generation: A Decomposed Approach to Well-Crafted Screenwriting with LLMs

超越直接生成:一种分解方法用于利用LLM进行精心构思的剧本创作

Hang Lei, Shengyi Zong, Zhaoyan Li, Ziren Zhou, Hao Liu, Liang Yu

机构 * Alibaba Group(阿里巴巴集团) Peking University(北京大学)

AI总结 本研究提出双阶段细化框架,通过分解生成方法提升LLM在剧本创作中的表现,实现高质量剧本生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25687 2026-01-08 cs.RO

OmniNav: A Unified Framework for Prospective Exploration and Visual-Language Navigation

OmniNav:一个统一的框架,用于前瞻性探索和视觉-语言导航

Xinda Xue, Junjun Hu, Minghua Luo, Shichao Xie, Jintao Chen, Zixun Xie, Kuichen Quan, Wei Guo, Mu Xu, Zedong Chu

机构 * Alibaba Group(阿里巴巴集团) Peking University(北京大学)

AI总结 OmniNav通过统一框架实现多导航任务和前沿探索,提升机器人自主导航的精度与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21318 2026-01-08 cs.AI

Beyond Chemical QA: Evaluating LLM's Chemical Reasoning with Modular Chemical Operations

超越化学问答:利用模块化化学操作评估LLM的化学推理

Hao Li, He Cao, Bin Feng, Yanjun Shao, Xiangru Tang, Zhiyuan Yan, Li Yuan, Yonghong Tian, Yu Li

机构 * Pengcheng Laboratory(鹏城实验室) International Digital Economy Academy(国际数字经济学院) School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院) School of AI for Science, Peking University(北京大学科学人工智能学院) Yale University(耶鲁大学)

AI总结 本文提出ChemCoTBench框架,通过模块化化学操作评估LLM在化学推理中的能力,解决分子优化和反应预测等复杂任务。

Comments Accepted by NeurIPS 2025 Dataset Track, 22 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23314 2026-01-08 cs.AI cs.CL cs.LG cs.MA

SPIO: Ensemble and Selective Strategies via LLM-Based Multi-Agent Planning in Automated Data Science

SPIO:基于LLM的多智能体规划的集成与选择策略在自动化数据科学中的应用

Wonduk Seo, Juhyeon Lee, Yanjun Shao, Qingshan Zhou, Seunghyun Lee, Yi Bu

机构 * Enhans Peking University(北京大学) Yale University(耶鲁大学)

AI总结 SPIO通过基于LLM的多智能体规划,在自动化数据科学中实现了集成与选择策略,提升了流程的灵活性和准确性。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏