arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Peking University(北京大学)

共收录 3038
2608.17988 2026-08-19 cs.CV 新提交

GS-Voxel: Fitting-Free Structured Latents for Large-Scale 3DGS Generation

GS-Voxel:用于大规模3DGS生成的免拟合结构化隐变量

Ming Qian, Zijian Wang, Minchao Sun, Jincheng Xiong, Hang Zhang, Mu Xu, Chi Wang, Baoquan Chen

机构 * Zhejiang University(浙江大学) Peking University(北京大学) Amap(高德地图) Alibaba(阿里巴巴)

AI总结 GS-Voxel是免拟合结构化隐变量框架,可将预优化3DGS重建转为稀疏活跃体素,通过GS专用VAE编码为稀疏3D隐变量,结合图像条件流模型实现大规模航空3DGS场景生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17962 2026-08-19 cs.RO 新提交

PRISM: Precision and contact-rich Real-world Industrial Skill dataset with Multimodal sensing

PRISM:具备多模态感知的高精度高接触真实工业技能数据集

Tengbo Yu, Jiahao Wu, Hanning Wang, Rui Chen, Chuanhou Liu, Chuang Sun, Hangxin Liu

机构 * State Key Laboratory of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院通用人工智能国家重点实验室) Delta Intelligence(三角洲智能公司) PKU-Wuhan Institute for Artificial Intelligence(北京大学武汉人工智能研究院) Hubei Humanoid Robot Innovation Center Co., Ltd.(湖北人形机器人创新中心有限公司) China Academy of Information and Communications Technology(中国信息通信研究院)

AI总结 本文介绍PRISM——一个面向高接触工业操作的大规模多模态数据集,涵盖25余项操作任务,包含5000余条共45小时的遥操作演示,为高精度工业场景的多模态感知与控制提供真实基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17852 2026-08-19 cs.SD cs.MM 新提交

UniVerse: Benchmarking and Enhancing LALMs on Culturally Inclusive Low-Resource Music Understanding

UniVerse:针对文化包容性低资源音乐理解的基准测试与增强

Ziya Zhou, Shangda Wu, Shenyang Xu, Yutong Zheng, Dafang Liang, Suin Chung, Danbinaerin Han, Junyan Jiang, Yongyi Zang, Ruibin Yuan, Rongxiu Zhong, Shilei Zhang, Junlan Feng, Jinglei Liu, Haotian Zhou, Zijin Li, Dasaem Jeong, Wei Xue, Yike Guo

机构 * Sogang University(西江大学) KAIST(韩国科学技术院) NYU Shanghai(上海纽约大学) JIUTIAN Research, China Mobile(中国移动九天研究院) The State Key Laboratory of Multimedia Information Processing, Peking University(北京大学多媒体信息处理国家重点实验室) China Mobile (Hong Kong) Innovation Research Institute(中国移动(香港)创新研究院) Central Conservatory of Music(中央音乐学院)

AI总结 该研究针对低资源音乐理解问题,推出UniVerse基准与数据集,训练LALMs并研究多模态不平衡学习策略,实现性能提升但仍存在深层音乐理解的差距。

Comments 21 pages, 7 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17337 2026-08-19 cs.CV cs.ET 新提交

Learning latent progression states from spatial heterogeneity in uterine histopathology

从子宫组织病理学的空间异质性中学习潜在进展状态

Qiming He, Yan Liu, Shuang Ge, Fan Yang, Yuxiang Wang, Ieng Man Zhang, Jing Yang, Zihao Jia, Ajin Hu, Yexing Zhang, Zixiu Song, Qiang Huang, Xiaoya Zhao, Zihan Wang, Xianjing Zheng, Yijun Zheng, Liling Lin, Shuxing Liu, Bin Bao, Yue Xie, Tian Guan, Yonghong He, Congrong Liu

机构 * Fuzhou University(福州大学) Fuzhou University Affiliated Provincial Hospital(福州大学附属省立医院) Interdisciplinary Institute for Medical Engineering, Fuzhou University(福州大学医学工程交叉研究院) Medical Optical Technology R&D Center, Research Institute of Tsinghua, Pearl River Delta(清华珠三角研究院医学光学技术研发中心) Peking University Health Science Center(北京大学医学部) Third Hospital, School of Basic Medical Sciences, Peking University Health Science Center(北京大学医学部基础医学院第三医院) Institute of Biopharmaceutical and Health Engineering, Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院生物医药与健康工程研究院) Tsinghua University(清华大学) Peng Cheng Laboratory(鹏城实验室) Jinfeng Laboratory(金凤实验室)

AI总结 本研究开发子宫特异性计算病理学框架SpaTIE,从子宫组织病理学空间异质性中学习形态感知表征,推断与肿瘤进展相关的空间连贯状态,关联多组学特征并支持临床预测任务,为肿瘤状态发现提供新工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17163 2026-08-19 cs.LG cs.AI 新提交

Q-Learning With World Models

结合世界模型的Q学习

Perry Dong, Yueru Jia, Chelsea Finn, Dorsa Sadigh

机构 * Stanford University(斯坦福大学) Peking University(北京大学)

AI总结 本研究提出QWM框架,将世界模型与标准Q学习结合,在真实环境训练中避免复合模型偏差,在Robomimic和LIBERO基准上的样本效率与性能均优于现有SOTA方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13538 2026-08-19 cs.CL 版本更新

SAEVerbalizer: Generating Explanations for Sparse Autoencoder Features via Representation Verbalization

SAEVerbalizer:通过表示 verbalization 为稀疏自编码器特征生成解释

Weihan Meng, Hongzhu Guo, Yi Jing, Dewen Liu, Zijun Yao, Xiaozhi Wang, Lei Hou, Juanzi Li

机构 * Tsinghua University(清华大学) Peking University(北京大学) Fudan University(复旦大学)

AI总结 该研究提出 SAEVerbalizer 框架,通过微调 LLM 下游层生成 SAE 特征的自然语言解释,解决了传统解释方法的表面性与低效率问题,其 verbalization 能力可泛化、迁移并扩展到不同 LLM 的 SAE 特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16299 2026-08-19 cs.CV 版本更新

Repurposing 3D Generative Model for Autoregressive Layout Generation

将3D生成模型重新利用于自回归布局生成

Haoran Feng, Yifan Niu, Zehuan Huang, Yang-Tian Sun, Yuxin Peng, Lu Sheng

机构 * School of Software, Beihang University(北航软件学院) Tsinghua University(清华大学) University of Hong Kong(香港大学) Tencent Hunyuan(腾讯文英) Peking University(北京大学)

AI总结 本文提出LaviGen框架,利用3D生成模型直接在3D空间中生成布局,通过自回归过程建模几何关系和物理约束,提升3D场景的物理合理性与效率。

Comments this https URL (https://fenghora.github.io/LaviGen-Page/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22782 2026-08-19 cs.CV 版本更新

Know3D: Prompting 3D Generation with Knowledge from Vision-Language Models

Know3D: 通过视觉-语言模型的知识提示3D生成

Wenyue Chen, Wenjue Chen, Peng Li, Qinghe Wang, Xu Jia, Heliang Zheng, Rongfei Jia, Yuan Liu, Ronggang Wang

机构 * Peking University(北京大学) Math Magic(数学魔术) The Hong Kong University of Science and Technology(香港科学与技术大学) Guangdong Provincial Key Laboratory of Ultra High Definition Immersive Media Technology(广东省超高清沉浸媒体技术重点实验室) Dalian University of Technology(大连理工大学)

AI总结 本文提出Know3D框架,利用多模态大语言模型的知识提升3D生成的可控性,通过潜在状态注入实现语言可控的后视图生成,改进3D生成的几何细节与一致性。

Comments ECCV2026 page: this https URL (https://xishuxishu.github.io/Know3D.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23119 2026-08-19 cs.CL 版本更新

Dripper: Token-Efficient Main HTML Extraction with a Lightweight LM

Dripper:一种轻量级的HTML主内容提取框架

Mengjie Liu, Jiahui Peng, Wenchang Ning, Pei Chu, Jiantao Qiu, Ren Ma, He Zhu, Rui Min, Lindong Lu, Linfeng Hou, Kaiwen Liu, Yuan Qu, Zhenxiang Li, Chao Xu, Zhongying Tu, Wentao Zhang, Conghui He

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Peking University(北京大学)

AI总结 Dripper通过轻量级框架实现高效HTML主内容提取,兼顾效率与准确性,开源模型促进高质量数据集构建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14790 2026-08-19 cs.LG 版本更新

Continuous Evolution Pool: Taming Recurring Concept Drift in Online Time Series Forecasting

连续进化池:在在线时间序列预测中驯服反复出现的概念漂移

Tianxiang Zhan, Ming Jin, Yuanpeng He, Yuxuan Liang, Shirui Pan

机构 * University of Electronic Science and Technology of China(电子科技大学) Griffith University(格里菲斯大学) Peking University(北京大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 CEP通过动态维护专门预测器池,有效解决在线时间序列预测中反复出现的概念漂移问题,减少预测误差20%以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19513 2026-08-19 cs.LG 版本更新

Row-Stochastic Matrices Can Provably Outperform Doubly Stochastic Matrices in Decentralized Learning

行随机矩阵在去中心化学习中可证明优于双随机矩阵

Bing Liu, Boao Kong, Limin Lu, Kun Yuan, Chengcheng Zhao

机构 * College of Control Science and Engineering, Zhejiang University(浙江大学控制科学与工程学院) Center for Data Science, Peking University(北京大学数据科学中心) Center for Machine Learning Research, Peking University(北京大学机器学习研究中心)

AI总结 本文通过加权希尔伯特空间框架,严格证明了行随机矩阵相比双随机矩阵在去中心化学习中具有更快的收敛速度,并给出了拓扑条件指导设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16853 2026-08-18 cs.RO 新提交

FlexWorm: Primitive-augmented Hybrid Contact-motion Planning for Suction-based Multi-segment Deformable Robots

FlexWorm:用于基于吸盘的多段可变形机器人的基元增强混合接触-运动规划

Zili Tang, Tiecheng Guo, Qinyue Zhang, Meng Guo

机构 * School of Advanced Manufacturing and Robotics, Peking University(北京大学先进制造与机器人学院)

AI总结 FlexWorm框架为基于吸盘的多段可变形机器人提出规划方法,含IKHS与PaHS,仿真和硬件实验表明其在复杂环境下规划性能更优且鲁棒性良好。

Comments 9 pages, 12 figures, accepted for publication in IEEE Robotics and Automation Letters (RA-L), 2026. Supplementary video: https://youtu.be/OQR5Sx5Bwnc

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16837 2026-08-18 cs.RO cs.AI 新提交

HAF: Adapting Generalist VLAs to Humanoid Whole-Body Loco-manipulation via Hierarchical Action Flow and Spectral Latent RL

HAF:通过分层动作流与谱潜在线性RL将通用VLAs适配至人形机器人全身运动操作

Langzhe Gu, Chengkai Hou, Meng Li, Xinhua Wang, Jiaming Liu, Xinyuan Lv, Bowei Zhang, Shuanghao Bai, Guangrun Li, Jingyang He, Gaole Dai, Ziluo Ding, Zhiyuan Xu, Kuan Cheng, Jian Tang, Zhengping Che, Shanghang Zhang

机构 * Xi’an Jiaotong University(西安交通大学) Peking University(北京大学) Nankai University(南开大学)

AI总结 研究针对通用VLAs难以适配人形机器人全身运动操作的问题,提出HAF框架,通过分层动作流生成器与潜空间RL流水线实现高效迁移优化,在7项任务上性能优于单阶段VLA基线。

Comments Project page: https://grange007.github.io/HAF

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16647 2026-08-18 cs.CL 新提交

Every Coin Has Two Sides: On the Dual Nature of Generalization in On-Policy Distillation of Large Language Models

硬币皆有两面:关于大型语言模型的策略内蒸馏中泛化的双重性质

Zhaoyi Li, Deyang Kong, Yuan Wei, Evan Yang, Ranran Shen, Mahardika Krisna Ihsani, Ming Yang, Wei Zhang, Chuan Hao, Jian Yang, Ran Tao, Bryan Dai, Shikun Zhang, Wei Ye, Ying Wei, Defu Lian

机构 * University of Science and Technology of China(中国科学技术大学) Peking University(北京大学) IQuest Research(IQuest研究院) MBZUAI(穆罕默德·本·扎耶德人工智能大学) Zhejiang University(浙江大学)

AI总结 本研究探究大型语言模型策略内蒸馏(OPD)的泛化特性,发现其迁移教师推理行为而非答案,同源配对泛化性强,异源配对适配性有限,多教师组合存在能力跷跷板效应,为诊断多教师OPD提供了视角。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16182 2026-08-18 cs.LG cs.AI 新提交

Understanding and Stabilizing Deep Q-Learning via Controlled Bootstrapping and Regulated Value Dynamics

通过受控自举和调节值动态理解并稳定深度Q学习

Bozhou Chen, Yongyi Wang, Hanyu Liu, Xionghui Yang, Wenxin Li

机构 * School of Computer Science, Peking University(北京大学计算机学院)

AI总结 本研究系统分析深度Q学习的不稳定性来源,提出受控自举等稳定原则,在Atari-100K和Procgen上实现了竞争力性能与更优训练稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16134 2026-08-18 cs.LG cs.HC eess.SP q-bio.NC 新提交

Multi-Feature Riemannian Hypergraph for Online Test-Time Adaptation of Motor Imagery Brain-Computer Interface

用于运动想象脑机接口在线测试时自适应的多特征黎曼超图

Siqi Li, Zhi Li, Tong Liu, Shuai Zhang, Yanfei Jia, Zhiqiang Yi, Jue Xie, Ni Ji

机构 * Peking University(北京大学) Chinese Institute for Brain Research(中国脑科学研究院) NeuCyber Neurotech(纽赛博神经科技公司) Beijing Medical University(北京医科大学) Chinese Academy of Medical Sciences & Peking Union Medical College(中国医学科学院北京协和医学院)

AI总结 针对MI-BCI解码的跨天可迁移性与在线运行挑战,提出MRieHy框架,通过融合黎曼几何的双超图实现在线测试时自适应,在三类数据集上性能优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15863 2026-08-18 cs.RO cs.AI cs.CL cs.CV cs.MM 新提交

Scaling Manual-Grounded Appliance Manipulation with Data Synthesis and Unified Planning

通过数据合成与统一规划扩展基于手册的家电操作规模

Yuxing Long, Lei Kang, Ziyan Yu, Yuzheng Gao, Bin Cheng, Jiyao Zhang, Xiaoqi Li, Haolin Yang, Dongjiang Li, Hui Shen, Hao Dong

机构 * Center on Frontiers of Computing Studies, School of Computer Science, Peking University(北京大学计算机学院计算前沿研究中心) Beijing University of Aeronautics and Astronautics(北京航空航天大学) Jingdong Technology Information Technology Co., Ltd(京东科技信息技术有限公司)

AI总结 针对现有大模型缺乏支持基于手册的家电操作规划的数据集的问题,提出MAGE数据合成流水线构建UseAppliance数据集,开发AppliancePlan模型,在RealAppliance-Bench和真实机器人实验中表现优异,推进通用家用机器人发展。

Comments Accepted by ACM MM 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15698 2026-08-18 cs.CV cs.IR 新提交

ConceptFormer: Learning Adaptive Latent Concepts for Query-Document Alignment in Visual Document Retrieval

ConceptFormer:学习自适应潜在概念以实现视觉文档检索中的查询-文档对齐

Peng Chunyi, Xu Zhipeng, Yan Yukun, Liu Zhenghao, Yu Shi, Mei Sen, Sun Yubo, Zhang Yongheng, Zhou Jie, Gu Yu, Yu Ge, Sun Maosong

机构 * Northeastern University(东北大学) Tsinghua University(清华大学) Peking University(北京大学)

AI总结 针对视觉文档检索中现有监督信号的局限,本文提出ConceptFormer框架,以自适应潜在概念为中间表示衔接语义鸿沟,在基准测试中较最强基线实现了16.7%、22.1%的NDCG@10相对提升,性能优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15654 2026-08-18 cs.CL cs.AI 新提交

When Stories Evolve: Benchmarking LLM Storytelling Across Agent Architectures in Open-Ended World Simulations

当故事演变时:在开放世界模拟中针对智能体架构对大语言模型故事讲述能力进行基准测试

Yuqi Chen, Sixuan Li, Yunfeng Cai, Xueai Li, Ka Man Yan, Ying Li

机构 * The University of Hong Kong(香港大学) Peking University(北京大学) Tsinghua University(清华大学) Beijing Institute of Mathematical Sciences and Applications (BIMSA)(北京数学科学与应用研究院)

AI总结 该研究推出WSE-bench基准,评估开放世界模拟中不同智能体架构的大语言模型故事讲述的持续生成、规范一致性和有意义发展,发现三者存在竞争关系,模型规模仅提升持续生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15365 2026-08-18 cs.LG 新提交

Does 1/2-Tsallis-INF Also Work Well for Best-Arm Identification?

1/2-Tsallis-INF 是否也能很好地用于最优臂识别?

Jingxin Zhan, Yuze Han, Zhihua Zhang

机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院) Center for Applied Statistics and School of Statistics, Renmin University of China(中国人民大学应用统计中心与统计学院)

AI总结 该研究探讨 1/2-Tsallis-INF 能否用于最优臂识别,通过构造 Lyapunov 函数得出其失败概率的多项式上下界,证明指数 2 本质紧。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15284 2026-08-18 cs.RO cs.AI cs.CL cs.CV cs.MM 新提交

VTInstructor: Visual Trajectory Prompting for Navigation Instruction Generation in Continuous Environments

VTInstructor:面向连续环境中导航指令生成的视觉轨迹提示

Haolin Yang, Yuxing Long, Zihan Yang, Hao Dong

机构 * Peking University(北京大学) PrimeBot

AI总结 本研究提出首个面向连续环境的VLN指令生成框架VTInstructor,通过视觉轨迹提示技术生成导航指令,在基准测试中刷新最优性能,提升跟随器成功率并为下游任务带来数据增强增益。

Comments accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15018 2026-08-18 cs.AI 新提交

S2-MoE: Enabling Efficient Self-Speculative Decoding for Mixture-of-Experts on Edge Devices

S2-MoE:在边缘设备上实现混合专家模型的高效自推测解码

Haochen Huang, Shengxuan Qiu, Meng Li

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) School of Integrated Circuits, Peking University(北京大学集成电路学院) School of Electronics Engineering and Computer Science, Peking University(北京大学电子工程与计算机科学学院)

AI总结 S2-MoE是面向边缘设备MoE推理的高效自推测解码框架,通过路由感知自适应扩展、复用感知门控等设计,使MoE推理在边缘设备上最高获5.3倍加速,平均约2.0倍。

Comments 13 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14854 2026-08-18 cs.CV 新提交

Zero-MELO: Test-Time Evidence Calibration with Multimodal LLMs for Zero-Shot Micro-Gesture Recognition

Zero-MELO:基于多模态大语言模型的测试时证据校准用于零样本微手势识别

Chengyan Wang, Hanliang Xie, Yueyi Yang, Haoyu Chen

机构 * University of Oulu(奥卢大学) Peking University(北京大学)

AI总结 该研究针对多模态大语言模型在微手势识别中局部证据不足、分数偏差的瓶颈,提出Zero-MELO框架,结合树搜索、测试时校准与多线索融合,在iMiGUE和MA-52数据集上显著优于Qwen2.5-VL基线。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14684 2026-08-18 cs.LG cs.AI 新提交

Mitigating Rubric Interference in LLM Judges via On-Policy Self-Distillation

通过策略内自蒸馏缓解大语言模型评审员中的评分标准干扰

Dingyao Yu, Tong Zhang, Yutao Mou, Yunxiao Zhang, Wei Ye, Shikun Zhang

机构 * Peking University(北京大学) Weixin Al, Tencent Inc(腾讯公司微信智能)

AI总结 本研究针对LLM评审员多评分标准评估时的干扰问题,提出SARA方法,通过策略内自蒸馏提升评估一致性,且该一致性可跨数据集迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12385 2026-08-18 cs.AI 版本更新

Decode-Branch Transformers: Decoupling the Primary Prefill Path from Additional Decode Computation

双流式Transformer:将主预填路径与额外解码计算解耦

Liming Liu, Mingze Wang, Tuo Zhao

机构 * Georgia Institute of Technology(佐治亚理工学院) Peking University(北京大学)

AI总结 该研究提出双流式Transformer,将主预填路径与额外解码计算解耦,通过共享权重与缓存降低推理成本,在多架构与数据配置下实现更低验证损失,且可灵活分配MoE专家预算。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03025 2026-08-18 cs.AI 版本更新

DiffImaginE: Imagine to Verify Entity Types with Diffusion

DiffImaginE:通过想象验证实体类型

Feng Zhang, Feiyu Han, Rongxin Yang, Yang Liu, Yancheng Chen, Rui Wang, Yingguang Yang, Tian Xueyun, Chongyang Zhang, Hao Zheng, Xu Kefu, Congjing Ran, Fuhai Chen, Bin Chong

机构 * Fuzhou University(福州大学) Chinese Academy of Sciences(中国科学院) Peking University(北京大学) Alibaba Group(阿里巴巴集团) University of Science and Technology of China(中国科学技术大学) Fullive Innovation (Beijing) AI Technology Co., Ltd.(福莱创新(北京)人工智能科技有限公司) Baidu(百度) Wuhan University(武汉大学)

AI总结 DiffImaginE将多模态命名实体识别的类型验证建模为条件潜在扩散推理,在Twitter-2015和Twitter-2017数据集上,相比确定性对照模型取得了一致的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02474 2026-08-18 cs.CV 版本更新

EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation

EchoCache:面向高效音频驱动视频生成的能量引导跨模态缓存

Jiayu Chen, Xiaoyu Wu, Rongshan Gao, Maoliang Li, Zihao Zheng, Xinhao Sun, Hailong Zou, Guojie Luo, Xiang Chen

机构 * Peking University(北京大学) Taiyuan University of Technology(太原理工大学)

AI总结 EchoCache是一种能量引导跨模态缓存框架,通过利用音频时频能量锚点与动态缓存机制,在保持音频驱动视频生成质量的同时,实现了2.46倍的推理加速,优化了延迟-质量权衡。

Comments EchoCache is honored to be accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12485 2026-08-18 cs.LG cs.AI 版本更新

Speculative Rollback Correction for Quality-Diverse Web Agent Imitation

面向质量多样性的Web智能体模仿的推测性回滚修正

Longkun Hao, Hongyu Lin, Hao Li, Zhuowen Liu, Zhichao Yang, Haojie Hao, Dongshuo Huang, Haitao Yang, Hongyu Ge, Ming jie Xie, Yanjun Wu, Zi Hao Yin, Yan Bai, Yihang Lou

机构 * Beihang University(北京航空航天大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) The Hong Kong University of Science and Technology(香港科技大学) Northwestern Polytechnical University(西北工业大学) Tsinghua University(清华大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Peking University(北京大学)

AI总结 提出推测性回滚修正(SRC)框架,通过固定视野分支审查和回滚机制,在减少教师查询的同时保持轨迹多样性,在WebArena-Infinity上收集了977条通过验证的轨迹和9183个下一步动作示例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08759 2026-08-18 cs.CV cs.RO 版本更新

Dissecting Embodied Abilities in Multimodal Language Models through Skill-level Evaluation and Diagnosis

通过技能级评估与诊断解构多模态语言模型的具身能力

Yu Qi, Haibo Zhao, Ziyu Guo, Siyuan Ma, Ziyan Chen, Yaokun Han, Renrui Zhang, Zitiantao Lin, Yizhe Zhu, Shiji Xin, Yijian Huang, Boce Hu, Kai Cheng, Peiheng Wang, Jiazheng Liu, Jiayi Zhang, Yizhe Zhu, Wenqing Wang, Yiran Qin, Haojie Huang, Lawson L. S. Wong

机构 * Northeastern University, Boston, MA, USA The Chinese University of Hong Kong, Hong Kong, China Peking University, Beijing, China Westlake University, Hangzhou, China Harvard University, Cambridge, MA, USA Purdue University, West Lafayette, IN, USA University of Oxford, Oxford, United Kingdom

AI总结 本文提出BEAR基准,通过分解具身任务为14个原子技能进行细粒度评估,发现感知能力是推理失败的主要瓶颈,并提出BEAR-Agent多模态对话代理,显著提升具身技能性能。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21351 2026-08-18 cs.LG cs.AI 版本更新

Analytical Provisioning for Attention-FFN Disaggregated LLM Serving under Stochastic Workloads

注意力-前馈网络解耦大语言模型服务的分析资源配置

Chendong Song, Meixuan Wang, Hang Zhou, Hong Liang, Yuan Lyu, Zixi Chen, Yuwei Fan, Zijie Zhou

机构 * Dept. of Industrial Engineering and Decision Analytics HKUST(工业工程与决策分析系香港科技大学) Dept. of Computer Science and Technology Tsinghua University(计算机科学与技术系清华大学) IIIS Tsinghua University(清华大学信息学院) Huawei Hong Kong Research Center(华为香港研发中心) School of Mathematical Sciences Peking University(北京大学数学科学学院)

AI总结 本文提出在随机负载下,针对注意力-前馈网络解耦架构的分析资源配置框架,通过考虑工作负载统计量θ,确定最优注意力与前馈网络比例,减少阻塞和设备空闲时间。

Comments Submitted to Neurips 2026

详情

展开后加载摘要…

URL PDF HTML 收藏