arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Beihang University(北京航空航天大学)

2026-08-25 至 2026-08-25 共收录 7
2608.23329 2026-08-25 cs.CV cs.AI 新提交

Thinking Beyond Videos: Unifying Video Reasoning and Deep Research for Open-World Video Agents

超越视频:统一视频推理与深度研究的开放世界视频智能体

Wenqi Liu, Shijie Ma, Yunxiao Wang, Meng Liu, Qile Su, Han Liu, Bohan Hou, Xuanyu Zheng, Changyi Liu, Tianke Zhang, Haonan Fan, Kaiyu Jiang, Yingxin Li, Jiankang Chen, Xu Wang, Bin Wen, Tingting Gao, Han Li, Jianhua Yin, Yinwei Wei, Xuemeng Song

机构 * Shandong University(山东大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beihang University(北京航空航天大学) City University of Hong Kong(香港城市大学) Nanyang Technological University(南洋理工大学) Kuaishou Technology(快手科技) Southern University of Science and Technology(南方科技大学)

AI总结 本研究提出统一视频推理与深度研究的VideoRover框架,构建相关数据集与基准,其8B-RL模型在无工具直接回答场景性能接近专有模型,优于同工具套件的更大开源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23189 2026-08-25 cs.CV 新提交

EchoWM: Open and Enterable Omnimodal World Models

EchoWM:开放且可进入的全模态世界模型

Songchun Zhang, Yaowei Li, Junhao Zhuang, Weiyang Jin, Haoyu Wang, Xin Lu, Yilang Sun, Shiyi Zhang, Haoran Li, Xiaoxiao Ma, Yuming Li, Yijun Liu, Yaofeng Su, Yanwen Ma, Haoyu Wu, Zihan Su, Yue Ma, Lvmin Zhang, Haoyang Huang, Zeyue Xue, Anyi Rao, Nan Duan

机构 * HKUST(香港科技大学) PKU(北京大学) Joy Future Academy, JD(京东探索研究院) HKU(香港大学) THU(清华大学) USTC(中国科学技术大学) FDU(复旦大学) Beihang University(北京航空航天大学) Stanford University(斯坦福大学)

AI总结 该研究提出EchoWM全模态世界模型,围绕相机意图组织交互,构建互补数据引擎并采用渐进式训练等方法,在公开基准上实现强轨迹跟随与高视觉质量,支持跨视角交互及长序列多模态同步生成。

Comments 42 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22701 2026-08-25 cs.RO 新提交

Physics Filtering Favors the Generalization of Robot Learning

物理滤波有利于机器人学习的泛化

Jindou Jia, Shixuan Han, Meng Wang, Gen Li, Zihan Yang, Sicheng Zhou, Kexin Guo, Jianfei Yang, Xiang Yu, Wei Wang, Lei Guo

机构 * Nanyang Technological University(南洋理工大学) Beihang University(北京航空航天大学) National University of Singapore(新加坡国立大学) Beijing Aerospace Control Instrument Research Institute(北京航天测控仪器研究所)

AI总结 该研究提出轻量、模型无关的 PhyFilter 反馈机制,无需海量训练数据,即可提升机器人在动态不确定性下的泛化能力,在四类机器人系统上验证了其有效性。

Comments Accepted by npj Robotics

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22313 2026-08-25 cs.CV 新提交

Adapting Dense Vision-Language Relationships for Multi-label Classification with Partial Label

适配密集视觉-语言关系的部分标签多标签分类方法

Cheng Chen, Yifan Zhao, Jia Li

机构 * State Key Laboratory of Virtual Reality Technology and Systems(虚拟现实技术与系统国家重点实验室) School of Computer Science and Engineering(计算机科学与工程学院) Beihang University(北京航空航天大学)

AI总结 针对部分标签多标签分类中统计先验导致的过拟合问题,提出语言驱动的密集语义适配器LDSA,结合密集对比适配器与类特定提示调整的交互解码器,在公开基准上取得当前最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22092 2026-08-25 cs.LG 新提交

Counterfactual Quotient Models: Learning What Actions Change, Not What the World Does

反事实商模型:学习动作会改变什么,而非世界会发生什么

Junlin Chen, Ruijie Wang, Jianxin Li

机构 * School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院)

AI总结 该研究提出反事实商模型,通过移除动作间共享的未来分量,直接从同步反事实回滚学习动作依赖效应,在物理环境实验中验证其可抑制无关变异、提升动作排序效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21702 2026-08-25 cs.AI cs.CL 新提交

From Association to Causation: Improving Retrieval Precision of Retrieval-Augmented Generation via Causal Relations and an Attention Mechanism

从关联到因果:通过因果关系与注意力机制提升检索增强生成的检索精度

Jing Liu, Yongxing Qi, Muchen Jiang, Chengnan Hu, Qingqing Peng, Haoming Wang, Yuqing Wang, Yang Yu, Xu Zhang, Ting Wu

机构 * Hangzhou Innovation Institute, Beihang University(北京航空航天大学杭州创新研究院)

AI总结 该研究针对RAG检索阶段仅捕捉关联关系的问题,通过建模检索过程的因果结构,提出一种无需训练的注意力式重评分规则,在企业知识库和关键词堆砌语料库上显著提升了检索精度。

Comments 16 pages, 2 figures, 4 tables, 1 algorithm. Code available at this https URL (https://github.com/Silk-Road/causal-rag-rerank)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21415 2026-08-25 cs.CL cs.AI 新提交

Mitigating Bias in Large Vision-Language Models via Counterfactual Ensemble Decoding

基于反事实集成解码缓解大视觉语言模型中的偏差

Yisong Xiao, Aishan Liu, Yongxin Huang, Zonghao Ying, Shiji Zhao, Tianlin Li, Yong Han, Jian Yang, Xianglong Liu

机构 * State Key Lab of Software Development Environment, Beihang University(北京航空航天大学软件开发环境国家重点实验室)

AI总结 该研究针对大视觉语言模型的社会偏差问题,提出反事实集成解码框架,通过构建多群体反事实视角并集成解码,在三类基准上实现最高47.97%的偏差降低,同时保留模型核心能力。

详情

展开后加载摘要…

URL PDF HTML 收藏