arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Beihang University(北京航空航天大学)

2026-09-01 至 2026-09-01 共收录 19
2608.30657 2026-09-01 cs.CV 新提交

InfraOcc: An Infrastructure Occupancy Benchmark with Static-to-Dynamic Reasoning

InfraOcc:具备静态-动态推理能力的基础设施占用基准测试集

Lei Yang, Xiaokai Bai, Boqi Li, Chunmian Lin, Li Wang, Ziying Song, Jiahuan Zhang, Enhui Ma, Haibao Yu, Jiaqi Ma, Kaicheng Yu

机构 * Nanyang Technological University(南洋理工大学) Zhejiang University(浙江大学) Beihang University(北京航空航天大学) Beijing Institute of Technology(北京理工大学) Yanshan University(燕山大学) Westlake University(西湖大学) University of Hong Kong(香港大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

AI总结 本文构建了首个基础设施占用基准InfraOcc,提出ProSD-Occ方法实现静态-动态渐进推理,在多赛道排名第一,为固定视角路边占用提供了新的推理范式。

Comments 17 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30530 2026-09-01 cs.CL cs.SE 新提交

WebWorld: The Browser as a World Model for Self-Improving Web Code

WebWorld:将浏览器作为自改进网页代码的世界模型

Jiajun Wu, Jian Yang, Yaxin Du, Wei Zhang, Haowen Wang, Junhang Cheng, Yuxuan Zhang, Tuney Zheng, Xianglong Liu, Ming Zhou

机构 * Beihang University(北京航空航天大学) Shanghai Jiao Tong University(上海交通大学) IQuest Research(IQuest研究院) Langboat

AI总结 本研究提出WebWorld,将浏览器作为VLM无法欺骗的网页代码世界模型,通过浏览器签发合格证书的机制实现VLM自主交互与监督,使WebWorld-27B在两个基准任务上实现显著性能提升,达到强前沿系统水平。

Comments EMNLP Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30400 2026-09-01 cs.CV 新提交

Real-Time Scene-Adaptive Tone Mapping for High-Dynamic Range Object Detection

面向高动态范围目标检测的实时场景自适应色调映射

Gongzhe Li, Linwei Qiu, Peibei Cao, Fengying Xie, Xiangyang Ji, Qilin Sun

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) Tianmushan Laboratory, Beihang University(北京航空航天大学天目山实验室) School of Artificial Intelligence, Nanjing University of Information Science and Technology(南京信息工程大学人工智能学院) Department of Automation, Tsinghua University(清华大学自动化系) Point Spread Technology(点扩散科技)

AI总结 本文提出一种场景自适应实时色调映射方法,通过神经光度校准等技术解决HDR图像适配检测网络的问题,性能优于传统算法,可在NVIDIA Jetson平台实现4K HDR图像实时处理。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30399 2026-09-01 cs.CL cs.AI 新提交

SemPOI-RL: Aligning LLM Semantic Reasoning for Interpretable Out-of-Town POI Sequential Generation

SemPOI-RL:对齐大语言模型语义推理以实现可解释的异地兴趣点序列生成

Yunqi Liu, Yang Zhang, Ruixing Zhang, Liangzhe Han, Yi Qiao, Tongyu Zhu, Leilei Sun

机构 * State Key Laboratory of Complex & Critical Software Environment(复杂与关键软件环境国家重点实验室) Beihang University(北京航空航天大学)

AI总结 SemPOI-RL框架通过微调LLM、引入SPAM模块并结合推荐导向强化学习,实现LLM语义推理与结构化序列生成的对齐,在两个真实数据集上优于传统推荐器和LLM基线,可生成可解释的异地POI序列。

Comments 19 pages in total, including 9 pages of main text and 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30237 2026-09-01 cs.RO cs.AI cs.CV cs.LG 新提交

Motus2: A Self-Evolving General World Model for Dexterous Manipulation

Motus2:一种用于灵巧操作的自进化通用世界模型

Hongzhe Bi, Zihao Zhou, Yihang Tang, Jingrui Pang, Shuhe Huang, Haitian Liu, Runqing Wang, Shuai Huang, Yichen Wang, Yiming Cheng, Ruowen Zhao, Zhenghua Li, Hengkai Tan, Xiaolong Liu, Jinhui Wan, Jiabao Liu, Min Zhao, Fan Bao, Jun Zhu

机构 * GensPI Tsinghua University(清华大学) BUAA(北京航空航天大学) BIT(北京理工大学)

AI总结 本文提出Motus2,一种用于灵巧操作的自进化通用世界模型,通过模型缩放与数据缩放构建闭环决策学习循环,结合多模态数据与仿生平台实现通用具身智能体的灵巧操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29640 2026-09-01 cs.LG cs.AI 新提交

LLMODE: Aligning ODEs with LLMs via Gated Token Injection for Irregular Spatio-Temporal Forecasting

LLMODE:通过门控令牌注入将常微分方程(ODE)与大语言模型(LLM)对齐以用于不规则时空预测

Di Zhang, Jingyang Zhang, Ziqian Wang, Chi Zhang, Yikun Ban, Ziwei Zhang, Ruijie Wang

机构 * Beihang University(北京航空航天大学)

AI总结 LLMODE是基于冻结LLM的框架,通过图感知ODE编码器等处理不规则时空数据,在多数据集上表现优异,零样本泛化能力强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29605 2026-09-01 cs.CL 新提交

Hindsight Memory-PRM: Supervising Memory Management with Auditable Hindsight Credit

事后记忆-PRM:通过可审计的事后信用监督记忆管理

Haoxuan Jia, Yang Liu, Yingguang Yang, Yancheng Chen, Chongyang Zhang, Hao Zheng, Qian Li, Yulin Huang, Jianshen Zhang, Yongzhi Qi, Shang Luo, Kefu Xu, Hao Peng, Junyu Lu, Du Cheng, Philip S. Yu, Bin Chong

机构 * Peking University(北京大学) University of Chinese Academy of Sciences(中国科学院大学) Fullive-AI Nanyang Technological University(南洋理工大学) Beijing University of Posts and Telecommunications(北京邮电大学) Beihang University(北京航空航天大学) Beijing Institute of Technology, Zhuhai(北京理工大学珠海学院) Northeastern University(东北大学) University of Illinois Chicago(芝加哥大学伊利诺伊分校)

AI总结 该研究提出Hindsight Memory-PRM,利用轨迹审计轨迹训练记忆效用评判器并确定代理奖励,在LoCoMo、LongMemEval数据集上的性能优于基线系统,实现高效的长视野LLM智能体记忆管理监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29543 2026-09-01 cs.CL cs.AI cs.DB 新提交

Evaluating LLMs on Conversational Text-to-SQL under Chain Ambiguity and Intent Drift

在链歧义与意图漂移场景下评估大型语言模型(LLMs)的对话式文本转SQL能力

Yujia Liu, Jiayan Lin, Zijin Hong, Zheng Yuan, Shengyuan Chen, Hao Chen, Qinggang Zhang, Xiao Huang, Feiran Huang

机构 * The Hong Kong Polytechnic University(香港理工大学) City University of Macau(澳门城市大学) Jilin University(吉林大学) Beihang University(北京航空航天大学) Jinan University(暨南大学)

AI总结 研究针对对话式文本转SQL中用户意图演变未被现有基准覆盖的问题,推出TIDE-Bench基准并评估12个LLMs,发现链识别瓶颈等问题,代码已发布。

Comments Accepted to EMNLP2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29364 2026-09-01 cs.CV 新提交

Sketch2Inspire: Structure-Sensitive Evaluation for Product Retrieval

Sketch2Inspire:面向产品检索的结构敏感型评估

Ge Kong

机构 * Beihang University(北京航空航天大学)

AI总结 该研究提出Sketch2Inspire资源,基于CLIP系列编码器评估多模态融合等方法,证实结构敏感检索下多模态输入增益更高,为产品检索评估提供诊断资源。

Comments 15 pages, 2 figures. PRICAI 2026 version. The paper presents Sketch2Inspire, a structure-sensitive evaluation resource for multimodal product retrieval

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29346 2026-09-01 cs.CV 新提交

GSPotential: Camera Potential Field for Sparse-View 3D Gaussian Splatting

GSPotential:面向稀疏视图三维高斯溅射的相机势场

Zeyuan An, Yanghang Xiao, Zhiying Leng, Yijun Feng, Xiaohui Liang

机构 * State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北京航空航天大学虚拟现实技术与系统国家重点实验室) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) Zhongguancun Laboratory(中关村实验室)

AI总结 GSPotential是面向稀疏视图3D Gaussian Splatting的框架,通过相机势场解决稀疏视图下的过拟合与几何伪影,采用虚拟相机采样与高斯更新策略提升重建保真度且训练效率具竞争力。

Comments 10 pages, 8 figures, 5 tables. Accepted to Pacific Graphics 2026 Conference Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29137 2026-09-01 cs.CV 新提交

Chat-Edit-3D++: Interactive 3D and 4D Scene Editing via Large Language Models

Chat-Edit-3D++:基于大语言模型的交互式3D与4D场景编辑

Shuangkang Fang, Yufeng Wang, Yi-Hsuan Tsai, Wenrui Ding, Yi Yang, Shuchang Zhou, Ming-Hsuan Yang

机构 * School of Electrical and Information Engineering, Beihang University(北京航空航天大学电子信息工程学院) Institute of Unmanned System, Beihang University(北京航空航天大学无人系统研究院) Atmanity Inc.(Atmanity公司) Megvii Research(旷视研究院) University of California at Merced(加州大学默塞德分校)

AI总结 该研究针对现有3D场景编辑方案的缺陷,提出Hash-Atlas网络及基于LLM的CE3D++方法,实现2D编辑与3D重建解耦,可调度30种视觉工具,支持3D/4D场景交互式文本驱动编辑。

Comments Project Website: https://sk-fun.fun/CE3D

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27380 2026-09-01 cs.CL 版本更新

D2C-Routing: Dimension-to-Composition Evidence Routing for Mixed-Origin AI-Generated Text Detection

D2C-Routing:用于混合来源AI生成文本检测的维度到组成证据路由

Xin Chen, Fuwei Zhang, Yiqi Tong, Wei Guo, Yutian Xiao, Fuzhen Zhuang

机构 * Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究院)

AI总结 本研究针对混合来源AI生成文本检测问题,提出D2C-Routing方法,在MixD2C数据集上取得0.8603的四向平均TPR@1%FPR,性能优于RACE-local重运行结果。

Comments 17 pages, 4 figures. To appear in EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25875 2026-09-01 cs.LG cs.AI 版本更新

A2TTA: Anchored-and-Agile Test-Time Adaptation for Evolving Traffic Sensor Networks

A2TTA:用于不断发展的交通传感器网络的锚定与敏捷测试时自适应

Du Yin, Xiachong Lin, Yue Tan, Jinliang Deng, Estrid He, Hao Xue, Flora D. Salim

机构 * University of New South Wales(新南威尔士大学) Griffith University(格里菲斯大学) Beihang University(北京航空航天大学) RMIT University(皇家墨尔本理工大学)

AI总结 研究针对交通传感器网络动态变化致传统预测模型性能下降问题,提出A2TTA框架,将拓扑诱导误差转化为输出校准问题,区分时间自适应,联合应对拓扑演变和多尺度时间偏移,实验证明该框架能有效提升预测性能。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30117 2026-09-01 cs.AI 版本更新

VLA-Trace: Diagnosing Vision-Language-Action Models through Representation and Behavior Tracing

VLA-Trace: 通过表示与行为追踪诊断视觉-语言-动作模型

Haoyuan Shi, Xiancong Ren, Yingji Zhang, Qinfan Zhang, Jiayu Hu, Haozhe Shan, Han Dong, Jinpeng Lu, Yinda Chen, Yi Zhang, Yong Dai, Xiaozhu Ju

机构 * University of Science and Technology of China(中国科学技术大学) University of Manchester(曼彻斯特大学) Beihang University(北航) Fudan University(复旦大学) University of New South Wales(新南威尔士大学)

AI总结 提出VLA-Trace诊断框架,通过表示演化、因果控制归因和行为表现分析,揭示VLA模型在多模态知识向具身控制转化中的机制,发现不同模型在微调适应、多模态路由和语义遵循上的差异与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14712 2026-09-01 cs.RO cs.AI cs.CL cs.CV 版本更新

IntentVLA: Short-Horizon Intent Modeling for Aliased Robot Manipulation

IntentVLA:用于有歧义机器人操作的短周期意图建模

Shijie Lian, Bin Yu, Xiaopeng Lin, Zhaolong Shen, Laurence Tianruo Yang, Yurun Jin, Haishan Liu, Changti Wu, Hang Yuan, Cong Huang, Kai Chen

机构 * HUST(华中科技大学) ZGCA(中钢集团人工智能研究院) ZGCI(中钢智能科技有限公司) HIT(哈尔滨工业大学) HKUST(GZ)(香港科技大学(广州)) BUAA(北京航空航天大学) ZZU(浙江工业大学) ECNU(华东师范大学) USTC(中国科学技术大学) DeepCybo

AI总结 IntentVLA通过编码近期视觉观测为紧凑的短周期意图表示,提升机器人操作的执行稳定性,并在多个基准测试中优于现有VLA基线。

Comments EMNLP 2026 Main Conference, Code can be found at https://github.com/ZGC-EmbodyAI/IntentVLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23213 2026-09-01 cs.CL cs.AI 版本更新

Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process

评分、推理与选择最佳!通过同行评审过程进行大型语言模型的集成

Zhijun Chen, Zeyu Ji, Qianren Mao, Hao Wu, Jinhuan Song, Junhang Cheng, Bangjie Qin, Zhuoran Li, Jingzheng Li, Kai Sun, Zizhe Wang, Yikun Ban, Zhu Sun, Xiangyang Ji, Hailong Sun, Xiao Huang

机构 * Beihang University, Beijing, China(北京航空航天大学) Zhongguancun Laboratory, Beijing, China(中关村实验室) Beijing University of Posts and Telecommunications(北京邮电大学) Hong Kong University of Science and Technology(香港科学与技术大学) Xi'an Jiaotong University, Xi'an, China(西安交通大学) Tsinghua University, Beijing, China(清华大学) Singapore University of Technology and Design(新加坡科技设计大学)

AI总结 本文提出LLM-PeerReview方法,通过同行评审机制集成多个大型语言模型,提升响应质量。实验显示其在多个数据集上优于Smoothie-Global,适用于事实性问答、数学推理等任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02830 2026-09-01 cs.CL 版本更新

GRADE: Probing Knowledge Gaps in LLMs through Gradient Subspace Dynamics

GRADE: 通过梯度子空间动态探测语言模型中的知识差距

Yujing Wang, Yuanbang Liang, Yukun Lai, Hainan Zhang, Hanqi Yan

机构 * Beihang University(北航) Cardiff University(卡迪夫大学) King’s College London(伦敦国王学院)

AI总结 GRADE通过梯度子空间动态探测语言模型中的知识差距,量化知识缺口并验证其在多个基准上的有效性及抗扰性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06859 2026-09-01 cs.LG cs.AI 版本更新

Zero-shot Generalizable Graph Anomaly Detection with Mixture of Riemannian Experts

零射一般化图异常检测与混合黎曼专家

Xinyu Zhao, Qingyun Sun, Jiayi Luo, Xingcheng Fu, Jianxin Li

机构 * School of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院) Key Lab of Education Blockchain and Intelligent Technology, Ministry of Education, Guangxi Normal University(教育区块链与智能技术重点实验室,教育部,广西师范大学)

AI总结 GAD-MoRE通过混合黎曼专家架构实现零射一般化图异常检测,利用多曲率空间建模提升异常检测能力。

Comments Accepted by IEEE International Conference on Data Mining (ICDM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10015 2026-09-01 cs.LG 版本更新

Federated Personalization of Early-Exit Networks

CAFEDistill: 通过联邦早退网络蒸馏学习个性化和动态模型

Boyi Liu, Zimu Zhou, Cheng Fang, Yongxin Tong

机构 * DS, City University of Hong Kong(DS,香港城市大学) SKLCCSE, Beihang University(SKLCCSE,北京航空航天大学)

AI总结 CAFEDistill通过冲突感知的联邦退出蒸馏框架,解决PFL中客户端异质性和深度干扰问题,提升模型准确性和降低推理成本。

Comments 12 pages, conference

详情

展开后加载摘要…

URL PDF HTML 收藏