arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Beihang University(北京航空航天大学)

2026-09-01 至 2026-09-01 共收录 11
2608.30657 2026-09-01 cs.CV 新提交

InfraOcc: An Infrastructure Occupancy Benchmark with Static-to-Dynamic Reasoning

InfraOcc:具备静态-动态推理能力的基础设施占用基准测试集

Lei Yang, Xiaokai Bai, Boqi Li, Chunmian Lin, Li Wang, Ziying Song, Jiahuan Zhang, Enhui Ma, Haibao Yu, Jiaqi Ma, Kaicheng Yu

机构 * Nanyang Technological University(南洋理工大学) Zhejiang University(浙江大学) Beihang University(北京航空航天大学) Beijing Institute of Technology(北京理工大学) Yanshan University(燕山大学) Westlake University(西湖大学) University of Hong Kong(香港大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

AI总结 本文构建了首个基础设施占用基准InfraOcc,提出ProSD-Occ方法实现静态-动态渐进推理,在多赛道排名第一,为固定视角路边占用提供了新的推理范式。

Comments 17 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30530 2026-09-01 cs.CL cs.SE 新提交

WebWorld: The Browser as a World Model for Self-Improving Web Code

WebWorld:将浏览器作为自改进网页代码的世界模型

Jiajun Wu, Jian Yang, Yaxin Du, Wei Zhang, Haowen Wang, Junhang Cheng, Yuxuan Zhang, Tuney Zheng, Xianglong Liu, Ming Zhou

机构 * Beihang University(北京航空航天大学) Shanghai Jiao Tong University(上海交通大学) IQuest Research(IQuest研究院) Langboat

AI总结 本研究提出WebWorld,将浏览器作为VLM无法欺骗的网页代码世界模型,通过浏览器签发合格证书的机制实现VLM自主交互与监督,使WebWorld-27B在两个基准任务上实现显著性能提升,达到强前沿系统水平。

Comments EMNLP Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30400 2026-09-01 cs.CV 新提交

Real-Time Scene-Adaptive Tone Mapping for High-Dynamic Range Object Detection

面向高动态范围目标检测的实时场景自适应色调映射

Gongzhe Li, Linwei Qiu, Peibei Cao, Fengying Xie, Xiangyang Ji, Qilin Sun

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) Tianmushan Laboratory, Beihang University(北京航空航天大学天目山实验室) School of Artificial Intelligence, Nanjing University of Information Science and Technology(南京信息工程大学人工智能学院) Department of Automation, Tsinghua University(清华大学自动化系) Point Spread Technology(点扩散科技)

AI总结 本文提出一种场景自适应实时色调映射方法,通过神经光度校准等技术解决HDR图像适配检测网络的问题,性能优于传统算法,可在NVIDIA Jetson平台实现4K HDR图像实时处理。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30399 2026-09-01 cs.CL cs.AI 新提交

SemPOI-RL: Aligning LLM Semantic Reasoning for Interpretable Out-of-Town POI Sequential Generation

SemPOI-RL:对齐大语言模型语义推理以实现可解释的异地兴趣点序列生成

Yunqi Liu, Yang Zhang, Ruixing Zhang, Liangzhe Han, Yi Qiao, Tongyu Zhu, Leilei Sun

机构 * State Key Laboratory of Complex & Critical Software Environment(复杂与关键软件环境国家重点实验室) Beihang University(北京航空航天大学)

AI总结 SemPOI-RL框架通过微调LLM、引入SPAM模块并结合推荐导向强化学习,实现LLM语义推理与结构化序列生成的对齐,在两个真实数据集上优于传统推荐器和LLM基线,可生成可解释的异地POI序列。

Comments 19 pages in total, including 9 pages of main text and 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30237 2026-09-01 cs.RO cs.AI cs.CV cs.LG 新提交

Motus2: A Self-Evolving General World Model for Dexterous Manipulation

Motus2:一种用于灵巧操作的自进化通用世界模型

Hongzhe Bi, Zihao Zhou, Yihang Tang, Jingrui Pang, Shuhe Huang, Haitian Liu, Runqing Wang, Shuai Huang, Yichen Wang, Yiming Cheng, Ruowen Zhao, Zhenghua Li, Hengkai Tan, Xiaolong Liu, Jinhui Wan, Jiabao Liu, Min Zhao, Fan Bao, Jun Zhu

机构 * GensPI Tsinghua University(清华大学) BUAA(北京航空航天大学) BIT(北京理工大学)

AI总结 本文提出Motus2,一种用于灵巧操作的自进化通用世界模型,通过模型缩放与数据缩放构建闭环决策学习循环,结合多模态数据与仿生平台实现通用具身智能体的灵巧操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29640 2026-09-01 cs.LG cs.AI 新提交

LLMODE: Aligning ODEs with LLMs via Gated Token Injection for Irregular Spatio-Temporal Forecasting

LLMODE:通过门控令牌注入将常微分方程(ODE)与大语言模型(LLM)对齐以用于不规则时空预测

Di Zhang, Jingyang Zhang, Ziqian Wang, Chi Zhang, Yikun Ban, Ziwei Zhang, Ruijie Wang

机构 * Beihang University(北京航空航天大学)

AI总结 LLMODE是基于冻结LLM的框架,通过图感知ODE编码器等处理不规则时空数据,在多数据集上表现优异,零样本泛化能力强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29605 2026-09-01 cs.CL 新提交

Hindsight Memory-PRM: Supervising Memory Management with Auditable Hindsight Credit

事后记忆-PRM:通过可审计的事后信用监督记忆管理

Haoxuan Jia, Yang Liu, Yingguang Yang, Yancheng Chen, Chongyang Zhang, Hao Zheng, Qian Li, Yulin Huang, Jianshen Zhang, Yongzhi Qi, Shang Luo, Kefu Xu, Hao Peng, Junyu Lu, Du Cheng, Philip S. Yu, Bin Chong

机构 * Peking University(北京大学) University of Chinese Academy of Sciences(中国科学院大学) Fullive-AI Nanyang Technological University(南洋理工大学) Beijing University of Posts and Telecommunications(北京邮电大学) Beihang University(北京航空航天大学) Beijing Institute of Technology, Zhuhai(北京理工大学珠海学院) Northeastern University(东北大学) University of Illinois Chicago(芝加哥大学伊利诺伊分校)

AI总结 该研究提出Hindsight Memory-PRM,利用轨迹审计轨迹训练记忆效用评判器并确定代理奖励,在LoCoMo、LongMemEval数据集上的性能优于基线系统,实现高效的长视野LLM智能体记忆管理监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29543 2026-09-01 cs.CL cs.AI cs.DB 新提交

Evaluating LLMs on Conversational Text-to-SQL under Chain Ambiguity and Intent Drift

在链歧义与意图漂移场景下评估大型语言模型(LLMs)的对话式文本转SQL能力

Yujia Liu, Jiayan Lin, Zijin Hong, Zheng Yuan, Shengyuan Chen, Hao Chen, Qinggang Zhang, Xiao Huang, Feiran Huang

机构 * The Hong Kong Polytechnic University(香港理工大学) City University of Macau(澳门城市大学) Jilin University(吉林大学) Beihang University(北京航空航天大学) Jinan University(暨南大学)

AI总结 研究针对对话式文本转SQL中用户意图演变未被现有基准覆盖的问题,推出TIDE-Bench基准并评估12个LLMs,发现链识别瓶颈等问题,代码已发布。

Comments Accepted to EMNLP2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29364 2026-09-01 cs.CV 新提交

Sketch2Inspire: Structure-Sensitive Evaluation for Product Retrieval

Sketch2Inspire:面向产品检索的结构敏感型评估

Ge Kong

机构 * Beihang University(北京航空航天大学)

AI总结 该研究提出Sketch2Inspire资源,基于CLIP系列编码器评估多模态融合等方法,证实结构敏感检索下多模态输入增益更高,为产品检索评估提供诊断资源。

Comments 15 pages, 2 figures. PRICAI 2026 version. The paper presents Sketch2Inspire, a structure-sensitive evaluation resource for multimodal product retrieval

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29346 2026-09-01 cs.CV 新提交

GSPotential: Camera Potential Field for Sparse-View 3D Gaussian Splatting

GSPotential:面向稀疏视图三维高斯溅射的相机势场

Zeyuan An, Yanghang Xiao, Zhiying Leng, Yijun Feng, Xiaohui Liang

机构 * State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北京航空航天大学虚拟现实技术与系统国家重点实验室) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) Zhongguancun Laboratory(中关村实验室)

AI总结 GSPotential是面向稀疏视图3D Gaussian Splatting的框架,通过相机势场解决稀疏视图下的过拟合与几何伪影,采用虚拟相机采样与高斯更新策略提升重建保真度且训练效率具竞争力。

Comments 10 pages, 8 figures, 5 tables. Accepted to Pacific Graphics 2026 Conference Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29137 2026-09-01 cs.CV 新提交

Chat-Edit-3D++: Interactive 3D and 4D Scene Editing via Large Language Models

Chat-Edit-3D++:基于大语言模型的交互式3D与4D场景编辑

Shuangkang Fang, Yufeng Wang, Yi-Hsuan Tsai, Wenrui Ding, Yi Yang, Shuchang Zhou, Ming-Hsuan Yang

机构 * School of Electrical and Information Engineering, Beihang University(北京航空航天大学电子信息工程学院) Institute of Unmanned System, Beihang University(北京航空航天大学无人系统研究院) Atmanity Inc.(Atmanity公司) Megvii Research(旷视研究院) University of California at Merced(加州大学默塞德分校)

AI总结 该研究针对现有3D场景编辑方案的缺陷,提出Hash-Atlas网络及基于LLM的CE3D++方法,实现2D编辑与3D重建解耦,可调度30种视觉工具,支持3D/4D场景交互式文本驱动编辑。

Comments Project Website: https://sk-fun.fun/CE3D

详情

展开后加载摘要…

URL PDF HTML 收藏