arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Beihang University(北京航空航天大学)

共收录 2003
2609.04021 2026-09-04 cs.AI cs.LG 新提交

FLY-EVAL++: An Evidence-Driven Evaluation Protocol for Safety-Constrained Flight Prediction with Large Language Models

FLY-EVAL++:面向大语言模型的安全约束飞行预测的证据驱动评估协议

Yalun Wu, Junfeng Fang, Jiawei Wang, Haotian Liu, Qijun Yang, Minghan Yang, Hongcheng Guo, Zhoujun Li, Boyang Wang

机构 * National University of Singapore(新加坡国立大学) Xiamen University(厦门大学) University of Manchester(曼彻斯特大学) Yunnan University(云南大学) Fudan University(复旦大学) Beihang University(北京航空航天大学) China Telecom Artificial Intelligence Technology(Beijing) Co., Ltd.(中国电信人工智能技术(北京)有限公司)

AI总结 研究针对LLM在安全关键飞行预测中的评估缺陷,提出FLY-EVAL++协议,验证66个LLM后发现安全合规性是关键区分维度,表明需明确评估约束满足度。

Comments Published as a conference paper at COLM 2026

Journal ref Proceedings of the Conference on Language Modeling (COLM), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03689 2026-09-04 cs.CV 新提交

Semantic-Aware Subgraph State Space Model for WSI Classification in Histopathology

用于组织病理学WSI分类的语义感知子图状态空间模型

Feixing Chen, Hao Lu, Lin Luo, Yan Xu

机构 * National College for Excellent Engineers(卓越工程师学院) Beihang University(北京航空航天大学) School of Biological Science and Medical Engineering(生物与医学工程学院) College of Engineering(工学院) Peking University(北京大学)

AI总结 针对WSI分类中传统方法碎片化语义单元、难建模空间关系的问题,提出SASG-SSM框架,通过SASGs保留空间组织、SG-SSM融合局部与全局信息,在多数据集及少样本场景下表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03602 2026-09-04 cs.CV cs.RO 新提交

SV-WAM: An Efficient Surround-View World-Action Model for End-to-End Autonomous Driving

SV-WAM:一种用于端到端自动驾驶的高效环视世界-动作模型

Jinyang Wang, Shiwei Li, Junjian Wang, Zhiqiang Deng, Jianbin Gao, Yihang Zhao, Liu Liu, Yongjia Zhao, Jinlong Chen, Huirui Xu, Yifeng Pan, Kangwei Liu, Fan Ren, Ji Tao, Minghao Yang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Chongqing Changan Technology Co., Ltd.(重庆长安科技有限公司) Civil Aviation University of China(中国民航大学) Beihang University(北京航空航天大学) Guilin University of Electronic Technology(桂林电子科技大学)

AI总结 针对现有驾驶世界模型空间覆盖受限且推理效率低的问题,提出SV-WAM模型,通过以动作为中心的因果掩码和可微分可行驶区域正则化器,在六摄像头输入下实现高效规划,在两个基准上达到最优规划性能并具备低延迟和零样本迁移能力。

Comments 23 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03572 2026-09-04 cs.CV 新提交

Drive-HWM: Hierarchical World Models for Dynamic-Latent Guided Autonomous Driving

Drive-HWM:用于动态隐变量引导自动驾驶的分层世界模型

Zhaoxin Fan, Tianbao Zhang, Wenjun Wu, Xiaofeng Wang, Yeying Jin, Jian Zhao, Zheng Zhu, Shuicheng Yan

机构 * School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) Shanghai Jiao Tong University(上海交通大学) Dim12 AI GigaAI(极佳科技) National University of Singapore(新加坡国立大学) TeleAI

AI总结 Drive-HWM是一种分层快慢世界建模框架,通过动态感知隐变量引导,在NAVSIM数据集上实现了出色的自动驾驶性能,验证了其设计的有效性。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09447 2026-09-04 cs.LG cs.AI 版本更新

WDL-OPD: Weak-Driven On-Policy Distillation via Mixture-Constrained Co-Training

WDL-OPD:基于混合约束协同训练的弱驱动在线策略蒸馏

Zehao Chen, Gongxun Li, Tianxiang Ai, Yifei Li, Zixuan Huang, Wang Zhou, Tao Huang, Fuzhen Zhuang, Xianglong Lu, Jianxin Li, Deqing Wang, Yikun Ban

机构 * Beihang University(北京航空航天大学) China Telecom eSurfing Cloud(中国电信天翼云)

AI总结 该研究提出WDL-OPD混合约束协同训练方法,在Qwen3 17亿和40亿参数实验中,于四个规模-领域设置里获最强学生检查点,提升MATH500准确率,稳定代码生成表现,支持稳定性假设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02546 2026-09-03 cs.RO 新提交

ZETA: A Controlled Study of Zero-Shot Cross-Embodiment VLA Transfer for Tabletop Manipulation

ZETA:面向桌面操作的零样本跨 embodiment VLA 迁移的受控研究

Mi Yan, Wenhao Zhang, Zhiqi Zhang, Yu Peng, Tangxinyu Wang, Lingfei Zhai, Jiayi Su, Shengliang Deng, Lin Peng, Yaowei Liu, Yuxing Chen, Zhiyuan Wei, Jilong Wang, Jiayi Chen, Jiangran Lyu, Zhizheng Zhang, He Wang

机构 * Galbot(智元机器人) CFCS, School of CS, Peking University(北京大学计算机学院CFCS) Peking University(北京大学) Renmin University of China(中国人民大学) Xiamen University Malaysia(马来西亚厦门大学) The University of Hong Kong(香港大学) Beihang University(北京航空航天大学)

AI总结 ZETA研究区分两类零样本跨embodiment VLA迁移,引入含14个目标embodiment的受控基准,发现状态-动作表示等因素可提升迁移性能,为桌面操作场景提供实用指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02319 2026-09-03 cs.RO 新提交

From Multi-Fisheye Sensing to Panoramic Perception: A Parallax-Aware Onboard Platform for Ultra-Low-Altitude UAVs

从多鱼眼传感到全景感知:面向超低空无人机的视差感知机载平台

Dun Dai, Ze Lu, Cheng He, Yaowen Wang, Quan Quan

机构 * School of Automation Science and Electrical Engineering, Beihang University(北京航空航天大学自动化科学与电气工程学院) Tianmushan Laboratory(天目山实验室)

AI总结 该研究提出一种视差感知机载平台,可将四路同步鱼眼流转为ERP全景,经实验验证其能实现低功耗高帧率的全景感知,适用于超低空无人机。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00955 2026-09-02 cs.CV 新提交

ASSERT: Adaptive Stochastic Sampling for Robust Diffusion Models on Analog Compute-in-Memory Hardware

ASSERT:面向模拟存算一体硬件的鲁棒扩散模型的自适应随机采样

Yuannuo Feng, Yizhe Chen, Wenshuai Yao, Yuxin Xie, Ngai Wong, Wenyong Zhou, Wang Kang

机构 * School of Integrated Circuit Science and Engineering, Beihang University(北京航空航天大学集成电路科学与工程学院) Zhicun Research Lab(知存研究院) School of Integrated Circuits, Peking University(北京大学集成电路学院) Department of Electrical and Computer Engineering, The University of Hong Kong(香港大学电机电子工程学系)

AI总结 针对模拟存算一体硬件中扩散模型受空间内存变异影响的问题,提出无需训练的自适应随机采样器ASSERT,通过调整不同去噪阶段的随机性,显著降低FID且不改变模型参数。

Comments Accepted by ASP-DAC 2027, Tokoy, Japan

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00845 2026-09-02 cs.AI 新提交

Towards Generalizable Visually Grounded Exploration of Household Devices

面向家庭设备的可泛化视觉接地探索

Linhao Zheng, Zeming Liu, Wangke Chen, Li Zeng, Wanxiang Che, Heyan Huang, Yuhang Guo

机构 * School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院) Research Center for Social Computing and Interactive Robotics, Harbin Institute of Technology(哈尔滨工业大学社会计算与交互机器人研究中心) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院)

AI总结 本文针对现有具身探索范式泛化能力不足的问题,构建了基准VGEBench及逻辑驱动状态机框架,实验发现现有VLMs在语义知识转物理执行和长程状态跟踪上存在挑战。

Comments Accepted to Findings of the Association for Computational Linguistics: EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00508 2026-09-02 cs.AI 新提交

CoVer: Conflict-Aware Claim Verification

CoVer:感知冲突的主张验证

Shuning Zhang, Dai Shi, Bohao Chu, Hui Wang, Yuwei Chuai, Yifan Wang, Jingruo Chen, Simin Li, Xin Yi, Hewu Li

机构 * Tsinghua University(清华大学) Tongji University(同济大学) University of Duisburg-Essen(杜伊斯堡-埃森大学) University of Luxembourg(卢森堡大学) University of Washington(华盛顿大学) Cornell University(康奈尔大学) Beihang University(北京航空航天大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

AI总结 针对社交媒体事实核查的证据级与聚合级冲突挑战,提出大规模数据集ContraNote及三阶段裁决框架CoVer,在多数据集上实现了优于基线的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24882 2026-09-02 cs.RO 版本更新

Latent Action as Intention Enables Efficient Future Imagination for World Action Models

作为意图的隐式动作:为世界动作模型实现高效的未来想象

Xiang Li, Yupeng Zheng, Songen Gu, Huailiang Ma, Feng Yu, Yuhang Zheng, Xian Nie, Shanshuai Yuan, Yujie Zang, Weize Li, Shuai Tian, Moyang Liu, Ya-Qin Zhang, Wenchao Ding

机构 * CollegeAI, THU(清华大学CollegeAI) AIR, THU(清华大学AIR) CASIA(中国科学院自动化研究所) TARS Robotics(TARS机器人公司) FDU(复旦大学) Southeast University(东南大学) SJTU(上海交通大学) NUS(新加坡国立大学) BUAA(北京航空航天大学)

AI总结 本文提出名为 LAWA 的 WAM 架构,以紧凑隐式动作作为未来意图实现高效未来想象,在 RoboCasa 等数据集上优于 Fast-WAM,延迟更低且性能更优,兼顾性能、泛化性与延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23181 2026-09-02 cs.CR cs.CL 版本更新

CyberFactory: Scaling Cyber Security Capabilities with Instances from the Wild

CyberFactory:利用真实场景实例扩展网络安全能力

Jian Yang, Haau-Sing Li, Shawn Guo, Zixi Zhao, Yibo Tan, Jiajun Wu, Aishan Liu, Zhoujun Li, Xianglong Liu, Tianyu Zheng, Bryan Dai, Chengran Yang, Weifeng Lv

机构 * Beihang University(北京航空航天大学) ELLIS(欧洲学习与智能系统实验室) IQuest Research(智问研究) Singapore Management University(新加坡管理大学)

AI总结 本研究提出开源框架CyberFactory,将真实场景漏洞转化为任务实例以训练安全模型Aegis,该模型在CyberGym上的Pass@1较Qwen~3.5提升22.8个百分点,优于通用主干模型。

Comments We updated scores with models trained on updated agentic data

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30657 2026-09-01 cs.CV 新提交

InfraOcc: An Infrastructure Occupancy Benchmark with Static-to-Dynamic Reasoning

InfraOcc:具备静态-动态推理能力的基础设施占用基准测试集

Lei Yang, Xiaokai Bai, Boqi Li, Chunmian Lin, Li Wang, Ziying Song, Jiahuan Zhang, Enhui Ma, Haibao Yu, Jiaqi Ma, Kaicheng Yu

机构 * Nanyang Technological University(南洋理工大学) Zhejiang University(浙江大学) Beihang University(北京航空航天大学) Beijing Institute of Technology(北京理工大学) Yanshan University(燕山大学) Westlake University(西湖大学) University of Hong Kong(香港大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

AI总结 本文构建了首个基础设施占用基准InfraOcc,提出ProSD-Occ方法实现静态-动态渐进推理,在多赛道排名第一,为固定视角路边占用提供了新的推理范式。

Comments 17 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30530 2026-09-01 cs.CL cs.SE 新提交

WebWorld: The Browser as a World Model for Self-Improving Web Code

WebWorld:将浏览器作为自改进网页代码的世界模型

Jiajun Wu, Jian Yang, Yaxin Du, Wei Zhang, Haowen Wang, Junhang Cheng, Yuxuan Zhang, Tuney Zheng, Xianglong Liu, Ming Zhou

机构 * Beihang University(北京航空航天大学) Shanghai Jiao Tong University(上海交通大学) IQuest Research(IQuest研究院) Langboat

AI总结 本研究提出WebWorld,将浏览器作为VLM无法欺骗的网页代码世界模型,通过浏览器签发合格证书的机制实现VLM自主交互与监督,使WebWorld-27B在两个基准任务上实现显著性能提升,达到强前沿系统水平。

Comments EMNLP Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30400 2026-09-01 cs.CV 新提交

Real-Time Scene-Adaptive Tone Mapping for High-Dynamic Range Object Detection

面向高动态范围目标检测的实时场景自适应色调映射

Gongzhe Li, Linwei Qiu, Peibei Cao, Fengying Xie, Xiangyang Ji, Qilin Sun

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) Tianmushan Laboratory, Beihang University(北京航空航天大学天目山实验室) School of Artificial Intelligence, Nanjing University of Information Science and Technology(南京信息工程大学人工智能学院) Department of Automation, Tsinghua University(清华大学自动化系) Point Spread Technology(点扩散科技)

AI总结 本文提出一种场景自适应实时色调映射方法,通过神经光度校准等技术解决HDR图像适配检测网络的问题,性能优于传统算法,可在NVIDIA Jetson平台实现4K HDR图像实时处理。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30399 2026-09-01 cs.CL cs.AI 新提交

SemPOI-RL: Aligning LLM Semantic Reasoning for Interpretable Out-of-Town POI Sequential Generation

SemPOI-RL:对齐大语言模型语义推理以实现可解释的异地兴趣点序列生成

Yunqi Liu, Yang Zhang, Ruixing Zhang, Liangzhe Han, Yi Qiao, Tongyu Zhu, Leilei Sun

机构 * State Key Laboratory of Complex & Critical Software Environment(复杂与关键软件环境国家重点实验室) Beihang University(北京航空航天大学)

AI总结 SemPOI-RL框架通过微调LLM、引入SPAM模块并结合推荐导向强化学习,实现LLM语义推理与结构化序列生成的对齐,在两个真实数据集上优于传统推荐器和LLM基线,可生成可解释的异地POI序列。

Comments 19 pages in total, including 9 pages of main text and 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30237 2026-09-01 cs.RO cs.AI cs.CV cs.LG 新提交

Motus2: A Self-Evolving General World Model for Dexterous Manipulation

Motus2:一种用于灵巧操作的自进化通用世界模型

Hongzhe Bi, Zihao Zhou, Yihang Tang, Jingrui Pang, Shuhe Huang, Haitian Liu, Runqing Wang, Shuai Huang, Yichen Wang, Yiming Cheng, Ruowen Zhao, Zhenghua Li, Hengkai Tan, Xiaolong Liu, Jinhui Wan, Jiabao Liu, Min Zhao, Fan Bao, Jun Zhu

机构 * GensPI Tsinghua University(清华大学) BUAA(北京航空航天大学) BIT(北京理工大学)

AI总结 本文提出Motus2,一种用于灵巧操作的自进化通用世界模型,通过模型缩放与数据缩放构建闭环决策学习循环,结合多模态数据与仿生平台实现通用具身智能体的灵巧操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29640 2026-09-01 cs.LG cs.AI 新提交

LLMODE: Aligning ODEs with LLMs via Gated Token Injection for Irregular Spatio-Temporal Forecasting

LLMODE:通过门控令牌注入将常微分方程(ODE)与大语言模型(LLM)对齐以用于不规则时空预测

Di Zhang, Jingyang Zhang, Ziqian Wang, Chi Zhang, Yikun Ban, Ziwei Zhang, Ruijie Wang

机构 * Beihang University(北京航空航天大学)

AI总结 LLMODE是基于冻结LLM的框架,通过图感知ODE编码器等处理不规则时空数据,在多数据集上表现优异,零样本泛化能力强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29605 2026-09-01 cs.CL 新提交

Hindsight Memory-PRM: Supervising Memory Management with Auditable Hindsight Credit

事后记忆-PRM:通过可审计的事后信用监督记忆管理

Haoxuan Jia, Yang Liu, Yingguang Yang, Yancheng Chen, Chongyang Zhang, Hao Zheng, Qian Li, Yulin Huang, Jianshen Zhang, Yongzhi Qi, Shang Luo, Kefu Xu, Hao Peng, Junyu Lu, Du Cheng, Philip S. Yu, Bin Chong

机构 * Peking University(北京大学) University of Chinese Academy of Sciences(中国科学院大学) Fullive-AI Nanyang Technological University(南洋理工大学) Beijing University of Posts and Telecommunications(北京邮电大学) Beihang University(北京航空航天大学) Beijing Institute of Technology, Zhuhai(北京理工大学珠海学院) Northeastern University(东北大学) University of Illinois Chicago(芝加哥大学伊利诺伊分校)

AI总结 该研究提出Hindsight Memory-PRM,利用轨迹审计轨迹训练记忆效用评判器并确定代理奖励,在LoCoMo、LongMemEval数据集上的性能优于基线系统,实现高效的长视野LLM智能体记忆管理监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29543 2026-09-01 cs.CL cs.AI cs.DB 新提交

Evaluating LLMs on Conversational Text-to-SQL under Chain Ambiguity and Intent Drift

在链歧义与意图漂移场景下评估大型语言模型(LLMs)的对话式文本转SQL能力

Yujia Liu, Jiayan Lin, Zijin Hong, Zheng Yuan, Shengyuan Chen, Hao Chen, Qinggang Zhang, Xiao Huang, Feiran Huang

机构 * The Hong Kong Polytechnic University(香港理工大学) City University of Macau(澳门城市大学) Jilin University(吉林大学) Beihang University(北京航空航天大学) Jinan University(暨南大学)

AI总结 研究针对对话式文本转SQL中用户意图演变未被现有基准覆盖的问题,推出TIDE-Bench基准并评估12个LLMs,发现链识别瓶颈等问题,代码已发布。

Comments Accepted to EMNLP2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29364 2026-09-01 cs.CV 新提交

Sketch2Inspire: Structure-Sensitive Evaluation for Product Retrieval

Sketch2Inspire:面向产品检索的结构敏感型评估

Ge Kong

机构 * Beihang University(北京航空航天大学)

AI总结 该研究提出Sketch2Inspire资源,基于CLIP系列编码器评估多模态融合等方法,证实结构敏感检索下多模态输入增益更高,为产品检索评估提供诊断资源。

Comments 15 pages, 2 figures. PRICAI 2026 version. The paper presents Sketch2Inspire, a structure-sensitive evaluation resource for multimodal product retrieval

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29346 2026-09-01 cs.CV 新提交

GSPotential: Camera Potential Field for Sparse-View 3D Gaussian Splatting

GSPotential:面向稀疏视图三维高斯溅射的相机势场

Zeyuan An, Yanghang Xiao, Zhiying Leng, Yijun Feng, Xiaohui Liang

机构 * State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北京航空航天大学虚拟现实技术与系统国家重点实验室) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) Zhongguancun Laboratory(中关村实验室)

AI总结 GSPotential是面向稀疏视图3D Gaussian Splatting的框架,通过相机势场解决稀疏视图下的过拟合与几何伪影,采用虚拟相机采样与高斯更新策略提升重建保真度且训练效率具竞争力。

Comments 10 pages, 8 figures, 5 tables. Accepted to Pacific Graphics 2026 Conference Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29137 2026-09-01 cs.CV 新提交

Chat-Edit-3D++: Interactive 3D and 4D Scene Editing via Large Language Models

Chat-Edit-3D++:基于大语言模型的交互式3D与4D场景编辑

Shuangkang Fang, Yufeng Wang, Yi-Hsuan Tsai, Wenrui Ding, Yi Yang, Shuchang Zhou, Ming-Hsuan Yang

机构 * School of Electrical and Information Engineering, Beihang University(北京航空航天大学电子信息工程学院) Institute of Unmanned System, Beihang University(北京航空航天大学无人系统研究院) Atmanity Inc.(Atmanity公司) Megvii Research(旷视研究院) University of California at Merced(加州大学默塞德分校)

AI总结 该研究针对现有3D场景编辑方案的缺陷,提出Hash-Atlas网络及基于LLM的CE3D++方法,实现2D编辑与3D重建解耦,可调度30种视觉工具,支持3D/4D场景交互式文本驱动编辑。

Comments Project Website: https://sk-fun.fun/CE3D

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27380 2026-09-01 cs.CL 版本更新

D2C-Routing: Dimension-to-Composition Evidence Routing for Mixed-Origin AI-Generated Text Detection

D2C-Routing:用于混合来源AI生成文本检测的维度到组成证据路由

Xin Chen, Fuwei Zhang, Yiqi Tong, Wei Guo, Yutian Xiao, Fuzhen Zhuang

机构 * Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究院)

AI总结 本研究针对混合来源AI生成文本检测问题,提出D2C-Routing方法,在MixD2C数据集上取得0.8603的四向平均TPR@1%FPR,性能优于RACE-local重运行结果。

Comments 17 pages, 4 figures. To appear in EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25875 2026-09-01 cs.LG cs.AI 版本更新

A2TTA: Anchored-and-Agile Test-Time Adaptation for Evolving Traffic Sensor Networks

A2TTA:用于不断发展的交通传感器网络的锚定与敏捷测试时自适应

Du Yin, Xiachong Lin, Yue Tan, Jinliang Deng, Estrid He, Hao Xue, Flora D. Salim

机构 * University of New South Wales(新南威尔士大学) Griffith University(格里菲斯大学) Beihang University(北京航空航天大学) RMIT University(皇家墨尔本理工大学)

AI总结 研究针对交通传感器网络动态变化致传统预测模型性能下降问题,提出A2TTA框架,将拓扑诱导误差转化为输出校准问题,区分时间自适应,联合应对拓扑演变和多尺度时间偏移,实验证明该框架能有效提升预测性能。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30117 2026-09-01 cs.AI 版本更新

VLA-Trace: Diagnosing Vision-Language-Action Models through Representation and Behavior Tracing

VLA-Trace: 通过表示与行为追踪诊断视觉-语言-动作模型

Haoyuan Shi, Xiancong Ren, Yingji Zhang, Qinfan Zhang, Jiayu Hu, Haozhe Shan, Han Dong, Jinpeng Lu, Yinda Chen, Yi Zhang, Yong Dai, Xiaozhu Ju

机构 * University of Science and Technology of China(中国科学技术大学) University of Manchester(曼彻斯特大学) Beihang University(北航) Fudan University(复旦大学) University of New South Wales(新南威尔士大学)

AI总结 提出VLA-Trace诊断框架,通过表示演化、因果控制归因和行为表现分析,揭示VLA模型在多模态知识向具身控制转化中的机制,发现不同模型在微调适应、多模态路由和语义遵循上的差异与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14712 2026-09-01 cs.RO cs.AI cs.CL cs.CV 版本更新

IntentVLA: Short-Horizon Intent Modeling for Aliased Robot Manipulation

IntentVLA:用于有歧义机器人操作的短周期意图建模

Shijie Lian, Bin Yu, Xiaopeng Lin, Zhaolong Shen, Laurence Tianruo Yang, Yurun Jin, Haishan Liu, Changti Wu, Hang Yuan, Cong Huang, Kai Chen

机构 * HUST(华中科技大学) ZGCA(中钢集团人工智能研究院) ZGCI(中钢智能科技有限公司) HIT(哈尔滨工业大学) HKUST(GZ)(香港科技大学(广州)) BUAA(北京航空航天大学) ZZU(浙江工业大学) ECNU(华东师范大学) USTC(中国科学技术大学) DeepCybo

AI总结 IntentVLA通过编码近期视觉观测为紧凑的短周期意图表示,提升机器人操作的执行稳定性,并在多个基准测试中优于现有VLA基线。

Comments EMNLP 2026 Main Conference, Code can be found at https://github.com/ZGC-EmbodyAI/IntentVLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23213 2026-09-01 cs.CL cs.AI 版本更新

Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process

评分、推理与选择最佳!通过同行评审过程进行大型语言模型的集成

Zhijun Chen, Zeyu Ji, Qianren Mao, Hao Wu, Jinhuan Song, Junhang Cheng, Bangjie Qin, Zhuoran Li, Jingzheng Li, Kai Sun, Zizhe Wang, Yikun Ban, Zhu Sun, Xiangyang Ji, Hailong Sun, Xiao Huang

机构 * Beihang University, Beijing, China(北京航空航天大学) Zhongguancun Laboratory, Beijing, China(中关村实验室) Beijing University of Posts and Telecommunications(北京邮电大学) Hong Kong University of Science and Technology(香港科学与技术大学) Xi'an Jiaotong University, Xi'an, China(西安交通大学) Tsinghua University, Beijing, China(清华大学) Singapore University of Technology and Design(新加坡科技设计大学)

AI总结 本文提出LLM-PeerReview方法,通过同行评审机制集成多个大型语言模型,提升响应质量。实验显示其在多个数据集上优于Smoothie-Global,适用于事实性问答、数学推理等任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02830 2026-09-01 cs.CL 版本更新

GRADE: Probing Knowledge Gaps in LLMs through Gradient Subspace Dynamics

GRADE: 通过梯度子空间动态探测语言模型中的知识差距

Yujing Wang, Yuanbang Liang, Yukun Lai, Hainan Zhang, Hanqi Yan

机构 * Beihang University(北航) Cardiff University(卡迪夫大学) King’s College London(伦敦国王学院)

AI总结 GRADE通过梯度子空间动态探测语言模型中的知识差距,量化知识缺口并验证其在多个基准上的有效性及抗扰性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06859 2026-09-01 cs.LG cs.AI 版本更新

Zero-shot Generalizable Graph Anomaly Detection with Mixture of Riemannian Experts

零射一般化图异常检测与混合黎曼专家

Xinyu Zhao, Qingyun Sun, Jiayi Luo, Xingcheng Fu, Jianxin Li

机构 * School of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院) Key Lab of Education Blockchain and Intelligent Technology, Ministry of Education, Guangxi Normal University(教育区块链与智能技术重点实验室,教育部,广西师范大学)

AI总结 GAD-MoRE通过混合黎曼专家架构实现零射一般化图异常检测,利用多曲率空间建模提升异常检测能力。

Comments Accepted by IEEE International Conference on Data Mining (ICDM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏