arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Beihang University(北京航空航天大学)

2026-02-05 至 2026-02-05 共收录 6
2602.04486 2026-02-05 cs.CL

Beyond Unimodal Shortcuts: MLLMs as Cross-Modal Reasoners for Grounded Named Entity Recognition

超越单模态捷径:MLLMs作为跨模态推理器用于 grounded 命名实体识别

Jinlong Ma, Yu Zhang, Xuefeng Bai, Kehai Chen, Yuwei Wang, Zeming Liu, Jun Yu, Min Zhang

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Beijing University of Aeronautics and Astronautics(北京航空航天大学)

AI总结 本文提出MCR方法,通过多风格推理模式注入和约束引导的可验证优化,解决MLLMs在跨模态推理中的模态偏见问题,提升 grounded 命名实体识别的性能。

Comments GMNER

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04441 2026-02-05 cs.CV

SynthVerse: A Large-Scale Diverse Synthetic Dataset for Point Tracking

SynthVerse:一个大规模多样化合成数据集用于点跟踪

Weiguang Zhao, Haoran Xu, Xingyu Miao, Qin Zhao, Rui Zhang, Kaizhu Huang, Ning Gao, Peizhou Cao, Mingze Sun, Mulin Yu, Tao Lu, Linning Xu, Junting Dong, Jiangmiao Pang

机构 * University of Liverpool(利物浦大学) Zhejiang University(浙江大学) Durham University(杜伦大学) Beihang University(北京航空航天大学) Duke Kunshan University(杜克昆山大学) Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) Xi’an Jiaotong University(西安交通大学) Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学)

AI总结 SynthVerse通过提供大规模多样化合成数据集,提升点跟踪任务的泛化能力和评估效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21358 2026-02-05 cs.AI cs.CL

Latent Chain-of-Thought as Planning: Decoupling Reasoning from Verbalization

潜在的思维链作为规划:将推理与言说解耦

Jiecong Wang, Hao Peng, Chunyang Liu

机构 * Beihang University(北航大学) Didi Chuxing(滴滴出行)

AI总结 PLaT通过解耦推理与言说,实现了更灵活的推理过程和更高的可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20322 2026-02-05 cs.CV

Dynamic Pyramid Network for Efficient Multimodal Large Language Model

动态金字塔网络用于高效多模态大语言模型

Hao Ai, Kunyi Wang, Zezhou Wang, Hao Lu, Jin Tian, Yaxin Luo, Peng Xing, Jen-Yuan Huang, Huaxia Li, Gen luo

机构 * Beihang University(北航大学) Shanghai AI Laboratory(上海人工智能实验室) KAUST(卡塔尔大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Technical University Of Denmark(丹麦技术大学) Nanjing University of Science and Technology(南京理工大学) Peking University(北京大学) Xiaohongshu Inc(小红书公司)

AI总结 动态金字塔网络通过分层结构和动态池化专家提升多模态大语言模型的效率与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13928 2026-02-05 cs.CV cs.IR

LoVR: A Benchmark for Long Video Retrieval in Multimodal Contexts

LoVR:一种多模态背景下长视频检索的基准

Qifeng Cai, Hao Liang, Zhaoyang Han, Hejun Dong, Meiyi Qiang, Ruichuan An, Quanqing Xu, Bin Cui, Wentao Zhang

机构 * East China Normal University Shanghai China Peking University \& Zhongguancun Academy Beijing China Huazhong University of Science Beihang University Beijing China Peking University Beijing China East China Normal University Peking University \& Zhongguancun Academy Beihang University Peking University

AI总结 LoVR是一个针对长视频检索的多模态基准,通过高质量标注和细粒度数据提升视频理解挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.13229 2026-02-05 cs.RO cs.SY eess.SY

Learning-based Observer for Coupled Disturbance

基于学习的耦合扰动观测器

Jindou Jia, Meng Wang, Zihan Yang, Bin Yang, Yuhang Liu, Kexin Guo, Xiang Yu

机构 * Nanyang Technological University(南洋理工大学) Beihang University(北京航空航天大学)

AI总结 本文提出一种结合控制与学习方法的观测器,通过分解耦合扰动并利用历史数据学习参数矩阵,实现高精度扰动估计。

Comments 10 pages, 7 figures

Journal ref 2026 IEEE International Conference on Robotics and Automation (ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏