arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

2025-12-29 至 2025-12-29 共收录 15
2512.22010 2025-12-29 cs.CV cs.AI

LongFly: Long-Horizon UAV Vision-and-Language Navigation with Spatiotemporal Context Integration

LongFly: 长航程无人机视觉与语言导航中的时空上下文整合

Wen Jiang, Li Wang, Kangyao Huang, Wei Fan, Jinyuan Liu, Shaoyu Liu, Hongwei Duan, Bin Xu, Xiangyang Ji

机构 * School of Mechanical Engineering, Beijing Institute of Technology(北京理工大学机械工程学院) Chongqing Innovation Center, Beijing Institute of Technology(北京理工大学重庆创新中心) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Department of Automation, Tsinghua University(清华大学自动化系) School of Software, Dalian University of Technology(大连理工大学软件学院) School of Artificial Intelligence, Xidian University(西安电子科技大学人工智能学院)

AI总结 LongFly通过整合时空上下文提升无人机长航程视觉与语言导航的准确性和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21905 2025-12-29 cs.CV

High-Fidelity and Long-Duration Human Image Animation with Diffusion Transformer

高保真长时长人类图像动画

Shen Zheng, Jiaran Cai, Yuansheng Guan, Shenneng Huang, Xingpei Ma, Junjie Cao, Hanfeng Zhao, Qiang Zhang, Shunsi Zhang, Xiao-Ping Zhang

机构 * Guangzhou Quwan Network Technology(广州 quirwan 网络技术公司) Tsinghua University(清华大学)

AI总结 本文提出基于扩散变压器的框架,通过混合引导信号和位置移适应模块,实现高保真长时长人类图像动画生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19415 2025-12-29 cs.CV

Non-Contrast CT Esophageal Varices Grading through Clinical Prior-Enhanced Multi-Organ Analysis

通过临床先验增强的多器官分析进行非对比CT食管静脉曲张分级

Xiaoming Zhang, Chunli Li, Jiacheng Hao, Yuan Gao, Danyang Tu, Jianyi Qiao, Xiaoli Yin, Le Lu, Ling Zhang, Ke Yan, Yang Hou, Yu Shi

机构 * Department of Radiology, Shengjing Hospital of China Medical University, 110004, Shenyang, China(中国医科大学附属盛京医院放射科) DAMO Academy, Alibaba Group(阿里巴巴集团 DAMO 院) School of Biomedical Engineering, Tsinghua University, 100084, Beijing, China(清华大学生物医学工程学院) Faculty of Science and Engineering, Sorbonne University, 75005, Paris, France(索邦大学科学与工程学院) Hupan Lab, 310023, Hangzhou, China(华平实验室)

AI总结 MOON++通过结合临床先验知识的多器官分析,实现了非对比CT食管静脉曲张的高效分级。

Comments Medical Image Analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07849 2025-12-29 cs.CY cs.CL cs.MA

AI Urban Scientist: Multi-Agent Collaborative Automation for Urban Research

AI城市科学家:面向城市研究的多智能体协作自动化

Tong Xia, Jiankun Zhang, Ruiwen You, Ao Xu, Linghao Zhang, Tengyao Tu, Jingzhi Wang, Jinghua Piao, Yunke Zhang, Fengli Xu, Yong Li

机构 * Vanke School of Public Health, Tsinghua University, Beijing, China(范克学校公共卫生学院,清华大学,北京,中国) Zhongguancun Academy, Beijing, China(中关村学院,北京,中国) Department of Electronic Engineering, Tsinghua University, Beijing, China(电子工程系,清华大学,北京,中国)

AI总结 本文提出AI城市科学家,通过多智能体协作自动化,整合异构数据生成城市研究的结构化知识,提升自主研究效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.01274 2025-12-29 cs.RO

Efficient Collaborative Navigation through Perception Fusion for Multi-Robots in Unknown Environments

通过感知融合实现多机器人在未知环境中的高效协作导航

Qingquan Lin, Weining Lu, Litong Meng, Chenxi Li, Bin Liang

机构 * Beijing National Research Center for Information Science and Technology, Tsinghua University(北京信息科学与技术国家研究中心,清华大学)

AI总结 本文提出了一种基于感知融合的多机器人协作导航方法,通过图注意力架构和信息增益权重提升规划效率,实验证明在未知环境中显著提高导航效率和路径优化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.07105 2025-12-29 cs.RO cs.MA

Collaborative Goal Tracking of Multiple Mobile Robots Based on Geometric Graph Neural Network

基于几何图神经网络的多移动机器人协作目标跟踪

Weining Lu, Qingquan Lin, Litong Meng, Chenxi Li, Bin Liang

机构 * Beijing National Research Center for Information Science and Technology, Tsinghua University(北京信息科学与技术国家研究中心,清华大学) Department of Automation, Tsinghua University(自动化系,清华大学)

AI总结 本文提出基于几何图神经网络的多机器人协作路径规划方法,通过融合邻居信息提升路径效率与实时规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21675 2025-12-29 cs.CV

UniPercept: Towards Unified Perceptual-Level Image Understanding across Aesthetics, Quality, Structure, and Texture

UniPercept:迈向跨美学、质量、结构和纹理的统一感知级图像理解

Shuo Cao, Jiayang Li, Xiaohui Li, Yuandong Pu, Kaiwen Zhu, Yuanting Gao, Siqi Luo, Yi Xin, Qi Qin, Yu Zhou, Xiangyu Chen, Wenlong Zhang, Bin Fu, Yu Qiao, Yihao Liu

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Nanjing University(南京大学) Sun Yat-sen University(中山大学) Tele-AI Website(Tele-AI网站)

AI总结 UniPercept通过领域自适应预训练和任务对齐强化学习,实现跨美学、质量、结构和纹理的统一感知级图像理解,优于现有多模态大语言模型。

Comments 27 pages, 14 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21627 2025-12-29 cs.RO

AstraNav-Memory: Contexts Compression for Long Memory

AstraNav-Memory: 长记忆中的上下文压缩

Botao Ren, Junjun Hu, Xinda Xue, Minghua Luo, Jintao Chen, Haochen Bai, Liangliang You, Mu Xu

机构 * Amap, Alibaba Group(阿里巴巴集团Amap) Tsinghua University(清华大学) Peking University(北京大学)

AI总结 AstraNav-Memory通过高效的视觉上下文压缩模块和Qwen2.5-VL导航策略,实现了长记忆的压缩存储与高效导航,提升了在新环境中的探索能力和熟悉环境中的路径效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21618 2025-12-29 cs.CV cs.RO

SymDrive: Realistic and Controllable Driving Simulator via Symmetric Auto-regressive Online Restoration

SymDrive: 通过对称自回归在线修复实现逼真且可控的驾驶模拟器

Zhiyuan Liu, Daocheng Fu, Pinlong Cai, Lening Wang, Ying Liu, Yilong Ren, Botian Shi, Jianqiang Wang

机构 * School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动系统学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) State Key Lab of Intelligent Transportation System, Beihang University(北航智能交通系统国家重点实验室)

AI总结 SymDrive通过对称自回归在线修复技术,实现了逼真可控的驾驶模拟,解决了高保真渲染与交互式交通编辑的难题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21527 2025-12-29 cs.LG

Generative Actor Critic

生成性行为批判者

Aoyang Qin, Deqian Kong, Wei Wang, Ying Nian Wu, Song-Chun Zhu, Sirui Xie

机构 * Department of Automation, Tsinghua University(清华大学自动化系) Beijing Institute of General Artificial Intelligence (BIGAI)(北京通用人工智能研究院) Department of Statistics and Data Science, UCLA(UCLA统计与数据科学系) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) Department of Computer Science, UCLA(UCLA计算机科学系)

AI总结 生成性行为批判者通过学习轨迹和回报的联合分布生成模型,实现离线预训练模型与在线经验的高效结合,提升离线到在线的改进能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21514 2025-12-29 cs.CV cs.AI

DiverseGRPO: Mitigating Mode Collapse in Image Generation via Diversity-Aware GRPO

DiverseGRPO: 通过多样性感知的GRPO缓解图像生成中的模式崩溃

Henglin Liu, Huijuan Huang, Jing Wang, Chang Liu, Xiu Li, Xiangyang Ji

机构 * Tsinghua University(清华大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区)

AI总结 DiverseGRPO通过引入分布性创造力奖励和结构感知正则化,提升图像生成的多样性与质量平衡。

Comments Project Page: https://henglin-liu.github.io/DiverseGRPO/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13030 2025-12-29 cs.CV cs.LG cs.RO

Motus: A Unified Latent Action World Model

Motus:一个统一的潜在动作世界模型

Hongzhe Bi, Hengkai Tan, Shenghao Xie, Zeyuan Wang, Shuhe Huang, Haitian Liu, Ruowen Zhao, Yao Feng, Chendong Xiang, Yinze Rong, Hongyan Zhao, Hanyu Liu, Zhizhong Su, Lei Ma, Hang Su, Jun Zhu

机构 * Dept. of Comp. Sci. and Tech., Institute for AI, BNRist Center, THBI Lab, Tsinghua-Bosch Joint ML Center, Tsinghua University(计算机科学与技术系,人工智能研究院,BNRist中心,THBI实验室,清华-博世联合机器学习中心,清华大学) Peking University(北京大学) Horizon Robotics

AI总结 Motus通过统一的潜在动作世界模型整合理解、视频生成和动作模块,利用光流和三阶段训练流程提升大规模动作预训练效果,实现模拟与现实场景中的性能突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20146 2025-12-29 cs.CV

AlignFreeNet: Is Cross-Modal Pre-Alignment Necessary? An End-to-End Alignment-Free Lightweight Network for Visible-Infrared Object Detection

AlignFreeNet: 跨模态预对齐是否必要?一种端到端无对齐的轻量级网络用于可见-红外目标检测

Dingkun Zhu, Haote Zhang, Lipeng Gu, Wuzhou Quan, Fu Lee Wang, Honghui Fan, Jiali Tang, Haoran Xie, Xiaoping Zhang, Mingqiang Wei

机构 * School of Computer Science, Jiangsu University of Technology(江苏科技大学计算机科学学院) School of Computer Science and Technology, Nanjing University of Aeronautics and Astronautics(南京航空航天大学计算机科学与技术学院) School of Science and Technology, Hong Kong Metropolitan University(香港都会大学科技学院) School of Data Science, Lingnan University(岭南大学数据科学学院) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

AI总结 AlignFreeNet通过无对齐融合范式,提出VCC和FCF模块,有效缓解可见-红外目标检测中的跨模态错位问题,实现端到端轻量级网络的高鲁棒性与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05622 2025-12-29 cs.RO cs.AI

CityNavAgent: Aerial Vision-and-Language Navigation with Hierarchical Semantic Planning and Global Memory

CityNavAgent:基于层次语义规划和全局记忆的空中视觉-语言导航

Weichen Zhang, Chen Gao, Shiquan Yu, Ruiying Peng, Baining Zhao, Qian Zhang, Jinqiang Cui, Xinlei Chen, Yong Li

机构 * Tsinghua University(清华大学)

AI总结 CityNavAgent通过层次语义规划和全局记忆模块,提升空中视觉-语言导航在复杂城市环境中的导航性能。

Journal ref Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06157 2025-12-29 cs.CV cs.AI

UrbanVideo-Bench: Benchmarking Vision-Language Models on Embodied Intelligence with Video Data in Urban Spaces

UrbanVideo-Bench: 基于城市空间视频数据评估视觉-语言模型的具身智能

Baining Zhao, Jianjie Fang, Zichao Dai, Ziyou Wang, Jirong Zha, Weichen Zhang, Chen Gao, Yue Wang, Jinqiang Cui, Xinlei Chen, Yong Li

机构 * Tsinghua University(清华大学)

AI总结 UrbanVideo-Bench通过城市空间视频数据评估视频大语言模型的具身智能,揭示其在城市环境中感知、推理和导航能力的局限性,并验证了Sim-to-Real迁移的潜力。

Comments 22 pages

Journal ref Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pp. 32400-32423, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏