arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Shanghai Jiao Tong University(上海交通大学)

2026-03-02 至 2026-03-02 共收录 12
2602.24030 2026-03-02 cs.RO

Curriculum Reinforcement Learning for Quadrotor Racing with Random Obstacles

为随机障碍物的四旋翼赛车设计的课程强化学习

Fangyu Sun, Fanxing Li, Yu Hu, Linzuo Zhang, Yueqian Liu, Wenxian Yu, Danping Zou

机构 * School of Automation and Perception, Shanghai Jiao Tong University(自动化与感知学院,上海交通大学) Faculty of Aerospace Engineering, Delft University of Technology(航空航天工程学院,代尔夫特理工大学)

AI总结 本文提出一种课程强化学习框架,通过多阶段学习和领域随机化提升四旋翼赛车在随机障碍物环境中的鲁棒性和速度

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23996 2026-03-02 cs.CV

Accelerating Masked Image Generation by Learning Latent Controlled Dynamics

通过学习潜在控制动力学加速掩码图像生成

Kaiwen Zhu, Quansheng Zeng, Yuandong Pu, Shuo Cao, Xiaohui Li, Yi Xin, Qi Qin, Jiayang Li, Yu Qiao, Jinjin Gu, Yihao Liu

机构 * Shanghai Jiao Tong University, Shanghai, China(上海交通大学) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室) Shanghai Innovation Institute, Shanghai, China(上海创新研究院) Nankai University, Tianjin, China(南开大学) University of Science(科学技术大学) Nanjing University, Nanjing, China(南京大学) The University of Sydney, Sydney, Australia(悉尼大学) Peking University, Beijing, China(北京大学)

AI总结 本文提出MIGM-Shortcut模型,通过学习潜在控制动力学加速掩码图像生成,在保持质量的同时实现文本到图像生成的四倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23945 2026-03-02 cs.CV cs.AI cs.MM

PointCoT: A Multi-modal Benchmark for Explicit 3D Geometric Reasoning

PointCoT: 一种用于显式3D几何推理的多模态基准

Dongxu Zhang, Yiding Sun, Pengcheng Li, Yumou Liu, Hongqiang Lin, Haoran Xu, Xiaoxuan Mu, Liang Lin, Wenbiao Yan, Ning Yang, Chaowei Fang, Juanjuan Zhao, Jihua Zhu, Conghui He, Cheng Tan

机构 * Xi'an Jiaotong University(西安交通大学) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Institute of Automation, CASIA(中国科学院自动化研究所) Taiyuan University of Technology(太原理工大学) Shanghai AI Laboratory(上海人工智能实验室)

AI总结 PointCoT通过显式链式推理提升3D几何推理能力,提出多模态基准和双流架构,实现对3D点云的高精度理解与推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23926 2026-03-02 cs.CV

Leveraging Geometric Prior Uncertainty and Complementary Constraints for High-Fidelity Neural Indoor Surface Reconstruction

利用几何先验不确定性与互补约束实现高保真的神经室内表面重建

Qiyu Feng, Jiwei Shan, Shing Shin Cheng, Hesheng Wang

机构 * Department of Automation, Shanghai Jiao Tong University(自动化系,上海交通大学) Department of Mechanical and Automation Engineering and T Stone Robotics Institute, The Chinese University of Hong Kong(机械与自动化工程系及T Stone机器人研究所,香港中文大学)

AI总结 GPU-SDF通过利用几何先验不确定性与互补约束,提升神经室内表面重建的细部特征恢复能力。

Comments Accepted by ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23832 2026-03-02 cs.RO

OmniTrack: General Motion Tracking via Physics-Consistent Reference

OmniTrack: 通过物理一致的参考进行通用运动追踪

Yuhan Li, Peiyuan Zhi, Yunshen Wang, Tengyu Liu, Sixu Yan, Wenyu Liu, Xinggang Wang, Baoxiong Jia, Siyuan Huang

机构 * Huazhong University of Science and Technology(华中科技大学) State Key Lab of General AI, Beijing Institute for General Artificial Intelligence (BIGAI)(通用人工智能国家重点实验室,北京通用人工智能研究院) Shanghai Jiao Tong University(上海交通大学)

AI总结 OmniTrack通过分离物理可行性与通用运动追踪,提升了机器人运动跟踪的准确性和稳定性,支持复杂动作和动态远程操作。

Comments website: https://omnitrack-humanoid.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23734 2026-03-02 cs.CV cs.CL

UTPTrack: Towards Simple and Unified Token Pruning for Visual Tracking

UTPTrack: 向简单和统一的令牌剪枝迈进:视觉跟踪中的统一令牌剪枝

Hao Wu, Xudong Wang, Jialiang Zhang, Junlong Tong, Xinghao Chen, Junyan Lin, Yunpu Ma, Xiaoyu Shen

机构 * Institute of Digital Twin, Eastern Institute of Technology(数字孪生研究所,东部技术研究所) Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative(宁波空间智能与数字衍生关键实验室) Shanghai Jiao Tong University(上海交通大学) The Hong Kong Polytechnic University(香港理工大学) Munich Center for Machine Learning, LMU Munich(慕尼黑机器学习中心,慕尼黑大学)

AI总结 UTPTrack通过统一令牌剪枝框架,在视觉跟踪中实现高精度与高效能的平衡,同时支持多模态和语言引导任务。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23699 2026-03-02 cs.CV cs.CL

HiDrop: Hierarchical Vision Token Reduction in MLLMs via Late Injection, Concave Pyramid Pruning, and Early Exit

HiDrop:通过晚期注入、凹形金字塔剪枝和早期退出实现MLLM中的层次视觉令牌减少

Hao Wu, Yingqi Fan, Jinyang Dai, Junlong Tong, Yunpu Ma, Xiaoyu Shen

机构 * Institute of Digital Twin, Eastern Institute of Technology(数字孪生研究所,东部技术研究所) Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative(宁波空间智能与数字衍生关键实验室) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学) Munich Center for Machine Learning, LMU Munich(慕尼黑大学机器学习中心,慕尼黑大学)

AI总结 HiDrop通过晚期注入、凹形金字塔剪枝和早期退出机制,实现多模态大语言模型中视觉令牌的高效减少,提升训练效率并保持性能。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02960 2026-03-02 cs.RO cs.AI cs.LG

Embodiment-Aware Generalist Specialist Distillation for Unified Humanoid Whole-Body Control

具身感知的通用专家蒸馏用于统一的人形机器人全身控制

Quanquan Peng, Yunfeng Lin, Yufei Xue, Jiangmiao Pang, Weinan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Lab(上海人工智能实验室)

AI总结 EAGLE通过通用-专家蒸馏框架实现多形态人形机器人统一控制,提升跨形态迁移能力和复杂行为执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02814 2026-03-02 cs.AI

Radiologist Copilot: An Agentic Framework Orchestrating Specialized Tools for Reliable Radiology Reporting

放射科助手:一种协调专用工具的代理框架以实现可靠的放射学报告

Yongrui Yu, Zhongzhen Huang, Linjie Mu, Shaoting Zhang, Xiaofan Zhang

机构 * Shanghai Jiao Tong University, Shanghai, China(上海交通大学) SenseTime Research, Shanghai, China(商汤研究) Shanghai Innovation Institute, Shanghai, China(上海创新研究院)

AI总结 放射科助手通过协调专用工具实现全面的放射学报告流程,提升报告准确性和临床标准符合度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18825 2026-03-02 cs.CV

Q-Save: Towards Scoring and Attribution for Generated Video Evaluation

Q-Save:迈向生成视频评估的评分与归因

Xiele Wu, Zicheng Zhang, Mingtao Chen, Yixian Liu, Yiming Liu, Shushi Wang, Zhichao Hu, Yuhong Liu, Guangtao Zhai, Xiaohong Liu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 Q-Save提出一个统一的生成视频评估模型和数据集,通过三阶段训练策略实现质量评分与归因生成,提升AIGV质量预测的准确性和可解释性。

Comments 20 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05982 2026-03-02 cs.CV

AnimateScene: Camera-controllable Animation in Any Scene

AnimateScene: 任意场景中的相机可控动画

Qingyang Liu, Bingjie Gao, Weiheng Huang, Jun Zhang, Zhongqian Sun, Yang Wei, Fengrui Liu, Zelin Peng, Qianli Ma, Shuai Yang, Zhaohe Liao, Haonan Zhao, Li Niu

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent TEG(腾讯科技(北京)有限公司) East China Normal University(华东师范大学)

AI总结 AnimateScene通过统一框架解决3D场景重建与4D人体动画整合难题,实现人类在任意场景中自然放置、风格对齐及动态相机轨迹处理,生成高细节且时空一致的动画视频。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05629 2026-03-02 cs.LG

On the Generalization of SFT: A Reinforcement Learning Perspective with Reward Rectification

在SFT的泛化上:从强化学习视角的奖励校正

Yongliang Wu, Yizhou Zhou, Zhou Ziheng, Yingzhe Peng, Xinyu Ye, Xinting Hu, Wenbo Zhu, Lu Qi, Ming-Hsuan Yang, Xu Yang

机构 * Southeast University(东南大学) University of California, Los Angeles(加州大学洛杉矶分校) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) University of California, Berkeley(加州大学伯克利分校) Wuhan University(武汉大学) University of California, Merced(加州大学默塞德分校)

AI总结 本文提出动态微调方法,通过奖励校正提升SFT的泛化能力,在多个任务中表现优于传统SFT。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏