arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

Shanghai Jiao Tong University(上海交通大学)

2026-03-05 至 2026-03-05 共收录 14
2603.03957 2026-03-05 cs.RO

ArthroCut: Autonomous Policy Learning for Robotic Bone Resection in Knee Arthroplasty

ArthroCut:膝关节置换术中机器人骨切除的自主策略学习

Xu Lu, Yiling Zhang, Wenquan Cheng, Longfei Ma, Fang Chen, Hongen Liao

机构 * School of Biomedical Engineering, Tsinghua University(清华大学生物医学工程学院) School of Biomedical Engineering, Shanghai Jiao Tong University(上海交通大学生物医学工程学院) Longwood Valley MedTech

AI总结 ArthroCut通过结合术前和术中数据,实现膝关节置换术中骨切除的自主策略学习,提升机器人手术的自主性和可解释性。

Comments Accepted for publication at the 2026 IEEE International Conference on Robotics and Automation (ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03836 2026-03-05 cs.RO

SkillVLA: Tackling Combinatorial Diversity in Dual-Arm Manipulation via Skill Reuse

SkillVLA: 通过技能复用解决双臂操作中的组合多样性问题

Xuanran Zhai, Zekai Huang, Longyan Wu, Qianyou Zhao, Qiaojun Yu, Jieji Ren, Ce Hao, Harold Soh

机构 * National University of Singapore(国立新加坡大学) Beijing Zhongguancun Academy(北京中关村学院) Shanghai Innovation Institute(上海创新研究院) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Smart Systems Institute, NUS(NUS智能系统研究所)

AI总结 SkillVLA通过技能复用解决双臂操作中的组合多样性问题,提升技能组合成功率至51%并在复杂任务中表现优异。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03825 2026-03-05 cs.CV cs.AI

From Narrow to Panoramic Vision: Attention-Guided Cold-Start Reshapes Multimodal Reasoning

从窄视场到全景视觉:基于注意力的冷启动重塑多模态推理

Ruilin Luo, Chufan Shi, Yizhen Zhang, Cheng Yang, Songtao Jiang, Tongkun Guan, Ruizhe Chen, Ruihang Chu, Peng Wang, Mingkun Yang, Yujiu Yang, Junyang Lin, Zhibo Yang

机构 * Tsinghua University(清华大学) University of South California(南加州大学) Qwen Team, Alibaba Group(通义实验室,阿里巴巴集团) University of California San Diego(南加州大学圣地亚哥分校) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出AVAR框架,通过视觉锚定与注意力引导提升多模态推理性能,实现7%的平均提升。

Comments ICLR 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03739 2026-03-05 cs.CV cs.AI

PROSPECT: Unified Streaming Vision-Language Navigation via Semantic--Spatial Fusion and Latent Predictive Representation

PROSPECT:通过语义-空间融合和潜在预测表示实现统一的流式视觉-语言导航

Zehua Fan, Wenqi Lyu, Wenxuan Song, Linge Zhao, Yifei Yang, Xi Wang, Junjie He, Lida Huang, Haiyan Liu, Bingchuan Sun, Guangjun Bao, Xuanyao Mao, Liang Xu, Yan Wang, Feng Gao

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) University of Adelaide(阿德莱德大学) Wuhan University(武汉大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Beijing Jiaotong University(北京交通大学) AIR Wuxi Innovation Center, Tsinghua University(清华大学无锡创新中心) Lenovo(联想集团)

AI总结 PROSPECT通过语义-空间融合和潜在预测表示,实现统一的流式视觉-语言导航,提升环境动态和空间结构的预测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03677 2026-03-05 cs.CL cs.AI

MIND: Unified Inquiry and Diagnosis RL with Criteria Grounded Clinical Supports for Psychiatric Consultation

MIND: 一种基于临床标准的统一探究与诊断强化学习框架用于精神病咨询

Guoyi Li, Shihao Xu, Jiatong Ma, Yunyun Han, Jianhua Chen, Yafeng Deng

机构 * EverMind AI Inc.(EverMind AI公司) EverMind AI Inc., Tianqiao and Chrissy Chen Institute(EverMind AI公司、田桥与克里斯西·陈研究所) Shanghai Mental Health Center, Shanghai Jiao Tong University School of Medicine(上海精神卫生中心、上海交通大学医学院)

AI总结 MIND通过基于临床标准的推理框架提升精神病咨询的诊断准确性和互动质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24065 2026-03-05 cs.CV

EvalMVX: A Unified Benchmarking for Neural 3D Reconstruction under Diverse Multiview Setups

EvalMVX: 一种用于神经3D重建的统一基准测试,适用于多样化的多视角设置

Zaiyan Yang, Jieji Ren, Xiangyi Wang, zonglin li, Xu Cao, Heng Guo, Zhanyu Ma, Boxin Shi

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) School of Mechanical Engineering, Shanghai Jiao Tong University(上海交通大学机械工程学院) Xiong’an Aerospace Information Research Institute(雄安航空航天信息研究所) State Key Laboratory of Multimedia Information Processing, School of Computer Science Peking University(北京大学计算机科学学院多媒体信息处理国家重点实验室)

AI总结 EvalMVX是一个包含25个物体的真实世界数据集,用于评估神经3D重建方法在不同多视角设置下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18707 2026-03-05 cs.RO

CLASH: Collision Learning via Augmented Sim-to-real Hybridization to Bridge the Reality Gap

CLASH:通过增强的仿真到现实混合化进行碰撞学习以弥合现实差距

Haotian He, Ning Guo, Siqi Shi, Qipeng Liu, Wenzhao Lian

机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) School of Mathematical Sciences, Beijing Normal University(北京师范大学数学科学学院)

AI总结 CLASH通过增强的仿真到现实混合化方法,有效提升碰撞预测精度并减少仿真计算时间,增强机器人策略在现实中的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22235 2026-03-05 cs.AI

Training High-Level Schedulers with Execution-Feedback Reinforcement Learning for Long-Horizon GUI Automation

通过执行反馈强化学习训练高阶调度器以实现长周期GUI自动化

Zehao Deng, Tianjie Ju, Zheng Wu, Zhuosheng Zhang, Gongshen Liu

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)

AI总结 本文提出CES多代理框架,通过训练高阶调度器解决GUI代理在长周期任务中的责任耦合和状态管理问题,提升任务规划与执行效率。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19524 2026-03-05 cs.CV cs.MA

VideoChat-M1: Collaborative Policy Planning for Video Understanding via Multi-Agent Reinforcement Learning

VideoChat-M1: 通过多智能体强化学习实现视频理解的协作策略规划

Boyu Chen, Zikang Wang, Zhengrong Yue, Kainan Yan, Chenyun Yu, Yi Huang, Zijun Liu, Yafei Wen, Xiaoxin Chen, Yang Liu, Peng Li, Yali Wang

机构 * Shenzhen Key Lab of Computer Vision and Pattern Recognition(深圳计算机视觉与模式识别重点实验室) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) VIVO AI Lab(VIVO人工智能实验室) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shenzhen Campus of Sun Yat-sen University(孙逸仙大学深圳校区) Shanghai Jiao Tong University(上海交通大学) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University(清华大学计算机科学与技术系,人工智能研究院)

AI总结 VideoChat-M1通过多智能体强化学习实现视频理解的协作策略规划,显著提升复杂视频任务的性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05091 2026-03-05 cs.CV

Factuality Matters: When Image Generation and Editing Meet Structured Visuals

事实性至关重要:当图像生成与编辑遇见结构化视觉

Le Zhuo, Songhao Han, Yuandong Pu, Boxiang Qiu, Sayak Paul, Yue Liao, Yihao Liu, Jie Shao, Xi Chen, Si Liu, Hongsheng Li

机构 * CUHK MMLab(香港大学多模态实验室) Beihang University(北京航空航天大学) Krea AI(Krea人工智能) Shanghai Jiao Tong University(上海交通大学) Shanghai AI Lab(上海人工智能实验室) Hugging Face National University of Singapore(新加坡国立大学) ByteDance(字节跳动) The University of Hong Kong(香港大学)

AI总结 本文提出了一种统一模型,通过整合视觉语言模型和FLUX.1 Kontext,提升结构化视觉生成与编辑的多模态理解与事实准确性。

Comments Accepted by ICLR 2026, Project page: https://structvisuals.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02071 2026-03-05 cs.RO

A Geometric Method for Base Parameter Analysis in Robot Inertia Identification Based on Projective Geometric Algebra

基于投影几何代数的机器人惯性参数分析几何方法

Guangzhen Sun, Ye Ding, Xiangyang Zhu

机构 * The State Key Laboratory of Mechanical System and Vibration, School of Mechanical Engineering, Shanghai Jiao Tong University, Shanghai 200240, China(机械系统与振动国家重点实验室,机械工程学院,上海交通大学,上海200240,中国)

AI总结 本文提出了一种基于投影几何代数的几何方法,用于高效准确地识别机器人系统的基体惯性参数。

Comments 20 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02751 2026-03-05 cs.CV

Partial Weakly-Supervised Oriented Object Detection

部分弱监督定向物体检测

Mingxin Liu, Peiyuan Zhang, Yuan Liu, Wei Zhang, Yue Zhou, Ning Liao, Ziyang Gong, Junwei Luo, Zhirui Wang, Yi Yu, Xue Yang

机构 * Shanghai Jiao Tong University(上海交通大学) Wuhan University(武汉大学) East China Normal University(华东师范大学) Aerospace Information Research Institute(航天信息研究所) Southeast University(东南大学)

AI总结 本文提出PWOOD框架,通过部分弱标注高效利用未标注数据,提升定向物体检测性能,降低标注成本。

Comments 10 pages, 5 figures, 4 tables, source code: https://github.com/VisionXLab/PWOOD

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10118 2026-03-05 cs.CV cs.CL

Why 1 + 1 < 1 in Visual Token Pruning: Beyond Naive Integration via Multi-Objective Balanced Covering

为何1+1<1在视觉令牌修剪中:通过多目标平衡覆盖超越简单整合

Yangfu Li, Hongjian Zhan, Tianyi Chen, Qi Liu, Yue Lu

机构 * East China Normal University(华东师范大学) Shanghai Jiao Tong University(上海交通大学) Chongqing Institute of East China Normal University(华东师范大学重庆研究院) Shanghai University of Engineering Science(上海工程技术大学)

AI总结 MoB通过多目标平衡覆盖方法,解决视觉令牌修剪中提示对齐与视觉保留的权衡问题,实现高效且高性能的修剪效果。

Comments 31 pages,9 figures,conference

Journal ref Advances in Neural Information Processing Systems 39 (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09879 2026-03-05 cs.CV

TextMaster: A Unified Framework for Realistic Text Editing via Glyph-Style Dual-Control

TextMaster: 一种通过字形-风格双控实现真实文本编辑的统一框架

Zhenyu Yan, Jian Wang, Aoqiang Wang, Yuhan Li, Wenxiang Shang, Ran Lin

机构 * Taobao & Tmall Group of Alibaba(阿里巴巴淘宝与天猫集团) Shanghai Jiao Tong University(上海交通大学)

AI总结 TextMaster通过字形-风格双控机制,实现了高精度、可控的文本编辑,适用于多种场景和图像区域,提升了文本布局的准确性和风格的可控性。

Comments Accepted to ICCV 2025

Journal ref Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV), 2025, pp. 16112-16121

详情

展开后加载摘要…

URL PDF HTML 收藏