EndoSERV: A Vision-based Endoluminal Robot Navigation System
EndoSERV:一种基于视觉的内镜机器人导航系统
机构 * Institute of Medical Robotics, Shanghai Jiao Tong University(医学机器人研究所,上海交通大学)
AI总结 EndoSERV提出了一种基于视觉的内镜机器人导航系统,通过SE段到结构和Real到虚拟映射技术,解决内镜路径复杂、狭窄和曲折带来的导航难题。
高校专区
EndoSERV:一种基于视觉的内镜机器人导航系统
机构 * Institute of Medical Robotics, Shanghai Jiao Tong University(医学机器人研究所,上海交通大学)
AI总结 EndoSERV提出了一种基于视觉的内镜机器人导航系统,通过SE段到结构和Real到虚拟映射技术,解决内镜路径复杂、狭窄和曲折带来的导航难题。
LAHNet:用于点云配准的局部注意哈希网络
机构 * Nanjing University of Science and Technology(南京理工大学) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 LAHNet通过引入局部注意机制和高效窗口化策略,提升点云配准的特征区分性与鲁棒性。
ODI-Bench: MLLMs能否理解沉浸式全向环境?
机构 * Shanghai Jiao Tong University(上海交通大学) ; Xinjiang University(新疆大学) ; Tianjin University(天津大学)
AI总结 ODI-Bench旨在评估多模态大语言模型对全向图像沉浸环境的理解能力,通过定制基准和Omni-CoT方法提升模型表现。
ExGS:基于扩散先验的极端3D高斯压缩
机构 * Northwestern Polytechnical University(北western工业大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Shanghai Jiao Tong University(上海交通大学) ; Hong Kong University of Science and Technology(香港科技大学)
AI总结 ExGS通过结合UGC和GaussPainter,利用扩散先验实现高效且高质量的极端3DGS压缩。
FreeTacMan: 无需机器人的人工智能视觉-触觉数据采集系统用于接触密集的 manipulation
机构 * Shanghai Innovation Institute(上海创新研究院) ; The University of Hong Kong(香港大学) ; Shanghai Jiao Tong University(上海交通大学) ; Fudan University(复旦大学) ; Shanghai University(上海大学)
AI总结 FreeTacMan 提出了一种无需机器人的视觉-触觉数据采集系统,通过可穿戴抓取器和高精度光学跟踪系统,实现了高效的数据收集和多模态数据集的构建,推动了机器人 manipulation 的研究。
利用幻觉减少可提示分割中的手动提示依赖
机构 * Queen Mary University of London(伦敦大学玛丽女王学院) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 本文提出ProMaC框架,通过利用MLLM幻觉挖掘任务相关信息,提升分割精度与遮罩生成效果。
Comments NeurIPS 2024
无需剩余数据的机器无学习通过抑制样本贡献
机构 * Institute of Image Processing and Pattern Recognition, School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(图像处理与模式识别研究院,自动化与智能感知学院,上海交通大学)
AI总结 本文提出MU-Mis方法,通过最小化输入敏感性来无需剩余数据实现机器无学习,有效提升实用性与效率。
通过强化学习增强的遥控操作与混合的灵巧专家VLA实现人机操作
机构 * Shanghai Jiao Tong University(上海交通大学) ; Sharpa ; Shanghai AI Lab(上海人工智能实验室) ; Zhongguancun Academy(中关村学院) ; National University of Singapore(新加坡国立大学) ; Shanghai Innovation Institute(上海创新研究院)
AI总结 本文提出IMCopilot和MoDE-VLA框架,通过强化学习和多模态融合提升机器人灵巧操作能力,实现接触丰富的手内任务性能提升。
Comments Project Homepage: https://sites.google.com/view/mode-vla
基于向量场的可微政策学习用于基于视觉的无人机赛车
机构 * Shanghai Jiao Tong University(上海交通大学)
AI总结 本文提出DiffRacing框架,通过整合向量场和可微损失提升无人机赛车的样本效率与飞行性能。
Comments 8 pages, 7 figures, RAL 2026 March
FedMomentum: 在联邦微调中保持LoRA训练动量
机构 * Shanghai Jiao Tong University(上海交通大学) ; Queen's University Belfast(女王大学贝尔法斯特分校) ; Stevens Institute of Technology(史蒂文斯理工学院) ; Purdue University(普渡大学) ; Rice University(里奇大学)
AI总结 FedMomentum通过奇异值分解实现结构化且动量保持的LoRA聚合,提升联邦微调中的收敛速度和准确率。
长短期代理用于纯视觉支气管镜机器人自主性
机构 * Institute of Medical Robotics, Shanghai Jiao Tong University(上海交通大学医学机器人研究所) ; Shanghai Chest Hospital(上海胸科医院)
AI总结 本研究提出一种纯视觉的支气管镜机器人自主导航框架,通过长短期代理实现无外部跟踪的精准导航,验证了其在体内外实验中的有效性。
MedQ-Deg:一个多维基准,用于评估医疗图像质量退化下的多模态大语言模型
机构 * Fudan University(复旦大学) ; Shanghai AI Lab(上海人工智能实验室) ; Shanghai Jiaotong University(上海交通大学) ; Imperial College London(伦敦帝国理工学院)
AI总结 MedQ-Deg是一个多维基准,用于评估医疗图像质量退化下多模态大语言模型的性能,揭示模型在不同退化类型下的表现差异及置信度校准问题。
Comments 29 pages, 11 figures
Holi-Spatial: 将视频流转化为整体3D空间智能
机构 * Shanghai AI Lab(上海人工智能实验室) ; Northwestern Polytechnical University(西北工业大学) ; Shanghai Jiao Tong University(上海交通大学) ; Peking University(北京大学) ; Nanyang Technological University(南洋理工大学) ; Beihang University(北京航空航天大学) ; Sichuan University(四川大学) ; Tsinghua University(清华大学) ; The Chinese University of Hong Kong(香港中文大学) ; Fudan University(复旦大学) ; Hong Kong University of Science and Technology(香港科技大学)
AI总结 Holi-Spatial通过自动化方法构建大规模多模态3D空间数据集,提升空间推理任务的模型性能。
Comments project page: https://visionary-laboratory.github.io/holi-spatial/
Dial:一种基于知识的方言特定自然语言到SQL系统
机构 * Tsinghua University(清华大学) ; China Telecom Corporation Ltd. Shanghai Branch(中国电信股份有限公司上海分公司) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 Dial提出一种基于知识的方言特定自然语言到SQL系统,通过逻辑查询规划、知识库和执行驱动调试提升翻译准确性和方言特征覆盖度。
FLARE: 从视觉-语言模型中学习未来感知的潜在表示以实现自动驾驶
机构 * Shanghai Jiaotong University(上海交通大学) ; Shanghai Innovation Institute(上海创新研究院) ; OpenDriveLab at The University of Hong Kong(香港大学OpenDrive实验室) ; Li Auto Inc.(Li汽车公司)
AI总结 FLARE通过自监督的未来特征预测目标,从大规模未标记数据中学习鲁棒驾驶表示,无需语言监督,提升自动驾驶性能。
PonderLM-2: 在连续空间中通过潜在思想预训练语言模型
机构 * LUMIA Lab(LUMIA实验室) ; School of Artificial Intelligence(人工智能学院) ; Shanghai Jiao Tong University(上海交通大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Shanghai Innovation Institute(上海创新研究院) ; Sun Yat-sen University(中山大学)
AI总结 PonderLM-2通过在预训练过程中引入潜在思想的连续空间优化,提升了语言模型的生成能力与下游任务表现。
FreeKV: 提升KV缓存检索效率以实现高效的LLM推理
机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) ; Huawei Technologies Co., Ltd(华为技术有限公司)
AI总结 FreeKV通过算法与系统协同优化,提升KV缓存检索效率并保持精度,实现高达13倍的加速效果。
LangSurf: 语言嵌入的表面高斯用于3D场景理解
机构 * Brain and Artificial Intelligence Lab, Northwestern Polytechnical University(脑科学与人工智能实验室,西北工业大学) ; Tsinghua University(清华大学) ; Shanghai Jiaotong University(上海交通大学) ; Peking University(北京大学) ; School of Artifical Intelligence, Chongqing University of Posts and Telecommunications(人工智能学院,重庆邮电大学)
AI总结 LangSurf通过语言嵌入的表面高斯实现3D场景理解,提升2D和3D分割精度,扩展了下游任务如去除和编辑。
Comments \url{https://langsurf.github.io}
深度伪造生成与检测:基准与综述
机构 * East China Normal University(华东师范大学) ; Zhejiang University(浙江大学) ; Nanjing University(南京大学) ; Youtu Lab, Tencent(腾讯优图实验室) ; Shanghai Jiao Tong University(上海交通大学) ; Nanyang Technological University(南洋理工大学)
AI总结 本文综述了深度伪造生成与检测的最新进展,分析了相关技术、数据集及未来研究方向。
Comments This paper has been accepted by ACM Computing Surveys. We closely follow the latest developments in this \href{https://github.com/flyingby/Awesome-Deepfake-Generation-and-Detection}{project}
高效个性化重排序:半自动生成与在线知识蒸馏
机构 * University of Science and Technology of China(中国科学技术大学) ; Huawei(华为) ; Shanghai Jiao Tong University(上海交通大学) ; Beijing University of Posts and Telecommunications(北京邮电大学)
AI总结 本文提出PSAD框架,通过半自动生成与在线知识蒸馏提升个性化重排序的效率和性能。
双向数字孪生原型锚定与多周期学习用于少样本故障诊断
机构 * State Key Laboratory of Mechanical System and Vibration(机械系统与振动国家重点实验室) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 本文提出一种双向数字孪生原型锚定与多周期学习方法,用于解决少样本故障诊断中的数据不足问题,通过元训练和测试时适应提升模型鲁棒性,实验验证其有效性。
Comments 19 pages, 13 figures
SSP:通过行为和空间约束的联合优化实现安全的手术策略
机构 * Global College, Shanghai Jiao Tong University(上海交通大学全球学院) ; Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系) ; Computer Science and Artificial Intelligence Laboratory, Massachusetts Institute of Technology(麻省理工学院计算机科学与人工智能实验室)
AI总结 SSP通过联合优化行为和空间约束,实现安全的手术策略,确保在不确定性下的严格安全性,同时保持高任务成功率。
SIQA:迈向可靠的科学图像质量评估
机构 * TongJi University(同济大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 SIQA提出了一种多维框架,通过SIQA-U和SIQA-S评估科学图像的科学正确性和感知清晰度,揭示模型在评分一致性与科学理解上的差异。
生成模型中GRPO的进展:综述
机构 * SJTU(上海交通大学) ; THU(清华大学) ; CUHK(香港大学)
AI总结 本文综述了流GRPO在生成模型中的应用与进展,探讨了方法论改进和跨模态扩展,强调其作为通用对齐框架的重要性及未来挑战。
QuantSparse: 通过模型量化和注意力稀疏化全面压缩视频扩散变换器
机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) ; University of Chinese Academy of Sciences(中国科学院大学) ; ETH Zürich(苏黎世联邦理工学院) ; City College of New York, City University of New York, USA(纽约城市学院,纽约城市大学,美国) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 QuantSparse通过结合模型量化和注意力稀疏化,实现视频扩散变换器的高效压缩,提升性能并减少存储与推理时间。
Comments Accepted by ICLR 2026
量化视觉几何基础变换器
机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院人工智能安全国家重点实验室,计算技术研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; ETH Zürich(苏黎世联邦理工学院) ; City College of New York, City University of New York, USA(纽约城市学院,纽约城市大学,美国) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 本文提出QuantVGGT,首个针对大规模VGGT的量化框架,通过双平滑细粒度量化和噪声过滤多样化采样技术,在保持高精度的同时实现显著的内存减少和加速。
Comments Accepted by ICLR 2026
ActivePose: 用于机器人操作的主动6D物体姿态估计与跟踪
机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工大学) ; Shanghai Jiao Tong University(上海交通大学) ; Istituto Italiano di Tecnologia(意大利理工学院) ; The Hong Kong Polytechnic University(香港理工大学) ; D-Robotics(D-机器人)
AI总结 ActivePose通过结合视觉-语言模型与机器人想象力,实现主动6D物体姿态估计与跟踪,提升机器人操作的可靠性。
Comments 6D Pose, Diffusion Policy, Robot Learning
π³:排列等变视觉几何学习
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Shanghai Innovation Institute(上海创新研究院) ; Zhejiang University(浙江大学) ; University of Science and Technology of China(中国科学技术大学) ; Fudan University(复旦大学)
AI总结 π³通过排列等变架构实现无需参考视角的视觉几何重建,提升相机姿态和点地图重建的准确性和鲁棒性。
Comments Project page: https://yyfz.github.io/pi3/
扩散稳定策略用于自动化手术机器人操作
机构 * UM-SJTU Joint Intuitute(UM-SJTU联合学院) ; Shanghai Jiao Tong University(上海交通大学) ; Department of Computer Science and Engineering(计算机科学与工程系) ; The Chinese University of Hong Kong(香港中文大学) ; Department of Automation(自动化系)
AI总结 本文提出了一种基于扩散的策略学习框架,用于提升手术机器人在不完美或失败轨迹下的操作稳定性与鲁棒性。
Comments ICRA 2026
开放世界长期短期想象强化学习
机构 * MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(人工智能大模型关键实验室、人工智能研究院、上海交通大学) ; Ningbo Institute of Digital Twin, Eastern Institute of Technology(宁波数字孪生研究院、技术东院) ; School of Computer Science and Technology, East China Normal University(计算机科学与技术学院、华东师范大学)
AI总结 本文提出LS-Imagine方法,通过扩展想象 horizon 提高开放世界强化学习中长期收益的探索效率。
Comments Accepted by ICLR 2025 Oral. Project page: https://qiwang067.github.io/ls-imagine