arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Shanghai Jiao Tong University(上海交通大学)

2026-02-11 至 2026-02-11 共收录 14
2602.10093 2026-02-11 cs.RO

UniVTAC: A Unified Simulation Platform for Visuo-Tactile Manipulation Data Generation, Learning, and Benchmarking

UniVTAC:一种用于视觉-触觉操作数据生成、学习和评估的统一仿真平台

Baijun Chen, Weijie Wan, Tianxing Chen, Xianda Guo, Congsheng Xu, Yuanyang Qi, Haojie Zhang, Longyan Wu, Tianling Xu, Zixuan Li, Yizhe Wu, Rui Li, Xiaokang Yang, Ping Luo, Wei Sui, Yao Mu

机构 * ScaleLab, Shanghai Jiao Tong University(上海交通大学ScaleLab) D-Robotics ViTai Robotics The University of Hong Kong(香港大学) Nanjing University(南京大学) Shenzhen University(深圳大学) Wuhan University(武汉大学) Fudan University(复旦大学) Tsinghua University(清华大学)

AI总结 UniVTAC提出了一种统一的视觉-触觉数据生成平台,通过训练触觉中心的编码器和基准任务提升机器人操作的成功率。

Comments Website: https://univtac.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09934 2026-02-11 cs.CV

VersaViT: Enhancing MLLM Vision Backbones via Task-Guided Optimization

VersaViT: 通过任务引导优化增强MLLM视觉骨干

Yikun Liu, Yuan Liu, Shangzhe Di, Haicheng Wang, Zhongyin Zhao, Le Tian, Xiao Zhou, Jie Zhou, Jiangchao Yao, Yanfeng Wang, Weidi Xie

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University, China(上海交通大学人工智能学院) CMIC, Shanghai Jiao Tong University, China(上海交通大学计算机学院) WeChat AI, Tencent Inc., China(腾讯公司)

AI总结 VersaViT通过任务引导优化增强MLLM视觉骨干,解决其在密集预测任务中的性能问题,提升视觉任务的适应性与表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09893 2026-02-11 cs.RO cs.AI

TaCo: A Benchmark for Lossless and Lossy Codecs of Heterogeneous Tactile Data

TaCo: 一种用于异构触觉数据无损和有损编解码器的基准测试

Zhengxue Cheng, Yan Zhao, Keyu Wang, Hengdi Zhang, Li Song

机构 * Shanghai Jiao Tong University(上海交通大学) Paxini Tech.(帕辛尼科技)

AI总结 TaCo提出了一种用于评估触觉数据编解码器性能的基准测试,通过评估30种压缩方法,包括神经编解码器,验证了无损和有损压缩方案在多个任务中的优越性能。

Comments 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09883 2026-02-11 cs.CV

AdaTSQ: Pushing the Pareto Frontier of Diffusion Transformers via Temporal-Sensitivity Quantization

AdaTSQ: 通过时间敏感量化推动扩散变换器的帕累托前沿

Shaoqiu Zhang, Zizhong Ding, Kaicheng Yang, Junyi Wu, Xianglong Yan, Xi Li, Bingnan Duan, Jianping Fang, Yulun Zhang

机构 * Shanghai Jiaotong University(上海交通大学)

AI总结 AdaTSQ通过时间敏感量化方法提升扩散变换器的效率与质量,优于现有方法。

Comments Code will be released at https://github.com/Qiushao-E/AdaTSQ/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09868 2026-02-11 cs.CV

Free-GVC: Towards Training-Free Extreme Generative Video Compression with Temporal Coherence

Free-GVC: 向无训练极端生成视频压缩迈进:时间一致性

Xiaoyue Ling, Chuqin Zhou, Chunyi Li, Yunuo Chen, Yuan Tian, Guo Lu, Wenjun Zhang

机构 * Institute of Image Communication and Network Engineering, Shanghai Jiao Tong University(图像通信与网络工程研究所,上海交通大学) Shanghai AI Lab(上海人工智能实验室)

AI总结 Free-GVC通过无训练的生成视频压缩框架,在超低比特率下实现视觉质量与时间一致性的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09825 2026-02-11 cs.CV

SAKED: Mitigating Hallucination in Large Vision-Language Models via Stability-Aware Knowledge Enhanced Decoding

SAKED: 通过稳定性感知知识增强解码缓解大视觉-语言模型中的幻觉

Zhaoxu Li, Chenqi Kong, Peijun Bao, Song Xia, Yi Tu, Yi Yu, Xinghao Jiang, Xudong Jiang

机构 * ROSE Lab, School of Electrical and Electronic Engineering, Nanyang Technological University, Singapore(ROSE实验室,电子工程学院,南洋理工大学,新加坡) ROSE Lab, Interdisciplinary Graduate Programme, Nanyang Technological University, Singapore(ROSE实验室,跨学科研究生项目,南洋理工大学,新加坡) School of Physical and Mathematical Sciences, Nanyang Technological University, Singapore(物理与数学科学学院,南洋理工大学,新加坡) Shanghai Jiao Tong University, China(上海交通大学,中国)

AI总结 SAKED通过引入稳定性感知知识增强解码方法,有效缓解大视觉-语言模型中的幻觉问题,无需训练即可集成至不同架构中,实现最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09657 2026-02-11 cs.RO

AutoFly: Vision-Language-Action Model for UAV Autonomous Navigation in the Wild

AutoFly:面向野外无人机自主导航的视觉-语言-动作模型

Xiaolou Sun, Wufei Si, Wenhui Ni, Yuntian Li, Dongming Wu, Fei Xie, Runwei Guan, He-Yang Xu, Henghui Ding, Yuan Wu, Yutao Yue, Yongming Huang, Hui Xiong

机构 * Southeast University(东南大学) Purple Mountain Labs(紫金山实验室) The Chinese University of Hong Kong(香港中文大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 AutoFly是一种面向野外无人机自主导航的视觉-语言-动作模型,通过伪深度编码器和渐进两阶段训练策略,实现自主避障和规划,提升导航成功率。

Comments Acceped by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09432 2026-02-11 cs.CV

SceneReVis: A Self-Reflective Vision-Grounded Framework for 3D Indoor Scene Synthesis via Multi-turn RL

SceneReVis: 一种基于多轮强化学习的视觉 grounding 框架,用于通过多轮强化学习进行 3D 室内场景合成

Yang Zhao, Shizhao Sun, Meisheng Zhang, Yingdong Shi, Xubo Yang, Jiang Bian

机构 * Shanghai Jiao Tong University, Shanghai, China(上海交通大学) Microsoft Research Asia, Beijing, China(微软亚洲研究院) Peking University, Beijing, China(北京大学) ShanghaiTech University, Shanghai, China(上海科技大学)

AI总结 SceneReVis 通过多轮强化学习和多模态反馈,实现高保真 3D 室内场景合成,提升空间规划能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09042 2026-02-11 cs.SD eess.AS

The SJTU X-LANCE Lab System for MSR Challenge 2025

上海交通大学X-LANCE实验室系统用于MSR挑战2025

Jinxuan Zhu, Hao Qiu, Haina Zhu, Jianwei Yu, Kai Yu, Xie Chen

机构 * SJTU X-LANCE Lab(上海交通大学X-LANCE实验室)

AI总结 X-LANCE实验室提出了一种基于BS-RoFormers的音乐源恢复系统,通过预训练模型和多种训练方案实现8种乐器分离,取得挑战赛多项指标第一名。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02380 2026-02-11 cs.CV

Unified Personalized Reward Model for Vision Generation

面向视觉生成的统一个性化奖励模型

Yibin Wang, Yuhang Zang, Feng Han, Jiazi Bu, Yujie Zhou, Cheng Jin, Jiaqi Wang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiaotong University(上海交通大学) Shanghai AI Lab(上海人工智能实验室)

AI总结 本文提出UnifiedReward-Flex,一种面向视觉生成的统一个性化奖励模型,通过结合奖励建模与灵活上下文适应的推理,提升视觉生成的准确性与对人类偏好的对齐性。

Comments Website: https://codegoat24.github.io/UnifiedReward/flex

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21797 2026-02-11 cs.CV

MoWM: Mixture-of-World-Models for Embodied Planning via Latent-to-Pixel Feature Modulation

MoWM: 通过潜在到像素特征调制的混合世界模型实现具身规划

Yangcheng Yu, Xin Jin, Yu Shang, Xin Zhang, Haisheng Su, Wei Wu, Yong Li

机构 * Tsinghua University(清华大学) Manifold AI Shanghai Jiao Tong University(上海交通大学)

AI总结 MoWM通过融合潜在世界模型与像素特征,提升具身规划中动作解码的精度与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11097 2026-02-11 cs.CL

The Devil behind the mask: An emergent safety vulnerability of Diffusion LLMs

面具背后的魔鬼:扩散语言模型的新兴安全漏洞

Zichen Wen, Jiashu Qu, Zhaorun Chen, Xiaoya Lu, Dongrui Liu, Zhiyuan Liu, Ruixi Wu, Yicun Yang, Xiangqi Jin, Haoyun Xu, Xuyang Liu, Weijia Li, Chaochao Lu, Jing Shao, Conghui He, Linfeng Zhang

机构 * EPIC Lab, Shanghai Jiao Tong University(上海交通大学EPIC实验室) Shanghai AI Laboratory(上海人工智能实验室) University of Chicago(芝加哥大学)

AI总结 DIJA揭示了扩散语言模型的安全漏洞,通过构造对抗性提示利用双向建模和并行解码机制,使有害内容在对齐训练模型中得以生成。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13027 2026-02-11 cs.LG

Deconstructing Positional Information: From Attention Logits to Training Biases

解构位置信息:从注意力logits到训练偏见

Zihan Gu, Ruoyu Chen, Han Zhang, Hua Zhang, Yue Hu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Antai College of Economics and Management, Shanghai Jiao Tong University(上海交通大学安泰经济管理学院)

AI总结 本文通过分析注意力logits和位置编码形式,揭示了乘法编码在整合位置与语义信息上的优势,并发现训练过程中存在的单头沉积模式。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17490 2026-02-11 cs.LG cs.AI

Plasticine: Accelerating Research in Plasticity-Motivated Deep Reinforcement Learning

Plasticine: 加速塑料性驱动的深度强化学习研究

Mingqi Yuan, Qi Wang, Guozheng Ma, Caihao Sun, Bo Li, Xin Jin, Yunbo Wang, Xiaokang Yang, Wenjun Zeng, Dacheng Tao, Jiayu Chen

机构 * HK PolyU(香港理工大学) SJTU(上海交通大学) EIT, Ningbo(宁波工程学院) NTU(National University of Technology) HKU(香港大学) INFIFORCE

AI总结 Plasticine是首个开源框架,用于评估深度强化学习中的塑性优化,提供多种缓解方法和评估指标,帮助研究者系统量化塑性损失并分析动态。

Comments 21 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏