arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

Shanghai Jiao Tong University(上海交通大学)

2026-03-19 至 2026-03-19 共收录 13
2603.17693 2026-03-19 cs.CV

Learning Transferable Temporal Primitives for Video Reasoning via Synthetic Videos

通过合成视频学习可迁移的时间原语以实现视频推理

Songtao Jiang, Sibo Song, Chenyi Zhou, Yuan Wang, Ruizhe Chen, Tongkun Guan, Ruilin Luo, Yan Zhang, Zhihang Tang, Yuchong Sun, Hang Zhang, Zhibo Yang, Shuai Bai, Junyang Lin, Zuozhu Liu

机构 * Zhejiang University(浙江大学) Qwen Team, Alibaba Group(通义实验室,阿里巴巴集团) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

AI总结 本文提出SynRL框架,通过合成视频训练模型的时间原语,提升视频推理能力,在15个基准测试中取得显著成效,合成数据在复杂场景中表现优于真实数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24910 2026-03-19 cs.CV

Learning Goal-Oriented Vision-and-Language Navigation with Self-Improving Demonstrations at Scale

基于大规模自改进演示的目标导向视觉-语言导航学习

Songze Li, Zun Wang, Gengze Zhou, Jialu Li, Xiangyu Zeng, Ziyang Gong, Limin Wang, Yu Qiao, Qi Wu, Mohit Bansal, Yi Wang

机构 * Shanghai AI Laboratory(上海人工智能实验室) UNC Chapel Hill(北卡罗来纳大学教堂山分校) Fudan University(复旦大学) The University of Adelaide(阿德莱德大学) Nanjing University(南京大学) Shanghai Jiaotong University(上海交通大学)

AI总结 本文提出SID方法,通过自改进演示提升导航能力,实现高效探索和泛化,显著提升导航性能,达到新状态的SOTA水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17541 2026-03-19 cs.CV

Temporal Gains, Spatial Costs: Revisiting Video Fine-Tuning in Multimodal Large Language Models

时间收益,空间代价:重新审视多模态大语言模型中的视频微调

Linghao Zhang, Jungang Li, Yonghua Hei, Sicheng Tao, Song Dai, Yibo Yan, Zihao Dongfang, Weiting Liu, Chenxi Qin, Hanqian Li, Xin Zou, Jiahao Zhang, Shuhang Xun, Haiyun Jiang, Xuming Hu

机构 * SJTU(上海交通大学) HKUST(GZ)(香港科技大学(珠海)) HKUST(香港科技大学) CityU(城市大学) FDU(复旦大学) HIT(哈尔滨工业大学) TJU(天津大学)

AI总结 本文研究了视频微调对多模态大语言模型视觉能力的影响,发现视频性能提升的同时,静态图像表现可能受限,提出混合帧策略以缓解空间与时间理解的平衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17408 2026-03-19 cs.CV cs.AI

Joint Degradation-Aware Arbitrary-Scale Super-Resolution for Variable-Rate Extreme Image Compression

联合退化感知任意尺度超分辨率用于可变速率极值图像压缩

Xinning Chai, Zhengxue Cheng, Xin Li, Rong Xie, Li Song

机构 * School of Information Science and Electronic Engineering, Shanghai Jiao Tong University(上海交通大学信息科学与电子工程学院) Department of Electronic Engineer and Information Science, University of Science and Technology of China(中国科学技术大学电子工程与信息科学系) MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(上海交通大学人工智能教育部重点实验室)

AI总结 本文提出ASSR-EIC框架,利用任意尺度超分辨率支持可变速率极值图像压缩,通过联合退化感知解码器实现率自适应重建,提升低比特率下的图像恢复质量。

Comments Accepted by IEEE Transactions on BroadCasting

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17382 2026-03-19 cs.CV

VisionNVS: Self-Supervised Inpainting for Novel View Synthesis under the Virtual-Shift Paradigm

VisionNVS: 一种基于虚拟位移范式的自监督补全方法用于新型视角合成

Hongbo Lu, Liang Yao, Chenghao He, Fan Liu, Wenlong Liao, Tao He, Pai Peng

机构 * Shanghai Jiao Tong University(上海交通大学) Hohai University(河海大学) COWARobot Co. Ltd.(COWARobot有限公司)

AI总结 本文提出VisionNVS,通过引入虚拟位移策略,将视角合成问题转化为自监督补全任务,利用单目深度代理模拟遮挡模式,提升自动驾驶中新型视角合成的几何精度和视觉质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17160 2026-03-19 stat.ML cs.LG math.ST stat.TH

Self-Regularized Learning Methods

自调节学习方法

Max Schölpple, Liu Fanghui, Ingo Steinwart

机构 * Institute for Stochastics(随机学研究所) Applications, University of Stuttgart(应用,斯图加特大学) School of Mathematical Sciences(数学科学学院) Institute of Natural Sciences(自然科学研究所) MOE-LSC, Shanghai Jiao Tong University(教育部-上海交通大学联合实验室)

AI总结 本文提出基于自调节概念的通用学习算法分析框架,通过隐式复杂度控制实现无需显式正则化。该框架涵盖经典正则化经验风险最小化和梯度下降,提供统计分析并讨论数据依赖超参数选择问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17052 2026-03-19 cs.LG cs.AI

Early Quantization Shrinks Codebook: A Simple Fix for Diversity-Preserving Tokenization

早量化缩小代码表:一种维持多样性token化问题的简单修复

Wenhao Zhao, Qiran Zou, Rushi Shah, Yudi Wu, Zhouhan Lin, Dianbo Liu

机构 * National University of Singapore(国立新加坡大学) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文研究了向量量化中的坍塌问题,发现随机初始化和编码器容量限制导致token和嵌入坍塌,并提出缓解方案,是首次系统探讨该问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16301 2026-03-19 cs.RO

OGScene3D: Incremental Open-Vocabulary 3D Gaussian Scene Graph Mapping for Scene Understanding

OGScene3D: 增量式开放词汇3D高斯场景图映射用于场景理解

Siting Zhu, Ziyun Lu, Guangming Wang, Chenguang Huang, Yongbo Chen, I-Ming Chen, Wolfram Burgard, Hesheng Wang

机构 * Shanghai Jiao Tong University(上海交通大学) University of Cambridge(剑桥大学) University of Technology Nuremberg(纽伦堡技术大学) Nanyang Technological University(南洋理工大学) Department of Automation, Key Laboratory of System Control and Information Processing of Ministry of Education, State Key Laboratory of Avionics Integration and Aviation System-of-Systems Synthesis, Shanghai Key Laboratory of Navigation and Location Based Services, Shanghai Jiao Tong University(自动化系,教育部系统控制与信息处理重点实验室,航空系统集成与航空系统-of-系统综合国家重点实验室,上海导航与定位基于服务重点实验室,上海交通大学)

AI总结 OGScene3D通过增量式3D高斯场景图映射,实现开放词汇场景理解,结合高斯表示与层次优化策略,提升语义一致性与长期优化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23562 2026-03-19 cs.LG cs.AI cs.CL

VL-RouterBench: A Benchmark for Vision-Language Model Routing

VL-RouterBench:一种用于视觉-语言模型路由的基准测试

Zhehao Huang, Baijiong Lin, Jingyuan Zhang, Jingying Wang, Yuhang Liu, Ning Lu, Tao Li, Xiaolin Huang

机构 * Institute of Image Processing and Pattern Recognition, Shanghai Jiao Tong University(1 图像处理与模式识别研究所,上海交通大学) The Hong Kong University of Science and Technology (Guangzhou)(2 香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(3 香港科学与技术大学)

AI总结 本文提出VL-RouterBench,用于系统评估视觉-语言模型路由系统的能力,通过构建质量与成本矩阵,评估10种路由方法并发现显著的路由改进空间,揭示了路由架构改进的潜力。

Comments CVPR 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02341 2026-03-19 cs.CV

TALO: Pushing 3D Vision Foundation Models Towards Globally Consistent Online Reconstruction

TALO:推动3D视觉基础模型向全球一致的在线重建迈进

Fengyi Zhang, Tianjun Zhang, Kasra Khosoussi, Zheng Zhang, Zi Huang, Yadan Luo

机构 * UQMM Lab, The University of Queensland(昆士兰大学UQMM实验室) Shanghai Jiao Tong University(上海交通大学) Harbin Institute of Technology(哈尔滨工业大学)

AI总结 本文提出基于薄板样条的高自由度长期对齐框架,通过全局传播控制点纠正空间变化不一致,并采用点无关子图注册设计提升鲁棒性,实验表明其在多数据集和相机配置下均能获得更一致的几何和更低的轨迹误差。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13615 2026-03-19 cs.AI cs.CL cs.HC

See, Think, Act: Teaching Multimodal Agents to Effectively Interact with GUI by Identifying Toggles

看见、思考、行动:通过识别切换器教多模态代理有效交互GUI

Zongru Wu, Rui Mao, Zhiyuan Tian, Pengzhou Cheng, Tianjie Ju, Zheng Wu, Lingzhong Dong, Haiyue Sheng, Zhuosheng Zhang, Gongshen Liu

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)

AI总结 本文提出State-aware Reasoning方法,通过识别当前切换状态和指令目标状态,提升多模态代理在GUI切换指令执行的准确性,实验显示准确率提升超30%。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05591 2026-03-19 cs.AI

MLlm-DR: Towards Explainable Depression Recognition with MultiModal Large Language Models

MLlm-DR: 向多模态大语言模型的可解释性抑郁识别迈进

Wei Zhang, Juan Chen, En Zhu, Wenhong Cheng, YunPeng Li, Yanbo J. Wang

机构 * National University of Defense Technology(国防科技大学) University of Chinese Academy of Sciences(中国科学院大学) Shanghai Mental Health Center, Shanghai Jiao Tong University School of Medicine(上海精神卫生中心,上海交通大学医学院) Nanjing Industria Tenebris Information Technology Co., Ltd.(南京Industria Tenebris信息技术有限公司) National University of Uzbekistan named after Mirzo Ulugbek(乌兹别克斯坦Mirzo Ulugbek命名的国立大学)

AI总结 本文提出MLlm-DR模型,通过多模态大语言模型实现可解释的抑郁识别,结合小型LLM和轻量级查询模块,提升诊断性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12346 2026-03-19 cs.CV cs.AI

Efficient Diffusion as Low Light Enhancer

高效扩散作为低光照增强器

Guanzhou Lan, Qianli Ma, Yuqi Yang, Zhigang Wang, Dong Wang, Xuelong Li, Bin Zhao

机构 * Northwestern Polytechnical University(西北工业大学) Shanghai Jiao Tong University(上海交通大学) Shanghai AI Lab(上海人工智能实验室) TeleAI

AI总结 本文提出ReDDiT框架,通过线性外推错误分数函数和迁移高斯流到反射感知残差空间,提升低光照图像增强效率,仅用2步即可达到SOTA效果。

Comments CVPR 2025 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏