arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Shanghai Jiao Tong University(上海交通大学)

2026-03-03 至 2026-03-03 共收录 50
2603.00519 2026-03-03 cs.CV

Jano: Adaptive Diffusion Generation with Early-stage Convergence Awareness

Jano:具有早期阶段收敛意识的自适应扩散生成

Yuyang Chen, Linqian Zeng, Yijin ZHou, Hengjie Li, Jidong Zhai

机构 * Shanghai Jiaotong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Tsinghua University(清华大学)

AI总结 Jano通过自适应区域感知生成方法,提升扩散模型的生成效率,实现2.0至2.4倍的加速,同时保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00510 2026-03-03 cs.CV cs.AI

What Do Visual Tokens Really Encode? Uncovering Sparsity and Redundancy in Multimodal Large Language Models

视觉标记究竟编码了什么?揭示多模态大语言模型中的稀疏性与冗余性

Yingqi Fan, Junlong Tong, Anhao Zhao, Xiaoyu Shen

机构 * Institute of Digital Twin, Eastern Institute of Technology(数字孪生研究所,东部技术研究所) Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative(宁波空间智能与数字衍生关键实验室) Shanghai Jiao Tong University(上海交通大学) The Hong Kong Polytechnic University(香港理工大学)

AI总结 本研究揭示多模态大语言模型中视觉标记的稀疏性与冗余性,通过EmbedLens工具发现活跃标记在进入模型前已编码细粒度信息,并提出中层注入方法提升效率。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00490 2026-03-03 cs.AI

LifeEval: A Multimodal Benchmark for Assistive AI in Egocentric Daily Life Tasks

LifeEval: 一种面向日常生活中自体视角的多模态基准,用于辅助AI

Hengjian Gao, Kaiwei Zhang, Shibo Wang, Mingjie Chen, Qihang Cao, Xianfeng Wang, Yucheng Zhu, Xiongkuo Min, Wei Sun, Dandan Zhu, Guangtao Zhai

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) East China Normal University(华东师范大学) Shanghai University of Electric Power(上海电力大学)

AI总结 LifeEval 是一个面向日常生活中自体视角的多模态基准,用于评估实时任务导向的人机协作,揭示了在动态环境中实现有效交互的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00479 2026-03-03 cs.CV

U-VLM: Hierarchical Vision Language Modeling for Report Generation

U-VLM:用于报告生成的分层视觉语言模型

Pengcheng Shi, Minghui Zhang, Kehan Song, Jiaqi Liu, Yun Gu, Xinglin Zhang

机构 * Medical Image Insights Co. Ltd.(医疗影像洞察有限公司) Shanghai Jiao Tong University(上海交通大学)

AI总结 U-VLM通过分层视觉语言建模在CT-RATE和AbdomenAtlas 3.0上实现了最先进的报告生成性能,展示了精心设计的视觉编码器预训练的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00466 2026-03-03 cs.CV

DreamWorld: Unified World Modeling in Video Generation

DreamWorld: 视频生成中的统一世界建模

Boming Tan, Xiangdong Zhang, Ning Liao, Yuqing Zhang, Shaofeng Zhang, Xue Yang, Qi Fan, Yanyong Zhang

机构 * University of Science(科学技术大学) Shanghai Jiao Tong University, Shanghai, China.(上海交通大学) Nanjing University, Suzhou, China.(南京大学)

AI总结 DreamWorld通过联合世界建模范式和约束退火技术,提升视频生成的世界一致性,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00416 2026-03-03 cs.IR cs.AI

MuonRec: Shifting the Optimizer Paradigm Beyond Adam in Scalable Generative Recommendation

MuonRec: 在可扩展生成推荐中超越Adam的优化器范式

Rong Shan, Aofan Yu, Bo Chen, Kuo Cai, Qiang Luo, Ruiming Tang, Han Li, Weiwen Liu, Weinan Zhang, Jianghao Lin

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 MuonRec通过引入Muon优化器提升可扩展生成推荐系统的训练效率和排名质量,优于Adam/AdamW基线。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02108 2026-03-03 cs.CL

Out of the Memory Barrier: A Highly Memory Efficient Training System for LLMs with Million-Token Contexts

突破内存瓶颈:支持百万级上下文的高效训练系统

Wenhao Li, Daohai Yu, Gen Luo, Yuxin Zhang, Fei Chao, Rongrong Ji, Yifan Wu, Jiaxin Liu, Ziyang Gong, Zimu Liao

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing Ministry of Education of China(教育部多媒体可信感知与高效计算重点实验室) Xiamen University(厦门大学) Peking University(北京大学) University of Illinois Urbana-Champaign(伊利诺伊大学香槟分校) Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室)

AI总结 OOMB通过高效内存管理实现百万级上下文LLM训练,显著降低内存开销,提升训练效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19208 2026-03-03 cs.CL

DiSRouter: Distributed Self-Routing for LLM Selections

DiSRouter: 分布式自路由用于大语言模型选择

Hang Zheng, Hongshen Xu, Yongkai Lin, Shuai Fan, Lu Chen, Kai Yu

机构 * X-LANCE Lab, School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(上海交通大学计算机科学系X-LANCE实验室) Shanghai Innovation Institution, Shanghai, China(上海创新机构) Jiangsu Key Lab of Language Computing, Suzhou, China(江苏省语言计算重点实验室) AISpeech Co., Ltd., Suzhou, China(AISpeech公司) Suzhou Laboratory, Suzhou, China(苏州实验室)

AI总结 DiSRouter通过分布式自路由机制,利用LLM的自我认知能力,实现更灵活、可扩展的多代理系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10575 2026-03-03 cs.CV

UniFlow: A Unified Pixel Flow Tokenizer for Visual Understanding and Generation

UniFlow:一种统一的像素流标记器用于视觉理解和生成

Zhengrong Yue, Haiyu Zhang, Xiangyu Zeng, Boyu Chen, Chenting Wang, Shaobin Zhuang, Lu Dong, Yi Wang, Limin Wang, Yali Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Beihang University(北京航空航天大学) Shenzhen Key Lab of Computer Vision and Pattern Recognition, Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳计算机视觉与模式识别重点实验室,深圳先进技术研究院,中国科学院) Nanjing University(南京大学) University of Science and Technology of China(中国科学技术大学) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

AI总结 UniFlow是一种统一的像素流标记器,通过灵活适配视觉编码器和轻量级解码器,在视觉理解和生成任务中实现了性能的双赢。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12813 2026-03-03 cs.RO cs.SY eess.SY

Bridging Perception and Planning: Towards End-to-End Planning for Signal Temporal Logic Tasks

连接感知与规划:面向信号时序逻辑任务的端到端规划

Bowen Ye, Junyue Huang, Yang Liu, Xiaozhen Qiao, Xiang Yin

机构 * School of Automation & Intelligent Sensing, Shanghai Jiao Tong University(自动化与智能感知学院,上海交通大学) University of Minnesota, Twin Cities(明尼苏达大学,双城分校) School of Information Science and Technology, University of Science and Technology of China(信息科学与技术学院,中国科学技术大学)

AI总结 本文提出了一种端到端的STL规划器,通过结构感知的混合专家模型,实现对信号时序逻辑任务的高效规划与执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19754 2026-03-03 cs.CV

FastAvatar: Towards Unified and Fast 3D Avatar Reconstruction with Large Gaussian Reconstruction Transformers

FastAvatar: 向统一且快速的3D人像重建迈进:基于大高斯重建变换器

Yue Wu, Xuanhong Chen, Yufan Wu, Wen Li, Yuxi Lu, Kairui Feng

机构 * Tongji University(同济大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) AKool

AI总结 FastAvatar通过大高斯重建变换器实现快速且统一的3D人像重建,利用多种输入数据提升重建质量和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11484 2026-03-03 cs.CV

CineTrans: Learning to Generate Videos with Cinematic Transitions via Masked Diffusion Models

CineTrans: 通过掩码扩散模型学习生成具有电影过渡的视频

Xiaoxue Wu, Bingjie Gao, Yu Qiao, Yaohui Wang, Xinyuan Chen

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

AI总结 CineTrans通过掩码扩散模型生成具有电影风格的多镜头视频,利用镜头边界与注意力图的对应关系,实现稳定且高质量的视频过渡。

Comments ICLR2026 Accept; Project Page:https://uknowsth.github.io/CineTrans/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15852 2026-03-03 cs.CV cs.AI

Advancing Complex Video Object Segmentation via Progressive Concept Construction

通过渐进式概念构建推进复杂视频对象分割

Zhixiong Zhang, Shuangrui Ding, Xiaoyi Dong, Songxin He, Jianfan Lin, Junsong Tang, Yuhang Zang, Yuhang Cao, Dahua Lin, Jiaqi Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) Harbin Institute of Technology(哈尔滨工业大学) CPII under InnoHK(InnoHK下的CPII)

AI总结 SeC通过渐进式概念构建方法,在复杂视频对象分割任务中实现了显著性能提升,特别是在语义复杂场景下的表现优于现有方法。

Comments project page: https://rookiexiong7.github.io/projects/SeC/ ; code: https://github.com/OpenIXCLab/SeC ; dataset: https://huggingface.co/datasets/OpenIXCLab/SeCVOS

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03135 2026-03-03 cs.CV cs.AI cs.CL

OmniSpatial: Towards Comprehensive Spatial Reasoning Benchmark for Vision Language Models

OmniSpatial:迈向视觉语言模型的空间推理综合基准

Mengdi Jia, Zekun Qi, Shaochen Zhang, Wenyao Zhang, Xinqiang Yu, Jiawei He, He Wang, Li Yi

机构 * Tsinghua University(清华大学) Xian Jiaotong University(西安交通大学) Shanghai Jiao Tong University(上海交通大学) Galbot Peking University(北京大学) Shanghai Qi Zhi Institute(上海启智研究院)

AI总结 OmniSpatial是一个基于认知心理学的综合性空间推理基准,通过动态推理、复杂空间逻辑等四个类别,评估视觉语言模型在空间推理上的能力与局限。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02860 2026-03-03 cs.RO cs.AI

Tru-POMDP: Task Planning Under Uncertainty via Tree of Hypotheses and Open-Ended POMDPs

Tru-POMDP:通过假设树和开放性POMDPs在不确定性下进行任务规划

Wenjing Tang, Xinyu He, Yongxi Huang, Yunxiao Xiao, Cewu Lu, Panpan Cai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) East China Normal University(华东师范大学) Beijing University of Posts and Telecommunications(北京邮电大学)

AI总结 Tru-POMDP通过结合LLM生成的信念与开放性POMDP规划,有效应对任务规划中的不确定性,提升规划效率与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04326 2026-03-03 cs.CV cs.AI

WorldSense: Evaluating Real-world Omnimodal Understanding for Multimodal LLMs

WorldSense: 评估多模态大语言模型的现实世界多模态理解

Jack Hong, Shilin Yan, Jiayin Cai, Xiaolong Jiang, Yao Hu, Weidi Xie

机构 * Xiaohongshu Inc.(小红书公司) Shanghai Jiao Tong University(上海交通大学)

AI总结 WorldSense是首个评估多模态大语言模型现实世界多模态理解能力的基准,通过多模态协作、多样化视频任务和高质量标注,全面评估模型在复杂场景中的表现。

Comments Accepted by ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05233 2026-03-03 cs.AI

Electric Vehicle User Charging Behavior Analysis Integrating Psychological and Environmental Factors: A Statistical-Driven LLM based Agent Approach

电动汽车用户充电行为分析:整合心理和环境因素:一种基于统计驱动的LLM代理方法

Chuanlin Zhang, Junkang Feng, Chenggang Cui, Pengfeng Lin, Hui Chen, Yan Xu, A. M. Y. M. Ghias, Qianguang Ma, Pei Zhang

机构 * School of Electrical Engineering, Shanghai Jiaotong University(上海交通大学电气工程学院) School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院) Psychological Consultation Center, East China University of Political Science and Law(中国政法大学政治学与法律系心理咨询中心) School of Electrical and Information Engineering, Tianjin University(天津大学电气与信息工程学院)

AI总结 本文提出一种基于统计驱动LLM的代理方法,整合心理和环境因素分析电动汽车用户充电行为,揭示行为异质性及决策影响因素。

Comments Accepted for publication in CSEE Journal of Power and Energy Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.08007 2026-03-03 cs.CV

Velocity Disambiguation for Video Frame Interpolation

视频帧插值中的速度歧义消除

Zhihang Zhong, Yiming Zhang, Wei Wang, Xiao Sun, Yu Qiao, Gurunandan Krishnan, Sizhuo Ma, Jian Wang

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Cornell University(康奈尔大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) OtoNexus Medical Technologies(OtoNexus医疗科技公司) Snap Inc(Snap公司)

AI总结 本文提出距离索引方法,通过显式提示对象移动距离来提升视频帧插值的精度和质量。

Comments ECCV2024 Oral; TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00123 2026-03-03 cs.CV cs.AI

CT-Flow: Orchestrating CT Interpretation Workflow with Model Context Protocol Servers

CT-Flow: 通过模型上下文协议服务器协调CT解释工作流

Yannian Gu, Xizhuo Zhang, Linjie Mu, Yongrui Yu, Zhongzhen Huang, Shaoting Zhang, Xiaofan Zhang

机构 * Qing Yuan Research Institute, Shanghai Jiao Tong University, Shanghai, China(清元研究院,上海交通大学,上海,中国) Shanghai Innovation Institute, Shanghai, China(上海创新研究院,上海,中国) Sensetime Research, Shanghai, China(senseTime研究院,上海,中国)

AI总结 CT-Flow通过模型上下文协议实现3D CT解释工作流的动态协调,提升诊断准确性和工具调用效率。

Comments submitting to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00030 2026-03-03 cs.CL

SimpleTool: Parallel Decoding for Real-Time LLM Function Calling

SimpleTool: 并行解码用于实时大语言模型功能调用

Xiaoxin Shi, Jiaxin Wan, Linkang Dong, Wei Jiang, Yue Liu, Zengfeng Huang

机构 * Shanghai Jiao Tong University, Shanghai, China(上海交通大学) Shanghai Innovation Institute, Shanghai, China(上海创新研究院) Fudan University, Shanghai, China(复旦大学)

AI总结 SimpleTool通过并行解码技术实现大语言模型功能调用的实时加速,提升效率并降低延迟,适用于实时应用场景。

详情

展开后加载摘要…

URL PDF HTML 收藏