arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

Shanghai Jiao Tong University(上海交通大学)

2026-03-24 至 2026-03-24 共收录 16
2603.22148 2026-03-24 cs.CV

OpenEarth-Agent: From Tool Calling to Tool Creation for Open-Environment Earth Observation

OpenEarth-Agent:从工具调用到工具创建用于开放环境地球观测

Sijie Zhao, Feng Liu, Xueliang Zhang, Hao Chen, Xinyu Gu, Zhe Jiang, Fenghua Ling, Ben Fei, Wenlong Zhang, Junjue Wang, Weihao Xuan, Pengfeng Xiao, Naoto Yokoya, Lei Bai

机构 * Nanjing University(南京大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) The University of Tokyo(东京大学)

AI总结 本文提出OpenEarth-Agent框架,通过自适应工作流规划与工具创建,解决开放环境地球观测中多源数据和异构任务的挑战,并通过OpenEarth-Bench评估其适应性和工具创建能力。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21957 2026-03-24 cs.CV

Unified Spatiotemporal Token Compression for Video-LLMs at Ultra-Low Retention

面向超低保留率的视频大语言模型统一时空令牌压缩

Junhao Du, Jialong Xue, Anqi Li, Jincheng Dai, Guo Lu

机构 * Shanghai Jiao Tong University(上海交通大学) Beijing University of Posts and Telecommunications(北京邮电大学)

AI总结 本文提出统一的时空令牌压缩方法,通过全局令牌保留池整合注意力权重和语义相似性,实现高效令牌选择与合并,保留90.1%性能并降低计算量至2.6%。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21808 2026-03-24 cs.CV

Cascade-Free Mandarin Visual Speech Recognition via Semantic-Guided Cross-Representation Alignment

无需级联的 Mandarin 视觉语音识别 via 语义引导的跨表征对齐

Lei Yang, Yi He, Fei Wu, Shilin Wang

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出一种无需级联的多任务学习架构,通过整合音素和viseme等中间表示,利用语义引导的局部对比损失对齐特征,提升识别性能并减少误差累积。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21700 2026-03-24 cs.CV

PPGL-Swarm: Integrated Multimodal Risk Stratification and Hereditary Syndrome Detection in Pheochromocytoma and Paraganglioma

PPGL-Swarm:集成多模态风险分层与遗传综合征检测的pheochromocytoma和paraganglioma诊断系统

Zelin Liu, Xiangfu Yu, Jie Huang, Ge Wang, Yizhe Yuan, Zhenyu Yi, Jing Xie, Haotian Jiang, Lichi Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) Ruijin Hospital(瑞金医院) ShanghaiTech University(上海科技大学)

AI总结 本文提出PPGL-Swarm系统,通过多模态证据整合实现全面诊断报告,包括自动化GAPP评分、基因风险警报及可追溯的推理路径,解决传统诊断方法的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21508 2026-03-24 cs.LG cs.AI cs.HC

Optimizing Feature Extraction for On-device Model Inference with User Behavior Sequences

在用户行为序列上优化特征提取以实现设备端模型推理

Chen Gong, Zhenzhe Zheng, Yiliu Chen, Sheng Wang, Fan Wu, Guihai Chen

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出AutoFeature系统,通过图抽象、图优化和高效缓存减少设备端特征提取延迟,提升模型推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11549 2026-03-24 cs.LG cs.AI

Native Reasoning Models: Training Language Models to Reason on Unverifiable Data

原生推理模型:训练语言模型在不可验证数据上进行推理

Yuanfu Wang, Zhixuan Liu, Xiangtian Li, Chaochao Lu, Chao Yang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出NRT框架,通过让模型自行生成推理轨迹,无需专家示范,提升推理能力,实验证明其在复杂推理任务中表现优异,具有鲁棒性和可扩展性。

Comments Accepted at ICLR 2026. Code available at https://github.com/sharkwyf/native-reasoning-models

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24358 2026-03-24 cs.SE cs.CL

Automatically Benchmarking LLM Code Agents through Agent-Driven Annotation and Evaluation

通过代理驱动的标注和评估自动评估代码代理

Lingyue Fu, Bolun Zhang, Hao Guan, Yaoming Zhu, Lin Qiu, Weiwen Liu, Xuezhi Cao, Xunliang Cai, Weinan Zhang, Yong Yu

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出代理驱动的基准构建流程,引入PRDBench包含50个真实Python项目,通过专门模型提升评估准确性,验证了框架的可扩展性和鲁棒性。

Comments Accepted by AAMAS 2026

Journal ref Proc. of the 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026), Paphos, Cyprus, May 25-29, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24302 2026-03-24 cs.LG

LEAF: Language-EEG Aligned Foundation Model for Brain-Computer Interfaces

LEAF:语言-脑电对齐的基础模型用于脑机接口

Muyun Jiang, Shuailei Zhang, Zhenjie Yang, Mengjun Wu, Weibang Jiang, Zhiwei Guo, Wei Zhang, Rui Liu, Shangen Zhang, Yong Li, Yi Ding, Cuntai Guan

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) Shanghai Jiao Tong University, China(上海交通大学,中国) University of Science and Technology Beijing, China(北京科技大学,中国) Southeast University, China(东南大学,中国)

AI总结 LEAF通过整合语义指导生成结构化的脑电嵌入,提升解码鲁棒性和迁移性,实现语言与脑电信号的对齐,取得12个数据集上的最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14145 2026-03-24 cs.DC cs.AI

DIP: Efficient Large Multimodal Model Training with Dynamic Interleaved Pipeline

DIP: 一种高效的大规模多模态模型训练方法,采用动态交错流水线

Zhenliang Xue, Hanpeng Hu, Xing Chen, Yimin Jiang, Yixin Song, Zeyu Mi, Yibo Zhu, Daxin Jiang, Yubin Xia, Haibo Chen

机构 * Institute of Parallel and Distributed Systems(并行与分布式系统研究所) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出DIP框架,通过分离不同模态计算和动态分割输入数据,提升大规模多模态模型训练效率,实验显示吞吐量提升达97.3%。

Comments To be published in ASPLOS'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21295 2026-03-24 cs.CV

Text-Image Conditioned 3D Generation

文本-图像条件的3D生成

Jiazhong Cen, Jiemin Fang, Sikuang Li, Guanjun Wu, Chen Yang, Taoran Yi, Zanwei Zhou, Zhikuan Bao, Lingxi Xie, Wei Shen, Qi Tian

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, School of Computer Science, Shanghai Jiao Tong University(人工智能大模型重点实验室、人工智能学院、计算机科学学院、上海交通大学) Huawei Inc.(华为公司) Huazhong University of Science and Technology(华中科技大学)

AI总结 本文提出结合文本和图像条件的3D生成方法,通过跨模态互补性提升生成质量,引入TIGON模型实现高效融合。

Comments CVPR 2026. Project page: https://jumpat.github.io/tigon-page Code: https://github.com/Jumpat/tigon

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13279 2026-03-24 cs.SI cs.AI

LLM-Enhanced Rumor Detection via Virtual Node Induced Edge Prediction

通过虚拟节点诱导边预测增强的谣言检测

Jiran Tao, Cheng Wang, Binyan Jiang

机构 * Department of Data Science and Artificial Intelligence(数据科学与人工智能系) Hong Kong Polytechnic University(香港理工大学) School of Mathematical Sciences(数学科学学院) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出一种整合大语言模型的谣言检测框架,通过引入虚拟节点捕捉文本连贯性,改进传统方法对文本连贯性与传播动态的建模能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08771 2026-03-24 cs.CV

LinearSR: Unlocking Linear Attention for Stable and Efficient Image Super-Resolution

LinearSR: 解锁线性注意力以实现稳定且高效的图像超分辨率

Xiaohui Li, Shaobin Zhuang, Shuo Cao, Yang Yang, Yuandong Pu, Qi Qin, Siqi Luo, Bin Fu, Yihao Liu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学) The Australian National University(澳大利亚国立大学)

AI总结 本文提出LinearSR框架,首次系统解决线性注意力在图像超分辨率中的关键挑战,通过改进的早停指导微调策略、SNR基专家混合架构和TAG指导范式,实现高质量与高效兼顾的超分辨率生成。

Comments Camera Ready of ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01641 2026-03-24 cs.CV

FideDiff: Efficient Diffusion Model for High-Fidelity Image Motion Deblurring

FideDiff:高效的高保真图像运动去模糊扩散模型

Xiaoyang Liu, Zhengyan Zhou, Zihang Xu, Jiezhang Cao, Zheng Chen, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Harvard University(哈佛大学)

AI总结 本文提出FideDiff,一种高效的单步扩散模型,用于高保真图像运动去模糊。通过将运动去模糊转化为扩散过程,结合Kernel ControlNet和自适应时间步预测,提升了去模糊性能。

Comments Accepted to ICLR 2026. Code is available at https://github.com/xyLiu339/FideDiff

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12224 2026-03-24 cs.RO cs.AI

RoboFAC: A Comprehensive Framework for Robotic Failure Analysis and Correction

RoboFAC:机器人故障分析与纠正的综合框架

Zewei Ye, Weifeng Lu, Minghao Ye, Tao Lin, Shuo Yang, Junchi Yan, Bo Zhao

机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

AI总结 RoboFAC通过构建大规模故障中心数据集,开发轻量级多模态模型,提升机器人故障诊断与纠正能力,实验显示其故障分析准确率比GPT-4o高34.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20382 2026-03-24 cs.CV

Uni-Classifier: Leveraging Video Diffusion Priors for Universal Guidance Classifier

Uni-Classifier: 利用视频扩散先验进行通用引导分类器

Yujie Zhou, Pengyang Ling, Jiazi Bu, Bingjie Gao, Li Niu

机构 * Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出Uni-Classifier,通过利用视频扩散先验引导前序模型的去噪过程,提升生成质量,适用于视频和3D生成任务。

Comments Accepted by ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20351 2026-03-24 cs.CR cs.AI

MANA: Towards Efficient Mobile Ad Detection via Multimodal Agentic UI Navigation

MANA:通过多模态代理UI导航实现高效的移动广告检测

Yizhe Zhao, Yongjian Fu, Zihao Feng, Hao Pan, Yongheng Deng, Yaoxue Zhang, Ju Ren

机构 * Department of Computer Science and Technology(计算机科学与技术系) University of Southern California(南加州大学) Shanghai Jiao Tong University(上海交通大学) State Key Laboratory of Internet Architecture(互联网架构国家重点实验室)

AI总结 本文提出MANA框架,通过整合多种信号实现高效移动广告检测,提升准确率和效率,有效识别隐蔽恶意广告。

详情

展开后加载摘要…

URL PDF HTML 收藏