arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

Shanghai Jiao Tong University(上海交通大学)

2026-04-28 至 2026-04-28 共收录 25
2604.24447 2026-04-28 cs.RO cs.AI

Characterizing Vision-Language-Action Models across XPUs: Constraints and Acceleration for On-Robot Deployment

跨XPUs的视觉-语言-动作模型特性分析:约束与加速以实现机器人部署

Kaijun Zhou, Qiwei Chen, Da Peng, Zhiyang Li, Xijun Li, Jinyu Gu

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)

AI总结 本文研究了视觉-语言-动作模型在机器人上的部署问题,通过模型与硬件的协同分析,揭示了边缘加速器在成本、能耗和时间上的优化潜力,并提出DP-Cache和V-AEFusion方法提升性能。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24348 2026-04-28 cs.CL

OS-SPEAR: A Toolkit for the Safety, Performance,Efficiency, and Robustness Analysis of OS Agents

OS-SPEAR:一个用于操作系统代理安全、性能、效率和鲁棒性分析的工具包

Zheng Wu, Yi Hua, Zhaoyuan Huang, Chenhao Xue, Yijie Lu, Pengzhou Cheng, Zongru Wu, Lingzhong Dong, Gongshen Liu, Xinghao Jiang, Zhuosheng Zhang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)

AI总结 OS-SPEAR通过四个维度系统分析操作系统代理,解决现有评估方法在安全、效率和多模态鲁棒性方面的不足,揭示代理在效率与安全之间的权衡及不同模态的鲁棒性差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06542 2026-04-28 cs.LG cs.DC cs.MA stat.ML

On the Surprising Effectiveness of a Single Global Merging in Decentralized Learning

在去中心化学习中单一全局融合的惊人效果

Tongtian Zhu, Tianyu Zhang, Mingze Wang, Zhanpeng Zhou, Can Wang

机构 * Zhejiang University(浙江大学) Mila, Quebec AI Institute(魁北克AI研究院) Université de Montréal(蒙特利尔大学) Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文研究了去中心化学习中通信调度策略,发现集中通信预算在后期阶段可显著提升测试性能,通过单一全局融合实现完全连接,有效提升高数据异质性下的学习性能。

Comments We discover and theoretically explain why and when a single global parameter merging in decentralized learning can recover the performance of federated learning, even in highly heterogeneous and communication-constrained environments

Journal ref ICLR 2026 (Oral Presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24053 2026-04-28 cs.CV

Light 'em Up: Enabling Few-Shot Low-Light 3D Gaussian Splatting with Multi-Scale Explicit Retinex Illumination Decoupling

点亮它们:通过多尺度显式Retinex照明解耦实现少样本低光3D高斯点溅射

YuHao Yin, Zongji Wang, Yuanben Zhang, Biqing Li, Jiesong Bai, Junyi Liu

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航空航天信息研究所) Key Laboratory of Target Cognition and Application Technology (TCAT)(目标认知与应用技术重点实验室) University of Chinese Academy of Sciences(中国科学院大学) School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出MERID-GS框架,通过多尺度显式Retinex照明解耦和3D高斯点溅射,实现低光环境下少样本高质量360度视图合成,同时提升跨场景泛化能力与视图一致性。

Comments 19 pages, 5 figures. Code available at https://github.com/YhuoyuH/MERID-GS

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24001 2026-04-28 cs.AI

CT-FineBench: A Diagnostic Fidelity Benchmark for Fine-Grained Evaluation of CT Report Generation

CT-FineBench:用于CT报告生成细粒度评估的诊断可信度基准

Ruifeng Yuan, Wanxing Chang, Weiwei Cao, Bowen Shi, Zhongyu Wei, Ling Zhang, Jianpeng Zhang

机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) Hupan Lab(沪幻实验室) Fudan University(复旦大学) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 CT-FineBench通过基于问题回答的流程构建,评估CT报告的细粒度事实一致性,优于传统指标,能更敏感地捕捉临床细节错误。

Comments Accepted by ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23813 2026-04-28 cs.CV cs.CL

ShredBench: Evaluating the Semantic Reasoning Capabilities of Multimodal LLMs in Document Reconstruction

ShredBench:评估多模态大语言模型在文档重建中的语义推理能力

Zichun Guo, Yuling Shi, Wenhao Zeng, Chao Hu, Haotian Lin, Terry Yue Zhuo, Jiawei Chen, Xiaodong Gu, Wenping Ma

机构 * Xidian University(西安电子科技大学) Shanghai Jiao Tong University(上海交通大学) Alibaba Qwen(阿里巴巴量子计算实验室) Old Dominion University(旧 Dominion 大学)

AI总结 本文提出ShredBench基准,用于评估多模态大语言模型在文档重建任务中的语义推理能力,发现现有模型在处理破碎文档时存在显著性能差距。

Comments ACL 2026 Findings. Code available at https://github.com/ythere-y/ShredBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23717 2026-04-28 cs.SD cs.CL

HeadRouter: Dynamic Head-Weight Routing for Task-Adaptive Audio Token Pruning in Large Audio Language Models

HeadRouter: 任务自适应音频标记压缩中的动态头部权重路由

Peize He, Yaodi Luo, Xiaoqian Liu, Xuyang Liu, Jiahang Deng, Yaosong Du, Bangyu Li, Xiyan Gui, Yuxuan Chen, Linfeng Zhang

机构 * EPIC Lab, Shanghai Jiao Tong University(上海交通大学EPIC实验室) DAIL Tech(DAIL科技) Northeastern University(东北大学) Sichuan University(四川大学) Huazhong University of Science and Technology(华中科技大学)

AI总结 HeadRouter通过动态评估不同音频任务中注意力头的重要性,实现高效的音频标记压缩,实验表明其在多个基准上均取得最佳压缩效果。

Comments Homepage: https://dabdans.github.io/HeadRouter/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23678 2026-04-28 cs.AI

Transferable Human Mobility Network Reconstruction with neuroGravity

基于neuroGravity的人类移动网络重构

Jinming Yang, Shaoyu Huang, Zongyuan Huang, Yaohui Jin, Xiaokang Yang, Marta C. Gonzalez, Yanyan Xu

机构 * MoE Key Laboratory of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University, Shanghai 200240, China(人工智能编译实验室,人工智能研究院,上海交通大学,上海 200240,中国) Data-Driven Management Decision Making Lab, Shanghai Jiao Tong University, Shanghai 200240, China(数据驱动管理决策实验室,上海交通大学,上海 200240,中国) Department of City and Regional Planning, University of California, Berkeley, CA 94720, USA(城市与区域规划系,加州大学伯克利分校,CA 94720,美国) Energy Technologies Area, Lawrence Berkeley National Laboratory, Berkeley, CA 94720, USA(能源技术领域,劳伦斯伯克利国家实验室,伯克利,CA 94720,美国) Department of Civil and Environmental Engineering, University of California, Berkeley, CA 94720, USA(土木与环境工程系,加州大学伯克利分校,CA 94720,美国)

AI总结 本文提出neuroGravity模型,通过城市设施和人口分布数据重构移动网络,揭示空间收入 segregation 对模型迁移的重要性,为资源有限地区提供低成本的移动流量代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23641 2026-04-28 cs.CV

VDLF-Net: Variational Feature Fusion for Adaptive and Few-Shot Visual Learning

VDLF-Net:变分特征融合用于自适应和少样本视觉学习

Jiawei Yan

机构 * Department of Statistics, Shanghai Jiao Tong University(上海交通大学统计系)

AI总结 VDLF-Net通过在多尺度CNN主干上添加紧凑的变分自编码器,结合潜在向量和softmax门控实现自适应和少样本视觉学习,实验显示其在CIFAR-100和Mini-ImageNet上优于多种基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19234 2026-04-28 cs.CV

Learning to Credit the Right Steps: Objective-aware Process Optimization for Visual Generation

学习正确的步骤:面向视觉生成的客观感知过程优化

Rui Li, Ke Hao, Yuanzhi Liang, Haibin Huang, Chi Zhang, Yun Gu, XueLong Li

机构 * University of Science and Technology of China(科学技术大学) Shanghai Jiao Tong University(交通大学)

AI总结 本文提出OTCA框架,通过细粒度奖励分配提升视觉生成质量,解决传统GRPO在奖励分配上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11831 2026-04-28 cs.CV

Towards High-Fidelity CAD Generation via LLM-Driven Program Generation and Text-Based B-Rep Primitive Grounding

通过LLM驱动的程序生成和基于文本的B-Rep基础构建实现高保真的CAD生成

Jiahao Li, Qingwang Zhang, Qiuyu Chen, Guozhan Qiu, Yunzhong Lou, Xiangdong Zhou

机构 * Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出FutureCAD框架,利用LLM和BRepGround变压器生成高保真的CAD模型,通过自然语言指定几何选择并训练数据集提升生成性能。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19906 2026-04-28 cs.AR cs.AI cs.LG

GTAC: A Generative Transformer for Approximate Circuits

GTAC:一种用于近似电路的生成式变压器

Jingxin Wang, Shitong Guo, Wenhui Liang, Ruicheng Dai, Ruogu Ding, Xin Ning, Weikang Qian

机构 * Global College, Shanghai Jiao Tong University, Shanghai, China(上海交通大学全球学院)

AI总结 本文提出GTAC,一种端到端的生成式近似逻辑综合框架,通过生成核心和不可约编码提升电路设计效率,实现延迟和门数的显著降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14635 2026-04-28 cs.CL cs.PL cs.SE

SWE-QA: Can Language Models Answer Repository-level Code Questions?

SWE-QA: 语言模型能否回答仓库级代码问题?

Weihan Peng, Yuling Shi, Yuhang Wang, Xinyun Zhang, Beijun Shen, Xiaodong Gu

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出SWE-QA基准,旨在研究自动化QA系统在真实代码环境中的能力,包含576个高质量问题对,涵盖意图理解、跨文件推理和多跳依赖分析,评估六种先进LLM在不同上下文增强策略下的表现。

Comments Accepted to ACL 2026 Findings. Code and data available at https://github.com/peng-weihan/SWE-QA-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21107 2026-04-28 cs.LG q-bio.MN

Doloris: Dual Conditional Diffusion Implicit Bridges with Sparsity Masking Strategy for Unpaired Single-Cell Perturbation Estimation

Doloris:双条件扩散隐式桥梁与稀疏掩码策略用于无配对单细胞扰动估计

Changxi Chi, Jun Xia, Yufei Huang, Zhuoli Ouyang, Cheng Tan, Yunfan Liu, Jingbo Zhou, Chang Yu, Liangyu Yuan, Siyuan Li, Zelin Zang, Stan Z. Li

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Centre for Artificial Intelligence and Robotics Hong Kong Institute of Science & Innovation, Chinese Academy of Sciences(人工智能与机器人中心 香港创新研究院 中国科学院) Southern University of Science and Technology(南方科技大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出Doloris模型,通过双条件扩散模型和稀疏掩码策略解决无配对单细胞扰动数据建模问题,有效捕捉单细胞扰动多样性并取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23392 2026-04-28 cs.AI

SoccerRef-Agents: Multi-Agent System for Automated Soccer Refereeing

SoccerRef-Agents: 多智能体系统用于自动足球裁判

Zi Meng, Wanli Song, Yi Hu, Jiayuan Rao, Gang Chen

机构 * University of Michigan(密歇根大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出SoccerRef-Agents多智能体系统,通过构建多模态基准和知识库,提升足球裁判决策的准确性和可解释性。

Comments 26 pages, 8 figures. Submitted to ISACE 2026. Github Repo: https://github.com/yjlog/SoccerRef-Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23249 2026-04-28 cs.RO

BridgeACT: Bridging Human Demonstrations to Robot Actions via Unified Tool-Target Affordances

BridgeACT: 通过统一的工具-目标可及性桥接人类示范与机器人动作

Yifan Han, Jianxiang Liu, Haoyu Zhang, Yuqi Gu, Yunhan Guo, Wenzhao Lian

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

AI总结 BridgeACT通过统一的工具-目标可及性表示,直接从人类视频学习机器人操作,无需机器人示范数据,有效提升真实世界执行能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23231 2026-04-28 cs.CR cs.AI

Toward Polymorphic Backdoor against Semantic Communication via Intensity-Based Poisoning

面向语义通信的多态后门攻击:基于强度的污染

Xiao Yang, Yuni Lai, Gaolei Li, Jun Wu, Kai Zhou, Jianhua Li, Mingzhe Chen

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Shanghai Key Laboratory of Integrated Administration Technologies for Information Security(上海信息安全集成管理技术重点实验室) Department of Computing, Hong Kong Polytechnic University(香港理工大学计算机系) Department of Electrical and Computer Engineering and Frost Institute for Data Science and Computing, University of Miami(迈阿密大学电子与计算机工程系及弗罗斯特数据科学与计算研究所)

AI总结 本文提出SemBugger,一种多态语义通信后门,通过动态调整触发强度实现对系统知识的精细控制,以生成多样化的恶意结果。同时提出可证明鲁棒性的防御机制,有效抵御同类攻击。

Comments This paper has been accepted by IEEE TIFS

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22905 2026-04-28 eess.IV cs.AI cs.CV

CT-Guided Spatially-varying Regularization for Voxel-Wise Deformable Whole-Body PET Registration

基于CT的局部变化正则化用于全身体积PET变形注册

Xiangcen Wu, Ruohua Chen, Sichun Li, Qianye Yang, Sheng Liu, Jianjun Liu, Zhaoheng Xie

机构 * Institute of Medical Technology, Peking University Health Science Center(北京大学医学部医学技术研究所) Ren Ji Hospital, Shanghai Jiao Tong University(上海交通大学仁济医院) University of Oxford(牛津大学)

AI总结 本文提出基于CT的局部变化正则化方法,用于全身体积PET变形注册,通过CT体积构建voxel级正则化图,提高全身体积注册精度和器官对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22885 2026-04-28 cs.CV cs.AI

Federated Cross-Modal Retrieval with Missing Modalities via Semantic Routing and Adapter Personalization

联邦跨模态检索与缺失模态的语义路由和适配器个性化

Hefeng Zhou, Xuan Liu, Sicheng Chen, Wutong Zhang, Wu Yan, Jiong Lou, Chentao Wu, Guangtao Xue, Wei Zhao, Jie Li

机构 * Institute for Clarity in Documentation(清晰文档研究所) Inria Paris-Rocquencourt(巴黎-鲁克桑克鲁特研究所) Rajiv Gandhi University(拉吉夫·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕尔默研究实验室) Shanghai Jiao Tong University(上海交通大学) Hohai University(河海大学) Shaanghai Jiao Tong University(上海交通大学)

AI总结 本文提出RCSR框架,通过语义路由和适配器个性化解决联邦跨模态检索中异构数据和缺失模态的问题,提升全局检索准确性和训练稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22868 2026-04-28 cs.CV cs.AI

Probing Visual Planning in Image Editing Models

探测图像编辑模型中的视觉规划

Zhimu Zhou, Yanpeng Zhao, Qiuyu Liao, Bo Zhao, Xiaojian Ma

机构 * Shanghai Jiao Tong University(上海交通大学) Renmin University of China(中国人民大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI)

AI总结 本文提出EAR框架,通过抽象谜题和生成数据集AMAZE,评估图像编辑模型的视觉规划能力,发现模型在零样本设置下表现不佳,但微调后能有效泛化。

Comments Accepted to ES-Reasoning Workshop @ ICLR 2026. Our code is available at https://github.com/spatigen/amaze

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07990 2026-04-28 cs.CV

SceneScribe-1M: A Large-Scale Video Dataset with Comprehensive Geometric and Semantic Annotations

SceneScribe-1M:一个具有全面几何和语义标注的大规模视频数据集

Yunnan Wang, Kecheng Zheng, Jianyuan Wang, Minghao Chen, David Novotny, Christian Rupprecht, Yinghao Xu, Xing Zhu, Wenjun Zeng, Xin Jin, Yujun Shen

机构 * Shanghai Jiao Tong University(上海交通大学) Ant Group(蚂蚁集团) Visual Geometry Group, University of Oxford(牛津大学视觉几何组) Ningbo Institute of Digital Twin, Eastern Institute of Technology, Ningbo(宁波数字孪生研究院,东部技术研究院,宁波) Zhejiang Key Laboratory of Industrial Intelligence and Digital Twin(浙江工业智能与数字孪生重点实验室)

AI总结 SceneScribe-1M通过提供一个包含一百万真实视频的数据集,支持3D几何感知与视频合成的统一资源,推动了单目深度估计、场景重建等下游任务及文本到视频合成等生成任务的发展。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04204 2026-04-28 cs.CY cs.AI cs.CL cs.HC cs.MA

TeachMaster: Generative Teaching via Code

TeachMaster: 通过代码生成教学内容

Yuheng Wang, Runde Yang, Lin Wu, Jie Zhang, Jingru Fan, Tianle Zhou, Ruoyu Fu, Huatao Li, Ruijie Shi, Siheng Chen, Weinan E, Chen Qian

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

AI总结 本文提出Generative Teaching paradigm,通过多智能体框架TeachMaster实现教学内容的自动化生成,提升生产效率并降低教育视频制作成本。

Comments Accepted to ACL 2026; https://www.teachmaster.cn/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21275 2026-04-28 cs.DC cs.AI

InfiniPipe: Elastic Pipeline Parallelism for Efficient Variable-Length Long-Context LLM Training

InfiniPipe:弹性流水线并行用于高效可变长度长上下文LLM训练

Shiju Wang, Yujie Wang, Ao Sun, Fangcheng Fu, Zijian Zhu, Bin Cui, Xu Han, Kaisheng Ma

机构 * Tsinghua University(清华大学) Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Beijing University of Posts and Telecommunications(北京邮电大学)

AI总结 本文提出弹性流水线并行和阶段感知切片级自适应检查点,以应对资源和工作负载异质性,实验证明InfiniPipe比现有系统快1.69倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02548 2026-04-28 cs.LG cs.AI

Planning Under Observation Mismatch for Traffic Signal Control via Adaptive Modular World Models

基于观测不匹配的交通信号控制的适应性模块化世界模型规划

Zherui Huang, Yicheng Liu, Chumeng Liang, Guanjie Zheng

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出适应性模块化模型,用于解决观测不匹配下的交通信号控制问题,通过模块化规划架构提升性能和数据效率。

Comments Accepted by ICAPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.00978 2026-04-28 cs.CL

AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration

AWQ:基于激活的权重量化用于LLM压缩与加速

Ji Lin, Jiaming Tang, Haotian Tang, Shang Yang, Wei-Ming Chen, Wei-Chen Wang, Guangxuan Xiao, Xingyu Dang, Chuang Gan, Song Han

机构 * MIT(麻省理工学院) Shanghai Jiao Tong University(上海交通大学) NVIDIA(英伟达) Tsinghua University(清华大学) UMass Amherst(马萨诸塞大学阿姆赫斯特分校)

AI总结 本文提出AWQ方法,通过识别重要权重通道减少量化误差,实现低比特权重量化,提升LLM的压缩与加速性能,并在多个基准测试中表现优异。

Comments MLSys 2024 Best Paper Award. Code available at: https://github.com/mit-han-lab/llm-awq

详情

展开后加载摘要…

URL PDF HTML 收藏