arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

Shanghai Jiao Tong University(上海交通大学)

2026-03-17 至 2026-03-17 共收录 16
2603.15594 2026-03-17 cs.AI cs.CL

OpenSeeker: Democratizing Frontier Search Agents by Fully Open-Sourcing Training Data

OpenSeeker:通过完全开源训练数据民主化前沿搜索代理

Yuwen Du, Rui Ye, Shuo Tang, Xinyu Zhu, Yijun Lu, Yuzhu Cai, Siheng Chen

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 OpenSeeker通过两项技术创新实现前沿性能,利用开源数据提升搜索代理能力,实验表明其在多个基准测试中表现优异,超越现有开源和工业竞争对手。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15558 2026-03-17 cs.CV cs.RO

Panoramic Affordance Prediction

全景 affordance 预测

Zixin Zhang, Chenfei Liao, Hongfei Zhang, Harold Haodong Chen, Kanghao Chen, Zichen Wen, Litao Guo, Bin Ren, Xu Zheng, Yinchuan Li, Xuming Hu, Nicu Sebe, Ying-Cong Chen

机构 * HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学) SJTU(上海交通大学) MBZUAI(慕尼黑工业大学人工智能研究所) UniTrento(特伦特大学) Knowin

AI总结 本文提出全景 affordance 预测,利用 360 度影像捕捉全局空间关系,通过 PAP-12K 数据集和 PAP 框架解决超高清影像的高分辨率和畸变问题,展现全景感知在具身智能中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15478 2026-03-17 cs.CV

ViFeEdit: A Video-Free Tuner of Your Video Diffusion Transformer

ViFeEdit:一种无需视频的视频扩散变换器调谐器

Ruonan Yu, Zhenxiong Tan, Zigeng Chen, Songhua Liu, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出ViFeEdit框架,通过2D图像实现视频生成与编辑,无需视频训练数据,采用架构重参数化解耦空间独立性与全3D注意力,实现高质量视频编辑与生成。

Comments Working in progress, code is at https://github.com/Lexie-YU/ViFeEdit

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15280 2026-03-17 cs.AI

Advancing Multimodal Agent Reasoning with Long-Term Neuro-Symbolic Memory

通过长期神经符号记忆推进多模态代理推理

Rongjie Jiang, Jianwei Wang, Gengda Zhao, Chengyang Luo, Kai Wang, Wenjie Zhang

机构 * University of New South Wales(新南威尔士大学) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出NS-Mem框架,结合神经记忆与符号结构,提升多模态代理的推理能力,实验证明其在推理准确率上优于纯神经记忆系统。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15271 2026-03-17 cs.CV

Flash-Unified: A Training-Free and Task-Aware Acceleration Framework for Native Unified Models

Flash-Unified: 一种无需训练且任务感知的加速框架用于原生统一模型

Junlong Ke, Zichen Wen, Boxue Yang, Yantai Yang, Xuyang Liu, Chenfei Liao, Zhaorun Chen, Shaobo Wang, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室) Sichuan University(四川大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Chicago(芝加哥大学)

AI总结 本文提出FlashU框架,通过任务感知的网络剪枝和动态层跳过,减少统一模型的计算冗余,提升生成和理解任务的推理速度,实验表明在Show-o2数据集上加速1.78至2.01倍,保持SOTA性能。

Comments Accepted by CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15084 2026-03-17 cs.RO

HALO:Closing Sim-to-Real Gap for Heavy-loaded Humanoid Agile Motion Skills via Differentiable Simulation

HALO:通过可微模拟缩小重载人形机器人敏捷运动技能的仿真到现实差距

Xingyi Wang, Chenyun Zhang, Weiji Xie, Chao Yu, Wei Song, Chenjia Bai, Shiqiang Zhu

机构 * Zhejiang University(浙江大学) Institute of Artificial Intelligence (TeleAI)(人工智能研究所(TeleAI)) Shanghai Jiao Tong University(上海交通大学) Lumos Robotics(Lumos机器人)

AI总结 本文提出一种两阶段梯度基于系统辨识框架,通过可微模拟器MuJoCo XLA减少仿真到现实的不匹配,提升重载条件下人形机器人的运动跟踪精度和敏捷性。

Comments 9 pages, 5 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14916 2026-03-17 cs.CV cs.MM

EditHF-1M: A Million-Scale Rich Human Preference Feedback for Image Editing

EditHF-1M: 一个百万级的丰富人类偏好反馈用于图像编辑

Zitong Xu, Huiyu Duan, Zhongpeng Ji, Xinyun Zhang, Yutao Liu, Xiongkuo Min, Ke Gu, Jian Zhang, Shusong Xu, Jinwei Chen, Bo Li, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Vivo Mobile Communication Co., Ltd(vivo移动通信有限公司) University of Electronic and Science Technology of China(电子科技大学) Ocean University of China(海洋大学) Beijing University of Technology(北京理工大学)

AI总结 本文提出EditHF-1M百万级图像编辑数据集及基于其的EditHF评估模型和EditHF-Reward奖励模型,通过强化学习优化文本引导图像编辑模型,实验表明其在对齐人类偏好和泛化能力方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14909 2026-03-17 cs.CV

TopoVST: Toward Topology-fidelitous Vessel Skeleton Tracking

TopoVST:迈向拓扑忠实的血管骨架跟踪

Yaoyu Liu, Minghui Zhang, Junjun He, Yun Gu

机构 * Institute of Medical Robotics, Shanghai Jiao Tong University(上海交通大学医学机器人研究所) School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院) Shanghai AI Lab(上海人工智能实验室)

AI总结 本文提出TopoVST,通过多尺度球图和图神经网络实现血管骨架跟踪,结合门控特征融合和几何感知加权方案,有效解决拓扑忠实性和类别不平衡问题,实验表明其在重叠和拓扑指标上表现优异。

Comments 10 pages, 9 figures. Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14860 2026-03-17 cs.CR cs.AI

Architecture-Agnostic Feature Synergy for Universal Defense Against Heterogeneous Generative Threats

面向异质生成威胁的通用特征协同架构

Bingxue Zhang, Yang Gao, Feida Zhu, Yanyan Shen, Yang Shi

机构 * University of Shanghai for Science and Technology(上海理工大学) Singapore Management University(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出ATFS框架,通过目标引导图像实现多模型防御的统一特征空间对齐,有效解决异质生成威胁下的防御问题,实验显示其在扩散模型+GAN场景中达到SOTA性能。

Comments 9 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14822 2026-03-17 cs.CV

RadarXFormer: Robust Object Detection via Cross-Dimension Fusion of 4D Radar Spectra and Images for Autonomous Driving

RadarXFormer: 通过4D雷达光谱与图像的跨维度融合实现稳健的目标检测用于自动驾驶

Yue Sun, Yeqiang Qian, Zhe Wang, Tianhui Li, Chunxiang Wang, Ming Yang

机构 * Global Institute of Future Technology, Shanghai Jiao Tong University(上海交通大学未来技术全球研究院) School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院) Key Laboratory of System Control and Information Processing, Ministry of Education of China(中国教育部系统控制与信息处理重点实验室) SAIC GM Wuling Automobile Company Co., Ltd.(上汽通用五菱汽车有限公司) Guangxi Laboratory of New Energy Automobile(广西新能源汽车实验室)

AI总结 本文提出RadarXFormer框架,通过融合4D雷达光谱与RGB图像的跨维度信息,提升自动驾驶中的目标检测鲁棒性和准确性,同时保持实时推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14818 2026-03-17 cs.SE cs.AI cs.LG

SimCert: Probabilistic Certification for Behavioral Similarity in Deep Neural Network Compression

SimCert: 深度神经网络压缩中的行为相似性概率认证

Jingyang Li, Fu Song, Guoqiang Li

机构 * Shanghai Jiao Tong University(上海交通大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

AI总结 本文提出SimCert框架,通过双网络符号传播方法和方差感知边界技术,实现压缩神经网络的行为相似性验证,提供可调节置信水平的安全保证,实验表明其优于现有方法。

Comments 26 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13414 2026-03-17 cs.SE cs.AI

Neuro-Symbolic Generation and Validation of Memory-Aware Formal Function Specifications

神经符号生成与验证内存感知的形式函数规范

Liao Zhang, Tong Chen, Xiwei Wu, Qi Liu, Xiyu Zhai, Xinqi Wang, Qinxiang Cao

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Shanghai Innovation Institute(上海创新研究院) School of Computer Science and Engineering, University of Washington(华盛顿大学计算机科学与工程学院)

AI总结 本文提出神经符号框架,通过自然语言描述和函数签名生成内存感知的形式函数规范,结合符号证明器和验证工具链迭代优化,提升形式规范的正确性与语法有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13399 2026-03-17 cs.CV

FlowAD: Ego-Scene Interactive Modeling for Autonomous Driving

FlowAD: 无人驾驶中的自体场景交互建模

Mingzhe Guo, Yixiang Yang, Chuanrong Han, Rufeng Zhang, Shirui Li, Ji Wan, Zhipeng Zhang

机构 * AutoLab, School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院AutoLab) Baidu Inc(百度公司)

AI总结 本文提出FlowAD框架,通过自体场景交互建模提升自动驾驶性能,利用场景流建模动态变化,结合新颖的FCP指标评估场景理解能力,实验表明其在碰撞率和驾驶评分上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13364 2026-03-17 cs.CV cs.AI

FineRMoE: Dimension Expansion for Finer-Grained Expert with Its Upcycling Approach

FineRMoE:细粒度专家的维度扩展及其再利用方法

Ning Liao, Xiaoxing Wang, Xiaohan Qin, Junchi Yan

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 FineRMoE通过扩展中间和输出维度提升专家专业化,引入双层稀疏计算和专用路由机制,并采用再利用方法降低训练成本,实验证明其在多个基准上的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01050 2026-03-17 cs.CV cs.AI cs.GR

EgoGrasp: World-Space Hand-Object Interaction Estimation from Egocentric Videos

EgoGrasp:从第一人称视频中估计世界空间手-物体交互

Hongming Fu, Wenjia Wang, Xiaozhen Qiao, Rolandos Alexandros Potamias, Taku Komura, Shuo Yang, Zheng Liu, Bo Zhao

机构 * Shanghai Jiao Tong University(上海交通大学) The University of Hong Kong(香港大学) University of Science and Technology of China(中国科学技术大学) Imperial College London(伦敦帝国学院) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

AI总结 EgoGrasp提出了一种从动态第一人称视频中重建世界空间手-物体交互的方法,支持开放词汇物体,通过多阶段框架实现鲁棒的3D重建与姿态估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16234 2026-03-17 cs.CV

ARMFlow: AutoRegressive MeanFlow for Online 3D Human Reaction Generation

ARMFlow:用于在线3D人体反应生成的自回归MeanFlow

Zichen Geng, Zeeshan Hayder, Wei Liu, Hesheng Wang, Ajmal Mian

机构 * The University of Western Australia(西澳大学) Commonwealth Scientific and Industrial Research Organisation (CSIRO)(澳大利亚联邦科学与工业研究组织) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出ARMFlow框架,通过自回归方法解决在线3D人体反应生成中的高运动保真度、实时推理和自回归适应性问题,引入BSCE减少误差积累,实现高效准确的生成。

详情

展开后加载摘要…

URL PDF HTML 收藏