arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

Shanghai Jiao Tong University(上海交通大学)

2026-03-25 至 2026-03-25 共收录 14
2603.23481 2026-03-25 cs.RO cs.AI cs.CV cs.LG

VTAM: Video-Tactile-Action Models for Complex Physical Interaction Beyond VLAs

VTAM:用于复杂物理交互的视频-触觉-动作模型超越VLAs

Haoran Yuan, Weigang Yi, Zhenyu Zhang, Wendi Chen, Yuchen Mo, Jiashi Yin, Xinzhuo Li, Xiangyu Zeng, Chuan Wen, Cewu Lu, Katherine Driggs-Campbell, Ismini Lourentzou

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Stanford University(斯坦福大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 VTAM通过整合触觉感知提升复杂物理交互的稳定性,其多模态框架在接触密集任务中表现优异,成功率达到90%。

Comments https://plan-lab.github.io/projects/vtam/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23345 2026-03-25 cs.CV

FHAvatar: Fast and High-Fidelity Reconstruction of Face-and-Hair Composable 3D Head Avatar from Few Casual Captures

FHAvatar: 从少量随意捕获快速高效重建面部和头发可组合的3D头身虚拟角色

Yujie Sun, Zhuoqiang Cai, Chaoyue Niu, Jianchuan Chen, Zhiwen Chen, Chengfei Lv, Fan Wu

机构 * Alibaba Group(阿里巴巴集团) Shanghai Jiao Tong University(上海交通大学)

AI总结 FHAvatar提出一种新型框架,通过分离面部和头发表示,实现从任意数量视角高效重建3D高斯虚拟角色,支持实时动画和风格化编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23326 2026-03-25 cs.CV

ViBe: Ultra-High-Resolution Video Synthesis Born from Pure Images

ViBe:源自纯图像的超高清视频合成

Yunfeng Wu, Hongying Cheng, Zihao He, Songhua Liu

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Xi'an Jiaotong-Liverpool University(西安交通大学利物浦大学) Jilin University(吉林大学)

AI总结 本文提出纯图像适应框架,通过两阶段LoRA策略提升视频扩散模型生成超高清视频的能力,无需视频训练数据,在VBench基准上超越现有最佳模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22704 2026-03-25 cs.CL

Synthetic or Authentic? Building Mental Patient Simulators from Longitudinal Evidence

合成还是真实?从纵向证据构建心理健康患者模拟器

Baihan Li, Bingrui Jin, Kunyao Lan, Ming Wang, Mengyue Wu

机构 * SJTU Paris Elite Institute of Technology(上海交通大学巴黎精英理工学院) X-LANCE Lab(X-LANCE实验室) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) School of Computing and Information Systems, Singapore Management University(新加坡管理大学计算机与信息系统学院)

AI总结 本文提出DEPROFILE框架,通过整合多源数据构建统一患者档案,提升对话真实性和行为多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20644 2026-03-25 cs.CV

ScaleEdit-12M: Scaling Open-Source Image Editing Data Generation via Multi-Agent Framework

ScaleEdit-12M:通过多智能体框架实现开源图像编辑数据生成的规模化

Guanzhou Chen, Erfei Cui, Changyao Tian, Danni Yang, Ganlin Yang, Yu Qiao, Hongsheng Li, Gen Luo, Hongjie Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) CUHK MMLab(香港中文大学多模态实验室) Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学) Xiamen University(厦门大学)

AI总结 本文提出ScaleEditor框架,通过多智能体方法构建大规模高质量图像编辑数据集,生成ScaleEdit-12M,涵盖23类任务,提升多种编辑模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07533 2026-03-25 cs.RO cs.CV

ACCURATE: Arbitrary-shaped Continuum Reconstruction Under Robust Adaptive Two-view Estimation

ACCURATE:任意形状连续体的鲁棒自适应双视角估计下的精确重建

Yaozhi Zhang, Shun Yu, Yugang Zhang, Yang Liu

机构 * Global Institute of Future Technology, Shanghai Jiao Tong University(未来技术全球研究院,上海交通大学)

AI总结 本文提出ACCURATE框架,结合图像分割神经网络与几何约束拓扑遍历算法,实现对任意形状连续体的高精度重建,实验表明在模拟和真实数据集上均达到亚毫米精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18933 2026-03-25 cs.CV cs.RO

Point What You Mean: Visually Grounded Instruction Policy

指出你的意图:基于视觉的指令策略

Hang Yu, Juntu Zhao, Yufeng Liu, Kaiyu Li, Cheng Ma, Di Zhang, Yingdong Hu, Guang Chen, Junyuan Xie, Junliang Guo, Junqiao Zhao, Yang Gao

机构 * Tongji University(同济大学) Shanghai Jiao Tong University(上海交通大学) Spirit AI Tsinghua University(清华大学)

AI总结 本文提出Point-VLA,通过结合视觉提示提升物体指称能力,在复杂场景中实现更精准的视觉 grounding。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01248 2026-03-25 cs.CV

TRivia: Self-supervised Fine-tuning of Vision-Language Models for Table Recognition

TRivia: 基于视觉-语言模型的自监督微调用于表格识别

Junyuan Zhang, Bin Wang, Qintong Zhang, Fan Wu, Zichen Wen, Jialin Lu, Junjie Shan, Ziqi Zhao, Shuya Yang, Ziling Wang, Ziyang Miao, Huaping Zhong, Yuhang Zang, Xiaoyi Dong, Ka-Ho Chow, Conghui He

机构 * The University of Hong Kong(香港大学) Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学) Shanghai Jiaotong University(上海交通大学) Sensetime

AI总结 TRivia通过自监督微调方法,使预训练视觉-语言模型直接从未标注的表格图像中学习表格识别,无需人工标注,提升了表格识别性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03334 2026-03-25 cs.CV

UniAVGen: Unified Audio and Video Generation with Asymmetric Cross-Modal Interactions

UniAVGen:基于非对称跨模态交互的统一音频视频生成

Guozhen Zhang, Zixiang Zhou, Teng Hu, Ziqiao Peng, Youliang Zhang, Yi Chen, Yuan Zhou, Qinglin Lu, Limin Wang

机构 * State Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室) Tencent Hunyuan(腾讯文英) Shanghai Jiao Tong University(上海交通大学) Renmin University of China(中国人民大学) Tsinghua University(清华大学) Shanghai AI Lab(上海人工智能实验室)

AI总结 UniAVGen通过非对称跨模态交互机制和双分支联合合成架构,实现了音频视频的统一生成,提升同步精度和语义一致性,实验表明其在较少训练样本下表现更优。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15620 2026-03-25 cs.LG

On-device Semantic Selection Made Low Latency and Memory Efficient with Monolithic Forwarding

在设备上实现语义选择:通过单体转发实现低延迟和内存高效

Jiahao Zhou, Chengliang Lin, Dingji Li, Mingkai Dong, Haibo Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei(华为)

AI总结 本文提出PRISM系统,通过单体转发实现低延迟和内存高效的语义top-K选择,减少延迟和内存使用,提升设备AI应用的效率和部署性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00415 2026-03-25 cs.AI

Towards Self-Evolving Benchmarks: Synthesizing Agent Trajectories via Test-Time Exploration under Validate-by-Reproduce Paradigm

迈向自演化基准:通过验证-再生产范式下的测试时间探索合成代理轨迹

Dadi Guo, Tianyi Zhou, Dongrui Liu, Chen Qian, Qihan Ren, Shuai Shao, Zhiyuan Fan, Yi R. Fung, Kun Wang, Linfeng Zhang, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Hong Kong University of Science and Technology(香港科技大学) University of Michigan(密歇根大学) Renmin University of China(中国人民大学) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出TRACE框架,通过测试时间探索使代理在原有任务基础上自演化更复杂的任务,提升基准的动态性和可靠性,适应并改进了AIME-2024等推理数据集。

Comments This is a work in progress due to methodology refinement and further evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09424 2026-03-25 cs.RO

Exploring Pose-Guided Imitation Learning for Robotic Precise Insertion

探索基于姿态引导的模仿学习用于机器人精确插入

Han Sun, Sheng Liu, Yizhao Wang, Zhenning Zhou, Shuai Wang, Haibo Yang, Jingyuan Sun, Qixin Cao

机构 * School of Mechanical Engineering, Shanghai Jiao Tong University(上海交通大学机械工程学院) Karlsruhe Institute of Technology(卡尔斯鲁厄大学) Shanghai Huawei Technologies Co., Ltd.(上海华为技术有限公司)

AI总结 本文提出基于姿态引导的模仿学习方法,通过紧凑的对象中心观测实现精确插入任务,提升数据效率和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.16125 2026-03-25 cs.DC cs.LG

Arena: Efficiently Training Large Models via Dynamic Scheduling and Adaptive Parallelism Co-Design

Arena:通过动态调度和自适应并行性协同设计高效训练大模型

Chunyu Xue, Weihao Cui, Quan Chen, Chen Chen, Han Zhao, Shulai Zhang, Linmei Wang, Yan Li, Limin Xiao, Weifeng Zhang, Jing Yang, Bingsheng He, Minyi Guo

机构 * Shanghai Jiao Tong University(上海交通大学) Lenovo Research(联想研究院) Microsoft(微软公司) Guizhou University(贵州大学) National University of Singapore(新加坡国立大学)

AI总结 本文提出Arena系统,通过动态调度与自适应并行性协同设计,提升GPU集群效率,减少作业完成时间达49.3%,集群吞吐量提升1.6倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22304 2026-03-25 cs.LG

Mitigating Premature Discretization with Progressive Quantization for Robust Vector Tokenization

通过渐进量化缓解早期内离散化以实现鲁棒的向量标记化

Wenhao Zhao, Qiran Zou, Zhouhan Lin, Dianbo Liu

机构 * National University of Singapore, Singapore(新加坡国立大学) Shanghai Jiao Tong University, Shanghai, China(上海交通大学)

AI总结 本文提出渐进量化方法,通过引入量化难度动态作为VQ训练的关键维度,有效引导代码本向扩展良好的流形发展,提升了多模态模型的生成性能和生物序列建模能力。

详情

展开后加载摘要…

URL PDF HTML 收藏