arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Shanghai Jiao Tong University(上海交通大学)

2026-08-27 至 2026-08-27 共收录 8
2608.25973 2026-08-27 cs.AI cs.LG 新提交

SciMIF: Understanding Multimodal Instruction Following in Scientific Domains

SciMIF:理解科学领域中的多模态指令遵循

Ye Shen, Yuting Zheng, Dun Pei, Zijian Chen, Wenlong Zhang, Qi Jia, Guangtao Zhai

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

AI总结 本研究提出用于评估多模态大语言模型科学指令遵循能力的SciMIF基准,揭示模型在科学领域性能差异及规模提升未对应改善约束遵循等问题,填补相关评估空白。

Comments 21pages, 9 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25917 2026-08-27 cs.AI cs.RO 新提交

Choose Your Game Wisely: Measuring Game-Theoretic Structures in Real-World Vehicle Interactions

明智选择博弈:测量现实世界车辆交互中的博弈论结构

Yueyuan Li, Rongcheng Nie, Weijie Xi, Mingyang Jiang, Songan Zhang, Hanyang Zhuang, Ming Yang

机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院) School of Airspace Science and Engineering, Shandong University(山东大学空天科学与工程学院) Global Institute of Future Technology, Shanghai Jiao Tong University(上海交通大学未来技术全球研究院) Global College, Shanghai Jiao Tong University(上海交通大学全球学院)

AI总结 本文开发了基于轨迹的交互测量框架,在六个现实世界车辆轨迹数据集上验证,发现现实车辆交互有并发、顺序等结构,不同博弈论模型是互补而非通用的建模抽象。

Comments 8 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25864 2026-08-27 cs.RO 新提交

MA-VLA: Multi-Arm Vision-Language-Action Model for Collaboration and Compositional Generalization

MA-VLA:用于协作与组合泛化的多臂视觉-语言-动作模型

Zaibin Zhang, Junlan Xiao, Zhongbo Zhang, Yifan Wang, Li Kang, Yiran Qin, Changxing Xia, Heng Zhou, Talas Fu, Enshen Zhou, Ruimao Zhang, Zhenfei Yin, Huchuan Lu, Lijun Wang

机构 * Dalian University of Technology(大连理工大学) University of Oxford(牛津大学) Sun Yat-sen University(中山大学) Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Beihang University(北京航空航天大学)

AI总结 MA-VLA通过将协作行为分解为原子提示并引入Arm Shuffle训练方法,解决了多臂VLA模型的协作泛化问题,在未见过的协作模式下表现优于现有模型。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25845 2026-08-27 cs.CV 新提交

THA-Flow Generative Model: Prosthesis Geometry Prediction from Preoperative CT

THA-Flow生成模型:基于术前CT的假体几何预测

Yiping Wang, Jie Li, Jingyu Shen, Liao Wang

机构 * Changzhou Jinse Medical Information Technology Co., Ltd.(常州金色医疗信息技术有限公司) Shanghai Ninth People’s Hospital, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属第九人民医院)

AI总结 本研究提出THA-Flow生成模型,通过AutoencoderKL和三维UNet从术前CT生成三维假体几何,在1355个髋关节数据上验证,实现了THA三维手术规划的生成式AI首次应用。

Comments 17 pages, 7 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25798 2026-08-27 cs.RO cs.LG 新提交

TacForcing: Streaming Action Generation with Execution-Time Tactile Feedback

TacForcing:结合执行时触觉反馈的流式动作生成

Jianbo Zhou, Boyuan Zhao, Yuzheng Zhang, Yiyang Chen, Wenxin Chen, Qiuyue Li, Xiangyang Gu, Yuhan Cao, Xiao Xia, Yanzhe Hu, Zhijie Deng

机构 * School of Computer Science, SJTU(上海交通大学计算机科学学院) SCUT(华南理工大学) ECUST(华东理工大学) ECNU(华东师范大学) PolyU(香港理工大学) CCUT(长春工业大学) UESTC(电子科技大学) HUST(华中科技大学)

AI总结 本文提出TacForcing框架,通过流式动作专家结合执行时触觉反馈,并引入EATA减少时间不匹配,在模拟和真实接触操纵任务中均优于基线方法。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25604 2026-08-27 cs.LG 新提交

Frequency-aware forecasting for short-term typhoon gust prediction

面向台风阵风短期预测的频率感知预测方法

Xuefei Wang, Tingyi Liu, Heng Zhang, Shengjun Zhang

机构 * School of Artificial Intelligence, Hubei University(湖北大学人工智能学院) School of Economics and Management, Wuhan University(武汉大学经济与管理学院) School of Electrical Engineering, Shanghai Jiao Tong University(上海交通大学电气工程学院)

AI总结 针对台风阵风短期预测难题,提出整合平稳小波分解等模块的WDANet框架,以西太平洋近海区域为对象验证,其在24小时预测时域的短提前期预测中精度优于ECMWF-HRES,可应用于海上风电等场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25529 2026-08-27 cs.CV 新提交

Video-IFBench: Evaluating Instruction Following of Multimodal LLMs in Video Understanding Scenarios

Video-IFBench:评估多模态大语言模型在视频理解场景中的指令遵循能力

Hongbo Liu, Peixian Chen, Sihan Liu, Peiyuan Zhang, Kai Zou, Dian Zheng, Xiaoxing Hu, Yuhao Dong, Mengdan Zhang, Yunhang Shen, Haoyu Cao, Wei Liu, Weibo Gu, Xing Sun, Shengjie Zhao

机构 * TJU(天津大学) Tencent Youtu Lab(腾讯优图实验室) SJTU(上海交通大学) Tencent Hunyuan(腾讯混元) CUHK(香港中文大学) NTU(南洋理工大学)

AI总结 本文推出Video-IFBench基准,构建含四类模板的指令分类体系与半自动数据 pipeline,评估20余种MLLMs的视频指令遵循能力,发现当前模型在复杂指令上仍具挑战,推动相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25472 2026-08-27 cs.CV physics.med-ph 新提交

PAGS: Autofocusing Photoacoustic Tomography via Speed-of-Sound-Adaptive Gaussian Splatting

PAGS:基于声速自适应高斯溅射的光声断层扫描自动聚焦

Jiarui Ge, Jintao Ma, Bangxu Fan, Jinyan Zhang, Xiaokang Yang, Shuai Na, Xiaoyun Yuan

机构 * Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) National Biomedical Imaging Center(国家生物医学成像中心) Academy for Advanced Interdisciplinary Studies, Peking University(北京大学前沿交叉学科研究院) PKU–Nanjing Institute of Translational Medicine(北京大学南京转化医学研究院)

AI总结 PAGS是基于声速自适应高斯溅射的可微分框架,无需声速先验,通过联合优化高斯光声源与声速场,提升了异质介质下光声断层扫描的重建清晰度与稀疏视图鲁棒性,且计算效率更高。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏