arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Shanghai Jiao Tong University(上海交通大学)

2026-08-26 至 2026-08-26 共收录 17
2608.24882 2026-08-26 cs.RO 新提交

Latent Action as Intention Enables Efficient Future Imagination for World Action Models

作为意图的隐式动作:为世界动作模型实现高效的未来想象

Xiang Li, Yupeng Zheng, Songen Gu, Huailiang Ma, Feng Yu, Xian Nie, Shanshuai Yuan, Yujie Zang, Weize Li, Shuai Tian, Moyang Liu, Ya-Qin Zhang, Wenchao Ding

机构 * CollegeAI, THU(清华大学CollegeAI) AIR, THU(清华大学AIR) CASIA(中国科学院自动化研究所) TARS Robotics(TARS机器人公司) FDU(复旦大学) Southeast University(东南大学) SJTU(上海交通大学) NUS(新加坡国立大学) BUAA(北京航空航天大学)

AI总结 本文提出名为 LAWA 的 WAM 架构,以紧凑隐式动作作为未来意图实现高效未来想象,在 RoboCasa 等数据集上优于 Fast-WAM,延迟更低且性能更优,兼顾性能、泛化性与延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24724 2026-08-26 cs.RO 新提交

Fiber Bragg Grating Whiskers for Bioinspired Hydrodynamic Perception on Underwater Robots

用于水下机器人生物启发式流体动力感知的光纤布拉格光栅触须

Hao Li, Tianyu Tu, Siyue Yao, Ziyang Chang, Juhyun Jung, Xiaochi Xie, Long Yin Chung, Tian-Ao Ren, Genliang Chen, Mark Cutkosky

机构 * Stanford University(斯坦福大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

AI总结 受港海豹触须流体感知能力启发,研发光纤布拉格光栅触须并验证其可辅助水下机器人仅通过触须信号区分直行与转弯,正确率达85%,为水下机器人流体感知提供新方案。

Comments 13 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24714 2026-08-26 cs.RO 新提交

GaussianWAM: Distilling Geometry and Semantics from 3D Gaussian Fields into World-Action Models

GaussianWAM:将三维高斯场的几何与语义知识蒸馏至世界-动作模型

Zijian Zhang, Yuqing Jiang, Weitao Zhou, Minglei Li, Jinhao Zhang, Yao Mu, Xiaofan Li, Hao Zhao, Haibao Yu

机构 * Tuojing Intelligence(拓境智能) University of Chinese Academy of Sciences(中国科学院大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Tsinghua University(清华大学) Simple AI(简智人工智能) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) The University of Hong Kong(香港大学)

AI总结 GaussianWAM是训练时的表征增强框架,通过三维高斯场蒸馏几何与语义监督,在LIBERO-Plus等任务上显著提升了WAM类模型的机器人操作性能,且不改变部署架构。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24544 2026-08-26 cs.CV 新提交

KLTNet: Learning Sparse Feature Tracking for Robust and Accurate Monocular Visual-Inertial Odometry

KLTNet:学习用于鲁棒且准确的单目视觉-惯性里程计的稀疏特征跟踪

Renbiao Jin, Danping Zou, Wenxian Yu

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 该研究提出轻量型学习型稀疏特征跟踪器KLTNet,替换传统KLT跟踪器,结合由粗到精架构与各向同性置信度权重,在多数据集实验中提升了VIO系统的跟踪与里程计精度,且保持实时性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24291 2026-08-26 cs.AI cs.SE 新提交

ReproAgent: Contract-Guided Paper-to-Code Reproduction

ReproAgent:基于合约引导的论文到代码复现

Xue Hu, Zewei Pan, Zhongyuan Wang, Zhou Liu, Zeli Su, Wentao Zhang

机构 * Beihang University(北京航空航天大学) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) Minzu University of China(中央民族大学) Zhongguancun Academy(中关村科学院)

AI总结 ReproAgent是基于合约引导的四阶段论文到代码复现流水线,在PaperBench Code-Dev基准上,其在两种骨干模型的同架构支架中取得最高平均得分,相关产物已公开。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24252 2026-08-26 cs.AI cs.SE 新提交

SA-Bench: Evaluating Semantic Alignment in LLM-Based Paper Reproduction

SA-Bench:评估基于大语言模型的论文复现中的语义对齐

Xue Hu, Zewei Pan, Zeli Su, Zhou Liu, Wentao Zhang

机构 * Beihang University(北京航空航天大学) Shanghai Jiao Tong University(上海交通大学) Minzu University of China(中央民族大学) Peking University(北京大学) Zhongguancun Academy(中关村科学院)

AI总结 本研究推出SA-Bench基准,评估LLM复现论文时的语义对齐,发现现有模型复现准确率低,需优化脚手架以提升语义规范验证能力。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24212 2026-08-26 cs.CV 新提交

NeoWorld-Pro: Programming Interactive Scenes from Monocular Images for Embodied Simulation

NeoWorld-Pro:从单目图像编程交互式场景以实现具身仿真

Yumeng He, Yichen Song, Xiaotian Yang, Weijia Zhang, Zanwei Zhou, Junru Gong, Xiaokang Yang, Yunbo Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Huazhong University of Science and Technology(华中科技大学)

AI总结 针对具身AI中图像转仿真场景的物理与交互性不足问题,提出NeoWorld-Pro框架,通过MLLMs将单目图像转为可执行程序,结合物理在环机制优化,性能优于现有方法并支持复杂下游任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24015 2026-08-26 cs.AI 新提交

Reflection with Action-Induced Visual Differences for Desktop GUI Agents

面向桌面GUI智能体的、基于动作诱导视觉差异的反思机制

Yijie Ma, Chaoyue Niu, Fan Wu, Guihai Chen

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 针对POR框架下GUI智能体反思器的决策依据薄弱问题,提出EFR两阶段反思器,解耦视觉差异提取与结果验证,在两个基准上提升了反思器准确率与端到端任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23984 2026-08-26 cs.CV 新提交

Source-Face Authenticity Detection for 3D Gaussian Heads Reconstructed from a Single Portrait: A Benchmark and Dedicated Detector

基于单张肖像重建的3D高斯头部的源人脸真实性检测:基准与专用检测器

Yujie Gao, Zijian Yu, Yan Hong, Jun Lan, Jianfu Zhang

机构 * Shanghai Jiaotong University(上海交通大学) Ant Group(蚂蚁集团)

AI总结 针对单张肖像重建的3D高斯头部的源人脸真实性检测问题,构建首个大规模基准并发现现有检测器的局限,提出两阶段训练的专用检测器,在所有指标上实现最高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23921 2026-08-26 cs.CV 新提交

HAP: Head-Adaptive Visual Token Pruning via Cross-Modal Alignment

HAP:基于跨模态对齐的头部自适应视觉Token剪枝

Yuanhao Sun, Huawei Ji, Yuan Jin, Cheng Deng, Luoyi Fu, Xinbing Wang

机构 * Shanghai Jiao Tong University(上海交通大学) University of Edinburgh(爱丁堡大学)

AI总结 该研究针对视觉-语言模型预填充成本过高的问题,提出基于PAQ指标的头部自适应视觉Token剪枝方法,在18个基准上实现最优权衡,在LLaVA-1.5-7B上仅保留5.6% Token即可维持99.1%的原始性能,优于基线AutoPrune。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23104 2026-08-26 cs.CL cs.AI 版本更新

Molecular LLM Agents: From Architectural Design to Scientific Autonomy

分子大语言模型智能体:从架构设计到科学自主性

Jiatong Li, Wengyu Zhang, Weida Wang, Yuxuan Ren, Wei Liu, Chenyang Mao, Yuqiang Li, Yatao Bian, Changmeng Zheng, Xiaoyong Wei, Qing Li

机构 * The Hong Kong Polytechnic University(香港理工大学) Shanghai AI Lab(上海人工智能实验室) National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 该研究提出分子LLM智能体的概念框架,从架构设计和科学自主性阶梯两方面展开,为分子领域LLM智能体的比较、设计评估及部署提供指导。

Comments 25pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04469 2026-08-26 cs.CL 版本更新

Don't Commit Alone: Joint Token Commitment in Diffusion Language Models

不要单独提交:扩散大语言模型中的联合令牌提交

Lin Yao

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院) Zhongguancun Academy(中关村科学城)

AI总结 研究扩散大语言模型中多令牌提交问题,提出CoCommit方法,通过标记门控协调步骤延迟提交,重新应用骨干网络最后n层使标记位置协调,近似联合模式解码,提高推理和精确答案任务准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18532 2026-08-26 cs.CV cs.AI cs.RO 版本更新

VLANeXt: Recipes for Building Strong VLA Models

VLANeXt: 构建强大VLA模型的配方

Xiao-Ming Wu, Bin Fan, Kang Liao, Jian-Jian Jiang, Runze Yang, Yihang Luo, Zhonghua Wu, Wei-Shi Zheng, Chen Change Loy

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) SenseTime Research(商汤科技研究院) Sun Yat-sen University(中山大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文通过统一框架和评估设置重新审视VLA设计空间,系统分析了基础组件、感知要素和动作建模视角,总结出12项关键发现,提出了一种简单有效的VLA模型VLANeXt,并在LIBERO和LIBERO-plus基准测试中超越了现有方法,同时提供了易于使用的代码库。

Comments Accepted in ICML 2026, Project Page: this https URL (https://dravenalg.github.io/VLANeXt/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10426 2026-08-26 cs.CV cs.AI 版本更新

CoWorld-VLA: Thinking in a Multi-Expert World Model for Autonomous Driving

CoWorld-VLA:面向自动驾驶的多专家世界模型中的思考

Minqing Huang, Yujiao Xiang, Zihan Liang, Jiajie Huang, Jingqi Wang, Yuheng Zhou, Zhi Xu, Feiyang Tan, Hangning Zhou, Mu Yang, Gong Che

机构 * Afari Intelligent Drive(Afari智能驾驶公司) University of Electronic Science and Technology of China(电子科技大学) Shanghai Jiao Tong University(上海交通大学) Beijing University Of Posts and Telecommunications(北京邮电大学) Tianjin University(天津大学)

AI总结 本文提出CoWorld-VLA,通过多专家世界推理框架,利用显式条件指导动作规划,提升自动驾驶的场景生成与路径规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10863 2026-08-26 cs.LG cs.AI 版本更新

ICA: Information-Aware Credit Assignment for Visually Grounded Long-Horizon Information-Seeking Agents

ICA: 信息感知的信用分配用于基于视觉的长周期信息寻求智能体

Cong Pang, Xuyu Feng, Yujie Yi, Jiaqi Su, Zixuan Chen, Jiawei Hong, Tiankuo Yao, Nang Yuan, Jiapeng Luo, Lewei Lu, Xin Lou

机构 * Shanghai Jiao Tong University(上海交通大学) ShanghaiTech University(上海科技大学) Wuhan University(武汉大学) SenseTime Research(商汤科技研究院)

AI总结 本文提出ICA方法,通过视觉快照和信息层面信用分配,提升开放网络环境中信息寻求智能体的性能。

Comments Accepted to the Main Conference of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17027 2026-08-26 cs.CV cs.AI 版本更新

Scientific Image Synthesis: Benchmarking, Methodologies, and Downstream Utility

科学图像合成:基准测试、方法论与下游应用

Honglin Lin, Zheng Liu, Chonghan Qin, Qizhi Pei, Yu Li, Zhanping Zhong, Xin Gao, Yanfeng Wang, Conghui He, Lijun Wu

机构 * Shanghai Jiao Tong University(上海交通大学) OpenDataLab, Shanghai Artificial Intelligence Laboratory(OpenDataLab,上海人工智能实验室) The University of Hong Kong(香港大学) Peking University(北京大学)

AI总结 本文提出ImgCoder框架和SciGenBench基准,通过逻辑驱动方法提升科学图像生成的结构精度,并展示微调LMMs在科学图像上的效果,验证了高保真合成在多模态推理中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12006 2026-08-26 eess.IV cs.CV 版本更新

crossMoDA Challenge: Evolution of Cross-Modality Domain Adaptation Techniques for Vestibular Schwannoma and Cochlea Segmentation from 2021 to 2023

crossMoDA挑战赛:2021至2023年前庭神经鞘瘤与耳蜗分割的跨模态域自适应技术演进

Navodini Wijethilake, Reuben Dorent, Marina Ivory, Aaron Kujawa, Stefan Cornelissen, Patrick Langenhuizen, Mohamed Okasha, Anna Oviedova, Hexin Dong, Bogyeong Kang, Guillaume Sallé, Luyi Han, Ziyuan Zhao, Han Liu, Yubo Fan, Tao Yang, Shahad Hardan, Hussain Alasmawi, Santosh Sanjeev, Yuzhou Zhuang, Satoshi Kondo, Maria Baldeon Calisto, Shaikh Muhammad Uzair Noman, Cancan Chen, Ipek Oguz, Rongguo Zhang, Mina Rezaei, Susana K. Lai-Yuen, Satoshi Kasai, Yunzhi Huang, Chih-Cheng Hung, Mohammad Yaqub, Lisheng Wang, Benoit M. Dawant, Cuntai Guan, Ritse Mann, Vincent Jaouen, Tae-Eui Kam, Li Zhang, Jonathan Shapey, Tom Vercauteren

机构 * School of BMEIS, King's College London, London, United Kingdom(伦敦国王学院生物医学工程与信息科学学院) Harvard University, USA(哈佛大学) Elisabeth-TweeSteden Hospital, Tilburg, Netherlands(蒂尔堡埃利斯贝特-特维德登医院) King's College Hospital, London, United Kingdom(伦敦国王学院医院) Center for Data Science, Peking University, Beijing, China(北京大学数据科学中心) Center for Data Science in Health and Medicine, Peking University, Beijing, China(北京大学健康与医学数据科学中心) Department of Artificial Intelligence, Korea University, Seoul, Republic of Korea(韩国大学人工智能系) Department of Radiology and Nuclear Medicine, Radboud University Medical Center, Geert Grooteplein 10, 6525 GA, Nijmegen, The Netherlands(拉德堡德大学医学中心放射科与核医学科) Department of Radiology, The Netherlands Cancer Institute, Plesmanlaan 121, 1066 CX, Amsterdam, The Netherlands(荷兰癌症研究所放射科) Nanyang Technological University, Singapore(南洋理工大学) Vanderbilt University, USA(范德比尔特大学) Department of Automation, Shanghai Jiao Tong University, Shanghai, China(上海交通大学自动化系) Mohamed bin Zayed University of Artificial Intelligence, Abu Dhabi, UAE(阿布扎克穆罕默德·本·扎耶德人工智能大学) School of Computer Science and Technology, Huazhong University of Science and Technology, Wuhan, China(华中科技大学计算机科学与技术学院) Center for Machine Vision and Security Research, Kennesaw State University, Marietta, MA 30060, USA(肯尼斯州立大学机器视觉与安全研究中心) Muroran Institute of Technology, Hokkaido, Japan(北海道Muroran理工学院) Niigata University of Health and Welfare, Niigata, Japan(Niigata健康与福利大学) University of South Florida, Tampa, FL, USA(佛罗里达州立大学) Infervision Advanced Research Institute, Beijing, China(北京Infervision高级研究 institutes) Academy for Multidisciplinary Studies, Capital Normal University, Beijing, China(北京师范大学多学科研究学院) School of Automation, Nanjing University of Information Science and Technology, Nanjing 210044, China(南京信息科学技术大学自动化学院)

AI总结 该研究回顾2021-2023年crossMoDA挑战赛,分析跨模态域自适应技术在VS与耳蜗分割任务中的演进,发现数据规模与异构性提升可改善分割性能,但耳蜗Dice评分2023年下降,提示需更具挑战性的跨模态任务。

详情

展开后加载摘要…

URL PDF HTML 收藏