arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Shanghai Jiao Tong University(上海交通大学)

2026-08-26 至 2026-08-26 共收录 10
2608.24882 2026-08-26 cs.RO 新提交

Latent Action as Intention Enables Efficient Future Imagination for World Action Models

作为意图的隐式动作:为世界动作模型实现高效的未来想象

Xiang Li, Yupeng Zheng, Songen Gu, Huailiang Ma, Feng Yu, Xian Nie, Shanshuai Yuan, Yujie Zang, Weize Li, Shuai Tian, Moyang Liu, Ya-Qin Zhang, Wenchao Ding

机构 * CollegeAI, THU(清华大学CollegeAI) AIR, THU(清华大学AIR) CASIA(中国科学院自动化研究所) TARS Robotics(TARS机器人公司) FDU(复旦大学) Southeast University(东南大学) SJTU(上海交通大学) NUS(新加坡国立大学) BUAA(北京航空航天大学)

AI总结 本文提出名为 LAWA 的 WAM 架构,以紧凑隐式动作作为未来意图实现高效未来想象,在 RoboCasa 等数据集上优于 Fast-WAM,延迟更低且性能更优,兼顾性能、泛化性与延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24724 2026-08-26 cs.RO 新提交

Fiber Bragg Grating Whiskers for Bioinspired Hydrodynamic Perception on Underwater Robots

用于水下机器人生物启发式流体动力感知的光纤布拉格光栅触须

Hao Li, Tianyu Tu, Siyue Yao, Ziyang Chang, Juhyun Jung, Xiaochi Xie, Long Yin Chung, Tian-Ao Ren, Genliang Chen, Mark Cutkosky

机构 * Stanford University(斯坦福大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

AI总结 受港海豹触须流体感知能力启发,研发光纤布拉格光栅触须并验证其可辅助水下机器人仅通过触须信号区分直行与转弯,正确率达85%,为水下机器人流体感知提供新方案。

Comments 13 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24714 2026-08-26 cs.RO 新提交

GaussianWAM: Distilling Geometry and Semantics from 3D Gaussian Fields into World-Action Models

GaussianWAM:将三维高斯场的几何与语义知识蒸馏至世界-动作模型

Zijian Zhang, Yuqing Jiang, Weitao Zhou, Minglei Li, Jinhao Zhang, Yao Mu, Xiaofan Li, Hao Zhao, Haibao Yu

机构 * Tuojing Intelligence(拓境智能) University of Chinese Academy of Sciences(中国科学院大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Tsinghua University(清华大学) Simple AI(简智人工智能) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) The University of Hong Kong(香港大学)

AI总结 GaussianWAM是训练时的表征增强框架,通过三维高斯场蒸馏几何与语义监督,在LIBERO-Plus等任务上显著提升了WAM类模型的机器人操作性能,且不改变部署架构。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24544 2026-08-26 cs.CV 新提交

KLTNet: Learning Sparse Feature Tracking for Robust and Accurate Monocular Visual-Inertial Odometry

KLTNet:学习用于鲁棒且准确的单目视觉-惯性里程计的稀疏特征跟踪

Renbiao Jin, Danping Zou, Wenxian Yu

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 该研究提出轻量型学习型稀疏特征跟踪器KLTNet,替换传统KLT跟踪器,结合由粗到精架构与各向同性置信度权重,在多数据集实验中提升了VIO系统的跟踪与里程计精度,且保持实时性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24291 2026-08-26 cs.AI cs.SE 新提交

ReproAgent: Contract-Guided Paper-to-Code Reproduction

ReproAgent:基于合约引导的论文到代码复现

Xue Hu, Zewei Pan, Zhongyuan Wang, Zhou Liu, Zeli Su, Wentao Zhang

机构 * Beihang University(北京航空航天大学) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) Minzu University of China(中央民族大学) Zhongguancun Academy(中关村科学院)

AI总结 ReproAgent是基于合约引导的四阶段论文到代码复现流水线,在PaperBench Code-Dev基准上,其在两种骨干模型的同架构支架中取得最高平均得分,相关产物已公开。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24252 2026-08-26 cs.AI cs.SE 新提交

SA-Bench: Evaluating Semantic Alignment in LLM-Based Paper Reproduction

SA-Bench:评估基于大语言模型的论文复现中的语义对齐

Xue Hu, Zewei Pan, Zeli Su, Zhou Liu, Wentao Zhang

机构 * Beihang University(北京航空航天大学) Shanghai Jiao Tong University(上海交通大学) Minzu University of China(中央民族大学) Peking University(北京大学) Zhongguancun Academy(中关村科学院)

AI总结 本研究推出SA-Bench基准,评估LLM复现论文时的语义对齐,发现现有模型复现准确率低,需优化脚手架以提升语义规范验证能力。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24212 2026-08-26 cs.CV 新提交

NeoWorld-Pro: Programming Interactive Scenes from Monocular Images for Embodied Simulation

NeoWorld-Pro:从单目图像编程交互式场景以实现具身仿真

Yumeng He, Yichen Song, Xiaotian Yang, Weijia Zhang, Zanwei Zhou, Junru Gong, Xiaokang Yang, Yunbo Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Huazhong University of Science and Technology(华中科技大学)

AI总结 针对具身AI中图像转仿真场景的物理与交互性不足问题,提出NeoWorld-Pro框架,通过MLLMs将单目图像转为可执行程序,结合物理在环机制优化,性能优于现有方法并支持复杂下游任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24015 2026-08-26 cs.AI 新提交

Reflection with Action-Induced Visual Differences for Desktop GUI Agents

面向桌面GUI智能体的、基于动作诱导视觉差异的反思机制

Yijie Ma, Chaoyue Niu, Fan Wu, Guihai Chen

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 针对POR框架下GUI智能体反思器的决策依据薄弱问题,提出EFR两阶段反思器,解耦视觉差异提取与结果验证,在两个基准上提升了反思器准确率与端到端任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23984 2026-08-26 cs.CV 新提交

Source-Face Authenticity Detection for 3D Gaussian Heads Reconstructed from a Single Portrait: A Benchmark and Dedicated Detector

基于单张肖像重建的3D高斯头部的源人脸真实性检测:基准与专用检测器

Yujie Gao, Zijian Yu, Yan Hong, Jun Lan, Jianfu Zhang

机构 * Shanghai Jiaotong University(上海交通大学) Ant Group(蚂蚁集团)

AI总结 针对单张肖像重建的3D高斯头部的源人脸真实性检测问题,构建首个大规模基准并发现现有检测器的局限,提出两阶段训练的专用检测器,在所有指标上实现最高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23921 2026-08-26 cs.CV 新提交

HAP: Head-Adaptive Visual Token Pruning via Cross-Modal Alignment

HAP:基于跨模态对齐的头部自适应视觉Token剪枝

Yuanhao Sun, Huawei Ji, Yuan Jin, Cheng Deng, Luoyi Fu, Xinbing Wang

机构 * Shanghai Jiao Tong University(上海交通大学) University of Edinburgh(爱丁堡大学)

AI总结 该研究针对视觉-语言模型预填充成本过高的问题,提出基于PAQ指标的头部自适应视觉Token剪枝方法,在18个基准上实现最优权衡,在LLaVA-1.5-7B上仅保留5.6% Token即可维持99.1%的原始性能,优于基线AutoPrune。

详情

展开后加载摘要…

URL PDF HTML 收藏