arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

Shanghai Jiao Tong University(上海交通大学)

2026-03-09 至 2026-03-09 共收录 12
2603.06366 2026-03-09 cs.CV

OralGPT-Plus: Learning to Use Visual Tools via Reinforcement Learning for Panoramic X-ray Analysis

OralGPT-Plus:通过强化学习学习使用视觉工具进行全景X射线分析

Yuxuan Fan, Jing Hao, Hong Chen, Jiahao Bao, Yihua Shao, Yuci Liang, Kuo Feng Hung, Hao Tang

机构 * The Hong Kong University of Science and Technology (GZ)(香港科学与技术大学) Faculty of Dentistry, The University of Hong Kong(香港大学牙医学院) School of Computer Science, Peking University(北京大学计算机学院) Shanghai Jiao Tong University(上海交通大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院)

AI总结 OralGPT-Plus通过强化学习实现全景X射线分析中的交互式对称推理,提升诊断可靠性。

Comments 34 pages, 24 figures, conference

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06159 2026-03-09 cs.DB cs.IR cs.LG

Efficient Vector Search in the Wild: One Model for Multi-K Queries

野外高效的向量搜索:一个支持多K查询的模型

Yifan Peng, Jiafei Fan, Xingda Wei, Sijie Shen, Rong Chen, Jianning Wang, Xiaojian Luo, Wenyuan Yu, Jingren Zhou, Haibo Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Boston University(波士顿大学) Alibaba Group(阿里巴巴集团)

AI总结 OMEGA是一种支持多K查询的高效向量搜索模型,通过动态细化和统计特性优化,实现高精度、高性能和低预处理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06032 2026-03-09 cs.CV

StruVis: Enhancing Reasoning-based Text-to-Image Generation via Thinking with Structured Vision

StruVis: 通过结构化视觉进行推理的文本到图像生成增强

Yuanhuiyi Lyu, Kaiyu Lei, Ziqiao Weng, Xu Zheng, Lutao Jiang, Teng Li, Yangfu Li, Ziyuan Huang, Linfeng Zhang, Xuming Hu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Ant Group(蚂蚁集团) Shanghai Jiao Tong University(上海交通大学) Hong Kong University of Science and Technology(香港科技大学) East China Normal University(华东师范大学)

AI总结 StruVis通过结构化视觉引导推理,提升基于推理的文本到图像生成性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05935 2026-03-09 cs.RO

Swooper: Learning High-Speed Aerial Grasping With a Simple Gripper

Swooper: 一种简单抓取器的高速空中抓取学习

Ziken Huang, Xinze Niu, Bowen Chai, Renbiao Jin, Danping Zou

机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(自动化与智能感知学院,上海交通大学)

AI总结 Swooper通过深度强化学习实现高速空中抓取,使用轻量级神经网络策略在25次试验中达到84%的成功率和1.5m/s的抓取速度。

Journal ref IEEE Robotics and Automation Letters ( Volume: 11, Issue: 2, February 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05900 2026-03-09 cs.LG cs.AI

Reference-guided Policy Optimization for Molecular Optimization via LLM Reasoning

基于参考的策略优化用于分子优化 via LLM 推理

Xuan Li, Zhanke Zhou, Zongze Li, Jiangchao Yao, Yu Rong, Lu Zhang, Bo Han

机构 * Hong Kong Baptist University(香港 Baptist 大学) CMIC, Shanghai Jiao Tong University(CMIC,上海交通大学) DAMO Academy, Alibaba Group(DAMO 院,阿里巴巴集团) Hupan Lab(虎盘实验室)

AI总结 RePO通过结合强化学习和参考引导策略优化,在分子优化中提升探索与利用的平衡,优于SFT和RLVR方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05861 2026-03-09 cs.RO

DexEMG: Towards Dexterous Teleoperation System via EMG2Pose Generalization

DexEMG: 通过EMG2Pose泛化实现灵巧遥控系统

Qianyou Zhao, Wenqiao Li, Chiyu Wang, Kaifeng Zhang

机构 * Sharpa Shanghai Jiao Tong University(上海交通大学)

AI总结 DexEMG通过EMG2Pose泛化实现灵巧遥控系统,利用sEMG信号提升机器人手的高精度操控与环境适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05818 2026-03-09 cs.CL

RouteGoT: Node-Adaptive Routing for Cost-Efficient Graph of Thoughts Reasoning

RouteGoT: 用于图状思维推理的节点自适应路由

Yuhang Liu, Ruijie Wang, Yunlong Chu, Bing Hao, Yumeng Lin, Shengzhong Liu, Minglai Shao

机构 * School of New Media and Communication, Tianjin University(新媒体与传播学院,天津大学) School of Computer Science and Engineering, Beihang University(计算机科学与工程学院,北航) Shanghai Jiao Tong University(上海交通大学)

AI总结 RouteGoT通过节点自适应路由框架提升图状思维推理的效率与准确性,实现性能与成本的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05504 2026-03-09 cs.RO cs.AI cs.LG

RoboPocket: Improve Robot Policies Instantly with Your Phone

RoboPocket: 通过手机即时改进机器人策略

Junjie Fang, Wendi Chen, Han Xue, Fangyuan Zhou, Tian Le, Yi Wang, Yuting Zhang, Jun Lv, Chuan Wen, Cewu Lu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Noematrix Ltd.(诺姆矩阵有限公司)

AI总结 RoboPocket通过手机实现无需机器人即时策略迭代,提升数据与样本效率,克服传统方法的效率瓶颈。

Comments Project page: https://robo-pocket.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02872 2026-03-09 cs.CV

Think-as-You-See: Streaming Chain-of-Thought Reasoning for Large Vision-Language Models

Think-as-You-See: 为大视觉-语言模型设计的流式推理链式思维

Jialiang Zhang, Junlong Tong, Junyan Lin, Hao Wu, Yirong Sun, Yunpu Ma, Xiaoyu Shen

机构 * Institute of Digital Twin, Eastern Institute of Technology(数字孪生研究院,东技术学院) Ocean University of China(中国海洋大学) Shanghai Jiao Tong University(上海交通大学) The Hong Kong Polytechnic University(香港理工大学) Munich Center for Machine Learning, LMU Munich(慕尼黑机器学习中心,慕尼黑大学) Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative(宁波空间智能与数字衍生关键实验室)

AI总结 TaYS为大视觉-语言模型设计了流式推理链式思维框架,通过并行化生成、流约束训练和解耦的KV缓存,提升视频理解的效率和响应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01288 2026-03-09 cs.LG

EDIS: Diagnosing LLM Reasoning via Entropy Dynamics

EDIS: 通过熵动力学诊断LLM推理

Chenghua Zhu, Siyan Wu, Xiangkang Zeng, Zishan Xu, Zhaolu Kang, Yifu Guo, Yuquan Lu, Junduan Huang, Guojing Zhou

机构 * South China Normal University(华南师范大学) Sun Yat-sen University(中山大学) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学)

AI总结 EDIS通过分析LLM推理过程中的熵动态变化,识别错误推理的特征模式,提供有效的诊断信号以提升推理准确性。

Comments 16 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18663 2026-03-09 cs.CV

DVD-Quant: Data-free Video Diffusion Transformers Quantization

DVD-Quant: 数据无依赖的视频扩散变换器量化

Zhiteng Li, Hanxuan Li, Junyi Wu, Kai Liu, Haotong Qin, Linghe Kong, Guihai Chen, Yulun Zhang, Xiaokang Yang

机构 * Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) ETH Zürich(苏黎世联邦理工学院)

AI总结 DVD-Quant通过无数据量化框架实现视频DiT模型的高效量化,提升运行速度并保持视觉质量。

Comments Code and models will be available at https://github.com/lhxcs/DVD-Quant

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14273 2026-03-09 eess.AS cs.SD

Efficient Emotion and Speaker Adaptation in LLM-Based TTS via Characteristic-Specific Partial Fine-Tuning

基于特征特定部分微调的LLM语音合成中高效情感与说话人适应

Tianrui Wang, Meng Ge, Cheng Gong, Chunyu Qiang, Haoyu Wang, Zikang Huang, Yu Jiang, Ye Ni, Yuheng Lu, Xiaobao Wang, Engsiong Chng, Xie Chen, Longbiao Wang, Jianwu Dang

机构 * Tianjin Key Laboratory of Cognitive Computing and Application(天津认知计算与应用重点实验室) College of Intelligence and Computing(智能与计算学院) Tianjin University(天津大学) TeleAI, China Telecom(TeleAI,中国电信) Southeast University(东南大学) Shanghai Jiao Tong University(上海交通大学) Huiyan Technology Co., Ltd(慧言科技有限公司) Nanyang Technological University(南洋理工大学) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究所,中国科学院)

AI总结 本文提出CSP-FT方法,通过特征特定部分微调提升LLM语音合成在情感和说话人适应中的性能,实现参数更新效率与模型表现的平衡。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏