arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Shanghai Jiao Tong University(上海交通大学)

2026-08-25 至 2026-08-25 共收录 23
2608.23493 2026-08-25 cs.AI 新提交

SRPO: Self-Reflective Policy Optimization for Long-Horizon Reasoning

SRPO:用于长程推理的自反思策略优化

Jialong Liu, Yuling Shi, Ning Yang, Xiaodong Gu, Zuchao Li

机构 * School of artificial intelligence, Wuhan University(武汉大学人工智能学院) School of computer science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院) Institute of automation, Chinese Academy of Sciences(中国科学院自动化研究所)

AI总结 本研究提出 SRPO 框架,将人类的自反思能力内化到 LLMs 中,无需额外模型即可将稀疏监督转化为密集训练信号,在数学推理等基准上以高数据效率取得了最先进性能。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23437 2026-08-25 cs.SD 新提交

AT-ADD: A Benchmark and Challenge for Robust and All-Type Audio Deepfake Detection

AT-ADD:面向鲁棒全类型音频深度伪造检测的基准与挑战赛

Yuankun Xie, Haonan Cheng, Jiayi Zhou, Xiaoxuan Guo, Tao Wang, Changhao Zhang, Jian Liu, Weiqiang Wang, Ruibo Fu, Xiaopeng Wang, Hengyan Huang, Xiaoying Huang, Long Ye, Guangtao Zhai

机构 * Communication University of China(中国传媒大学) Ant Group(蚂蚁集团) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing Institute of Technology(北京理工大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出AT-ADD基准与挑战赛,设双赛道分别评估鲁棒语音深度伪造检测与全类型音频深度伪造检测,官方基线及获胜系统取得对应性能,同时揭示泛化关键及未解决问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23313 2026-08-25 cs.AI 新提交

EviSafe: Evidence-Grounded Safety Evaluation for Vision-Language Models

EviSafe:基于证据的视觉语言模型安全性评估

Xuetong Li, Gaofeng Liu

机构 * Department of Automation, Shanghai Jiao Tong University(上海交通大学自动化系)

AI总结 本研究提出基于证据的VLM安全性评估框架EviSafe及对应基准EviSafeBench,通过三探针协议评估11个VLMs,发现其未因正确多模态原因可靠安全,需开展超越拒绝次数的评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23279 2026-08-25 cs.CV 新提交

Spatiotemporally Decoupled Autoregressive Diffusion Model for Human Motion Generation

用于人体动作生成的时空解耦自回归扩散模型

Chengqun Yang, Liang Xu, Yanping Li, Fulong Liu, Jingnan Gao, Weili Zeng, Yichao Yan

机构 * AI Institute, Shanghai Jiao Tong University(上海交通大学AI学院)

AI总结 本文提出名为DeMoDiff的时空解耦框架,通过针对每个身体关节编码的时空VAE与融入时空掩码和注意力的自回归扩散生成器,在HumanML3D和KIT-ML数据集上取得最优重构性能与动作生成效果,且具备强时空编辑能力。

Comments Accepted by ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23268 2026-08-25 cs.CV 新提交

Dual-Grained Agent Memory and Shapley Context Attribution for Multimodal Agentic Learner

面向多模态智能体学习者的双粒度智能体记忆与Shapley上下文归因

Jieke Wang, Tiancheng Shen, Yibo Yang, Ming-Hsuan Yang

机构 * UC Merced(加州大学默塞德分校) Shanghai Jiao Tong University(上海交通大学)

AI总结 针对多模态大模型推理不足的问题,提出双粒度智能体记忆框架DG-Mem,结合Shapley上下文归因,在多个数学多模态推理数据集上实现性能提升,且无需参数更新即可适配各类骨干模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23104 2026-08-25 cs.CL cs.AI 新提交

Molecular LLM Agents: From Architectural Design to Scientific Autonomy

分子大语言模型智能体:从架构设计到科学自主性

Jiatong Li, Wengyu Zhang, Weida Wang, Yuxuan Ren, Wei Liu, Chenyang Mao, Yuqiang Li, Yatao Bian, Changmeng Zheng, Xiaoyong Wei, Qing Li

机构 * The Hong Kong Polytechnic University(香港理工大学) Shanghai AI Lab(上海人工智能实验室) National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 该研究提出分子LLM智能体的概念框架,从架构设计和科学自主性阶梯两方面展开,为分子领域LLM智能体的比较、设计评估及部署提供指导。

Comments 25pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23100 2026-08-25 cs.RO cs.AI 新提交

Shaping the Evolutionary Dynamics of Robot Morphology via Adaptive Control Learning

通过自适应控制学习塑造机器人形态的进化动力学

Junru Song, Yang Yang, Yaqing Xu, Ying Wen, Wei Peng, Guozhen Li, Wei'en Zhou, Wen Yao

机构 * Shanghai Jiao Tong University(上海交通大学) Intelligent Game and Decision Laboratory(智能游戏与决策实验室) Renmin University of China(中国人民大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 本文针对机器人协同设计中控制学习反向塑造形态进化的未解决问题,提出AdaControl方法,通过监测无偏适应度评估减少计算量,使简单遗传算法性能媲美先进方法且计算量降80%

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22996 2026-08-25 cs.CV 新提交

ENCORE: Entropy-Guided Cropping and Attention Regularization for Robust Vision--Language Understanding

ENCORE:面向鲁棒视觉-语言理解的熵引导裁剪与注意力正则化方法

Yuanhao Sun, Huawei Ji, Jiaxin Ding, Luoyi Fu, Xinbing Wang

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 ENCORE是一个熵引导的视觉-语言理解框架,通过基于熵的裁剪策略和熵正则化训练,仅微调0.14%参数,在10个VQA基准上实现平均1.43%的准确率提升,达到2B参数VLMs的SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22956 2026-08-25 cs.CL 新提交

The Illusion of Control: Why Bare Classifier Inversion Silently Fails in Concept-Bottleneck Text Generation

控制的错觉:为什么单纯的分类器反演在概念瓶颈文本生成中会悄然失效

Qi Bing, Xiaowei Shao

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 该研究针对概念瓶颈文本生成,发现单纯分类器反演因生成流形外代码而失效,其性能逊于简单事后先验,还验证了该问题诊断并实现与基线的公平对比。

Comments Accepted to EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22906 2026-08-25 cs.CV 新提交

AquaFlow: A Monocular Gaussian Splatting SLAM for Underwater Streaming Reconstruction

AquaFlow:用于水下流式重建的单目高斯溅射SLAM

Yingxiang Xu, Kerui Ren, Wenqi Guo, Changjian Jiang, Tao Lu, Linning Xu, Mulin Yu

机构 * Zhejiang University(浙江大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 针对水下场景视觉退化导致的SLAM难题,提出AquaFlow框架,通过微调3D视觉基础模型等技术实现更优的水下重建,在62条水下轨迹数据集上相较WaterSplat-SLAM性能显著提升。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22874 2026-08-25 cs.LG cs.CV 新提交

Stochastic Separability of Embedding Manifolds

嵌入流形的随机可分性

Liqing Zhang

机构 * School of Computer Science(计算机学院) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文针对两类对象嵌入流形,提出并证明了随机可分性定理,通过投影测度集中分析技术,揭示了对象嵌入流形的几何与统计特性,为深度网络表示学习提供新机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22849 2026-08-25 cs.LG q-bio.GN 新提交

RIBOSPAN: A Long-Context RNA Foundation Model for Versatile RNA Modeling

RIBOSPAN:用于多功能RNA建模的长上下文RNA基础模型

Ziyuan Wang, Bohao Tang, Fei Zhang, Shuo Han, Pengfei Liu

机构 * Shanghai Innovation Institute(上海创新研究院) Center for Excellence in Molecular Cell Science, CAS(中国科学院分子细胞科学卓越创新中心) University of Chinese Academy of Sciences(中国科学院大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本研究提出支持10240nt上下文的长RNA基础模型RIBOSPAN,结合多种技术实现高分辨率长RNA建模,在多任务评估中达最优性能,并开发基于其主干的mRNA生成与优化框架。

Comments 21 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22800 2026-08-25 cs.RO cs.AI 新提交

Triplet2Track: A Hierarchical System with Object-Centric Representations for Reliable Long-Horizon Manipulation

Triplet2Track:一种基于以对象为中心表征的可靠长 horizon 操作分层系统

Jianxiang Liu, Gaojing Zhang, Chuan Wen, Qipeng Liu, Yuxuan Zhao, Ning Guo, Wenzhao Lian

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) School of Engineering and Informatics, University of Sussex(萨塞克斯大学工程与信息学院)

AI总结 针对长 horizon 机器人操作可靠性难题,提出 Triplet-to-Track System(TTS),该闭环模仿学习系统用人类视频减少数据依赖,经实验平均成功率达74.8%,支持对象级与组合泛化。

Comments 8 pages, 6 figures. Accepted for presentation at the 2026 IEEE International Conference on Systems, Man, and Cybernetics (SMC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22795 2026-08-25 cs.CV 新提交

VersaDB: A High-Performance AI Storage Database for Unifying Mutimodal Datasets

VersaDB:用于统一多模态数据集的高性能AI存储数据库

Cong Wang, Zelin Liu, Yang Luo Ran Zhang, Zhijian Guo, Hui Zhang, Fan Yu, Yanfei Cao, Naijie Gu, Jun Yu

机构 * University of Science and Technology of China(中国科学技术大学) Huawei(华为) South China University of Technology(华南理工大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 该研究针对多模态AI数据集处理速度不足的问题,推出专为AI数据集设计的VersaDB,通过页式存储、B+树索引等技术实现高效数据处理,可最高5.35倍加速且并行度适配性好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22740 2026-08-25 cs.CV 新提交

Seeing the Unseen: Semantic-in-Gaussian for Sparse-View 3D Generalization

看见不可见:用于稀疏视图三维泛化的高斯语义嵌入方法

Zeyang Bai, Yunpeng Wang, Yunbiao Wang, Jun Xiao

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Global Institute of Future Technology, Shanghai Jiao Tong University(上海交通大学全球未来技术研究院)

AI总结 本文提出新型通用三维高斯溅射框架SeeU,通过跨视图熵感知模块与条件高斯变换器优化高斯估计,在稀疏视图场景下提升新视图合成的渲染质量与结构完整性,外推设置下PSNR较SOTA方法提升2.44 dB。

Comments Accepted at the ECCV 2026 Workshop on 3DWM

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22725 2026-08-25 cs.AI 新提交

SEAM: Shot Entity-Attribute Memory for Consistent Short-Drama Generation at Scale

SEAM:用于大规模一致短剧生成的镜头实体-属性记忆

Jiaqi Liu, Maolin Ran, Xiaoyang Lu, Jian Wang, Weiwen Liu, Jianghao Lin, Yong Yu, Weinan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) CreativeFitting

AI总结 针对大规模短剧生成的视觉连续性瓶颈,提出无训练的SEAM记忆图,在SEAM-Bench上提升连续性召回率,部署后获96.5%导演接受率。

Comments Preprint. 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22692 2026-08-25 cs.CV 新提交

Hybrid Generative-Discriminative Object Placement

混合生成-判别式物体放置

Siyuan Zhou, Li Niu

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 针对现有物体放置方法难以平衡效率与效果的问题,提出一种半生成式方法,通过在背景分配均匀锚点并融合特征预测得分与放置集合,在OPA数据集上实现了效率与效果的良好平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22419 2026-08-25 cs.RO cs.CV 新提交

Robust Bimanual Vision-Language-Action Models via Embarrassingly Simple Modality Masking

基于极其简单的模态掩码机制的鲁棒双臂视觉-语言-动作模型

Dongzhou Cheng, Ziang Li, Yixiao Zhou, Haojuan Li, Jinghao Zhang, Lei Lei, Minjing Dong, Jie Gui, Jiaqi Wang

机构 * Shanghai Innovation Institute(上海创新研究院) Wuhan University(武汉大学) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学) City University of Hong Kong(香港城市大学) Southeast University(东南大学)

AI总结 该研究针对双臂操作中查询式VLA模型的动作不连续问题,提出仅训练用的模态掩码机制(M3),在RoboTwin 2.0等任务上使平均成功率提升超11.4%至30%以上,有效增强了模型鲁棒性。

Comments 35 pages, 22 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22367 2026-08-25 cs.CL 新提交

Context-Aware Cluster Decoding: Semantic Anchor-Driven Coherence in dMLLMs

上下文感知集群解码:dMLLMs中的语义锚驱动连贯性

Yikai Zhao, Qiyan Zhao, Jiaquan Zhang, Xiaofeng Zhang, Xiaosong Yuan, Pengzhou Cheng

机构 * Sun Yat-sen University(中山大学) Shanghai Jiao Tong University(上海交通大学) University of Electronic Science and Technology of China(电子科技大学) Alibaba Group(阿里巴巴集团) Shanghai University(上海大学)

AI总结 针对 dMLLMs 生成长文本时的语义漂移与重复问题,提出上下文感知集群解码方法,结合置信度与邻域邻近度评分,在多模型多基准上实现质量提升并减少幻觉。

Comments This paper is accepted by EMNLP 2026. 19 pages, 12 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22217 2026-08-25 cs.CV 新提交

UR$^{2}$-MLLM: Uncertainty-aware Revisit Reasoning in Multimodal Large Language Models for Radiology Report Generation

UR²-MLLM:面向放射科报告生成的多模态大语言模型中基于不确定性感知的重访推理

Yucheng Chen, Yang Yu, Jiazhou Zhou, Yufei Shi, Yongying Lan, Yichi Zhang, Liyi Li, Si Yong Yeo

机构 * MedVisAI Lab(MedVisAI实验室) Lee Kong Chian School of Medicine, Nanyang Technological University(南洋理工大学李光前医学院) Centre of AI in Medicine, Singapore(新加坡医学人工智能中心) AI Thrust, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)AI方向) Ruijin Hospital, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属瑞金医院)

AI总结 该研究针对放射科报告生成任务,提出UR²-MLLM框架,通过动态重访不确定区域的机制实现最优性能,提升报告的可靠性与临床适配性。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21899 2026-08-25 cs.RO 新提交

CIDER: Continual Interactive Distillation for Embodied Reinforcement Learning

CIDER:面向具身强化学习的持续交互式蒸馏

Houlin Li, Minghui Xu, Guo Xu, Xuan Du, Xiaohan Yan, Chun Wang, Yuxiang Yan, Shukai Yang, Yongcheng Liu, Wei Shan, Maoqing Yao

机构 * AgiBot Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出CIDER框架,通过冻结历史策略为教师策略并引入梯度路由,解决具身强化学习的灾难性遗忘问题,在6个现实世界操作任务上实现了新技能获取与旧技能保留的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21839 2026-08-25 cs.CV 新提交

FIRM-Video: Check Before You Score for Reliable Text-to-Video Reward Modeling

FIRM-Video:可靠文本到视频奖励建模的评分前检查机制

Peiyuan Zhang, Xiangyu Zhao, Hongbo Liu, Xiaoxing Hu, Mingxin Liu, Shuran Ma, Yunhang Shen, Jian Hu, Haihan Gao, Haoyu Cao, Xue Yang

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent Youtu Lab(腾讯优图实验室) Tongji University(同济大学)

AI总结 本文提出基于“评分前检查”的FIRM-Video框架,构建相关数据集与基准,其衍生模型在文本到视频奖励建模相关任务上取得最优表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21710 2026-08-25 cs.CV 新提交

StereoDiffuer: Diffusion-based Progressive Geometry Modeling with Saliency Attention Perception for Stereo Matching

StereoDiffuer:基于扩散的显著性注意力感知渐进几何建模的立体匹配方法

Bohan Li

机构 * Shanghai Jiaotong University(上海交通大学) Ningbo Institute of Digital Twin, Eastern Institute of Technology(宁波东方理工大学数字孪生研究院)

AI总结 针对现有立体匹配方法难以保留细粒度几何细节的问题,提出基于扩散的StereoDiffuer框架,通过显著性注意力感知模块提取几何线索,结合迭代去噪扩散过程优化视差,在Scene Flow与KITTI基准上表现具竞争力。

Comments 17 pages, 9 figures, and 11 tables. Accepted by Signal Processing: Image Communication

详情

展开后加载摘要…

URL PDF HTML 收藏