arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Xi'an Jiaotong University(西安交通大学)

共收录 770
2608.17995 2026-08-19 cs.CV 新提交

AViTS: Adaptive Spatiotemporal Token Selection for Efficient Dynamic-Resolution Generation

AViTS:用于高效动态分辨率生成的自适应时空令牌选择

Haoran Qin, Zhengan Yan, Shikang Zheng, Xiaobing Tu, Jiacheng Liu, Yuqi Lin, Chang Zou, JinShan Liu, Peiliang Cai, Xiantao Zhang, Jinkui Ren, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shandong University(山东大学) Terminal Intelligent Computing Division, Alibaba Cloud(阿里云终端智能计算事业部) Jilin University(吉林大学) Xi’an Jiaotong University(西安交通大学)

AI总结 该研究针对扩散变换器动态分辨率采样的冗余计算问题,提出AViTS框架,通过时空重要性感知的选择性上采样减少冗余,在FLUX等模型上实现显著加速且与其他优化技术兼容

Comments Accepted to ECCV 2026. 20 pages including appendix. Code: this https URL (https://github.com/QHR69/AViTS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17394 2026-08-19 cs.CV 新提交

Noisy group neurons with synchronous resetting for high-performance spiking neural networks

用于高性能脉冲神经网络的带同步重置的噪声组神经元

Yajie Zhai, Yanmei Kang, Meng Li, Zigang Huang

机构 * School of Mathematics and Statistics, Xi’an Jiaotong University(西安交通大学数学与统计学院) Center for Intersection of Mathematics and Life Sciences, Xi’an Jiaotong University(西安交通大学数学与生命科学交叉中心) School of Life Science and Technology, Xi’an Jiaotong University(西安交通大学生命科学与技术学院) Research Center for Brain-inspired Intelligence, Xi’an Jiaotong University(西安交通大学类脑智能研究中心)

AI总结 针对深度脉冲神经网络训练的时空信息丢失与梯度不匹配问题,提出带同步重置和神经随机性的噪声组神经元模型,结合平均场反向传播方法,在多数据集上验证其高性能,尤其在CIFAR10-DVS上10步推理达87.35%准确率,为神经形态计算提供实用方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17044 2026-08-19 cs.CV cs.AI 新提交

The 10th AI City Challenge

第10届AI City挑战赛

Zheng Tang, Shuo Wang, David C. Anastasiu, Ming-Ching Chang, Anuj Sharma, Quan Kong, Munkhjargal Gochoo, Jun-Wei Hsieh, Tomasz Kornuta, Zhedong Zheng, Renran Tian, Judah Goldfeder, Fulgencio Navarro, Yuxing Wang, Yizhou Wang, Sameer Satish Pusegaonkar, Anqi Li, Nalin Dadhich, Ridham Kachhadiya, Dhanishtha Patil, Haoquan Liang, Jiajun Li, Han Zhang, Yilin Zhao, Zaid Pervaiz Bhat, Shuyu Yang, Ashutosh Kumar, Rong Wang, Rafael Martin Nieto, Peter Christiansen, Ahmed Abduljawad, Mohanrasu Shanmugam, Nadeem Shaik, Sujit Biswas, Xunlei Wu, Vidya Murali, Rama Chellappa

机构 * Santa Clara University(圣克拉拉大学) University at Albany, SUNY(纽约州立大学奥尔巴尼分校) Iowa State University(爱荷华州立大学) Woven by Toyota(丰田编织公司) United Arab Emirates University(阿拉伯联合酋长国大学) National Yang Ming Chiao Tung University(国立阳明交通大学) University of Macau(澳门大学) North Carolina State University(北卡罗来纳州立大学) Columbia University(哥伦比亚大学) Milestone Systems(里程碑系统公司) Xi’an Jiaotong University(西安交通大学) Johns Hopkins University(约翰斯·霍普金斯大学)

AI总结 本文总结了与ECCV 2026同期举办的第10届AI City挑战赛的设置、数据集、评估结果等,该赛事规模扩大,设多类赛道,成功系统结合基础模型与多种技术。

Comments Summary of the 10th AI City Challenge Workshop in conjunction with ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16837 2026-08-18 cs.RO cs.AI 新提交

HAF: Adapting Generalist VLAs to Humanoid Whole-Body Loco-manipulation via Hierarchical Action Flow and Spectral Latent RL

HAF:通过分层动作流与谱潜在线性RL将通用VLAs适配至人形机器人全身运动操作

Langzhe Gu, Chengkai Hou, Meng Li, Xinhua Wang, Jiaming Liu, Xinyuan Lv, Bowei Zhang, Shuanghao Bai, Guangrun Li, Jingyang He, Gaole Dai, Ziluo Ding, Zhiyuan Xu, Kuan Cheng, Jian Tang, Zhengping Che, Shanghang Zhang

机构 * Xi’an Jiaotong University(西安交通大学) Peking University(北京大学) Nankai University(南开大学)

AI总结 研究针对通用VLAs难以适配人形机器人全身运动操作的问题,提出HAF框架,通过分层动作流生成器与潜空间RL流水线实现高效迁移优化,在7项任务上性能优于单阶段VLA基线。

Comments Project page: https://grange007.github.io/HAF

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19888 2026-08-18 cs.LG cs.AI 版本更新

SL-S4Wave: Self-Supervised Learning of Physiological Waveforms with Structured State Space Models

SL-S4Wave:基于结构化状态空间模型的生理波形自监督学习

Feng Wu, Harsh Deep, Eric Lehman, Sanyam Kapoor, Guoshuai Zhao, Rahul G. Krishnan, Gari Clifford, Li-wei H Lehman

机构 * Massachusetts Institute of Technology(麻省理工学院) OpenEvidence, USA(OpenEvidence(美国)) New York University(纽约大学) Xi’an Jiaotong University(西安交通大学) University of Toronto(多伦多大学) Emory University(埃默里大学)

AI总结 提出SL-S4Wave框架,结合对比学习与基于结构化状态空间模型的编码器,通过多尺度子核全局卷积捕获多通道生理波形的局部和长程依赖,在心律失常检测等任务中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26182 2026-08-18 cs.AI cs.GR 版本更新

BrickAnything: Geometry-Conditioned Buildable Brick Generation with Structure-Aware Tokenization

BrickAnything: 基于几何条件的可构建砖块生成与结构感知标记化

Zhengyang Ni, Feng Yan, Yu Guo, Fei Wang

机构 * Xi’an Jiaotong University(西安交通大学) State Key Laboratory of Human-Machine Hybrid Augmented Intelligence(人机混合增强智能国家重点实验室) Institute of Artificial Intelligence and Robotics(人工智能与机器人研究院)

AI总结 提出BrickAnything,一个基于几何条件的自回归框架,通过结构感知树标记化生成满足装配约束和结构稳定性的砖块结构。

Comments Revised version with updated Code: https://github.com/xjtunzy/BrickAnything

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21333 2026-08-18 cs.CV 版本更新

MME-VideoOCR: Evaluating OCR-Based Capabilities of Multimodal LLMs in Video Scenarios

MME-VideoOCR:评估多模态大语言模型在视频场景中基于OCR的能力

Yang Shi, Huanqian Wang, Wulin Xie, Huanyao Zhang, Lijie Zhao, Yi-Fan Zhang, Xinfeng Li, Chaoyou Fu, Zhuoer Wen, Wenting Liu, Zhuoran Zhang, Xinlong Chen, Bohan Zeng, Sihan Yang, Yushuo Guan, Zhang Zhang, Liang Wang, Haoxuan Li, Zhouchen Lin, Yuanxing Zhang, Pengfei Wan, Haotian Wang, Wenjing Yang

机构 * Kling Team(Kling团队) PKU(北京大学) THU(清华大学) CASIA(中国科学院自动化研究所) CUHKSZ(香港科技大学) NTU(国立台湾大学) NJU(南京大学) XJTU(吉林大学)

AI总结 本文推出MME-VideoOCR视频OCR基准,评估18个最先进MLLMs的视频OCR能力,发现现有模型在需视频整体理解的任务中表现有限,最优模型准确率仅73.7%,明确了高分辨率输入等对视频OCR的重要性。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14043 2026-08-17 cs.CV 新提交

Beyond Text Conditioning: A Systematic Study of MLLM-DiT Fusion for Video Generation

超越文本条件:面向视频生成的MLLM-DiT融合系统研究

Yanbo Ding, Yijia Fan, Caihua Shan, Yifan Yang, Yifei Shen, Weijie Wang, Xirui Hu, Dongsheng Li, Lili Qiu, Yuqing Yang, Yali Wang

机构 * Chinese Academy of Sciences(中国科学院) Microsoft Research(微软研究院) Sun Yat-sen University(中山大学) Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Xi’an Jiaotong University(西安交通大学)

AI总结 该研究针对视频生成中MLLM与DiT融合问题,提出BiVidGen框架,通过MLLM生成语义视觉标记辅助DiT渲染,提升了视频的语义对齐度与时间一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06526 2026-08-17 cs.CV 版本更新

Concept Unlearning by Modeling Key Steps of Diffusion Process

通过建模扩散过程关键步骤实现的概念遗忘

Chaoshuo Zhang, Chenhao Lin, Zhengyu Zhao, Le Yang, Qian Wang, Chao Shen

机构 * School of Cyber Science and Engineering, Xi’an Jiaotong University(网络安全科学与工程学院,西安交通大学) Wuhan University(武汉大学)

AI总结 针对文本到图像扩散模型概念遗忘时的灾难性遗忘问题,提出KSCU方法,通过动态隔离优化至概念特定活跃区域,实现了更优的概念擦除与效用保留权衡,在多类任务中性能领先。

Comments Accepted by T-IFS

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23496 2026-08-14 cs.AI cs.CR 版本更新

Do LLMs Know Their Vulnerable Scenarios?

大语言模型知道它们的脆弱场景吗?

Ziheng Peng, Huiqi Deng, Haoran Jing, Xuankun Rong, Jiahui Han, Xiting Wang, Na Zou, Xia Hu

机构 * Renmin University of China(中国人民大学) Xi’an Jiaotong University(西安交通大学) University of Science and Technology of China(中国科学技术大学) Wuhan University(武汉大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

AI总结 研究大语言模型在特定场景下的脆弱性,提出Concept2Scenario框架,通过实例化概念空间、归因拒绝抑制等步骤发现脆弱场景,在多模型和基准测试中验证,能提高攻击成功率、可迁移且组合效果优。

Comments 19 pages, 11 Figures, Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03181 2026-08-14 cs.RO cs.CV 版本更新

SpatialVAM:Spatial-Aware Multi-View Video Diffusion as a Data-Efficient Robot Policy

多视角视频扩散策略:一种3D空间-时间感知的视频动作模型

Peiyan Li, Yixiang Chen, Yuan Xu, Jiabing Yang, Xiangnan Wu, Jun Guo, Nan Sun, Long Qian, Xinghang Li, Xin Xiao, Jing Liu, Nianfeng Liu, Tao Kong, Yan Huang, Liang Wang, Tieniu Tan

机构 * New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) FiveAges(五时代) Tsinghua University(清华大学) Xi’an Jiaotong University(西安交通大学) Wuhan University(武汉大学) Nanjing University(南京大学)

AI总结 本文提出MV-VDP,通过联合建模环境的3D空间-时间状态,解决机器人操控中对3D空间结构和时间演变理解不足的问题,实现高效、鲁棒且可解释的动作执行。

Comments Updated Version; Project Website: https://spatialvam.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15577 2026-08-14 cs.CV 版本更新

Shortest-Path Decomposition for Foliage-Robust 3D Tree Modeling and Above-Ground Biomass Estimation from Point Clouds

适用于点云的抗 foliage 三维树木建模与地上生物量估算的最短路径分解方法

Di Wang, Shi Li

机构 * School of Software Engineering, Xi'an Jiaotong University, Xi'an 710049, China(软件工程学院,西安交通大学,西安710049,中国) Shaanxi Joint (Key) Laboratory for Artificial Intelligence (Xi’an Jiaotong University), Xi'an 710049, China(陕西省人工智能联合(重点)实验室(西安交通大学),西安710049,中国)

AI总结 该研究提出拓扑驱动的 foliage 抑制最短路径分解方法,从单一点云恢复树木分支层次,在有叶条件下的AGB估算精度优于传统QSM方法,为相关森林清查业务应用消除了障碍。

Comments 14 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11690 2026-08-13 cs.LG stat.ML 新提交

Drift and Dependence: Layer-wise Information-Theoretic Bounds for Replay-Based Continual Learning

漂移与依赖:基于重放的持续学习的分层信息论边界

Tieliang Gong, Zhongbo Zhang, Wen Wen, Yong-Jin Liu

机构 * School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)

AI总结 该研究提出分层信息论框架,分解重放式持续学习的泛化差距,通过Wasserstein松弛和SGLD实例化实现可操作的边界,经实验验证了相关预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04923 2026-08-13 cs.LG cs.AI cs.CL 版本更新

Reproducing, Analyzing, and Detecting Reward Hacking in Rubric-Based Reinforcement Learning

基于评分标准的强化学习中的奖励黑客行为的复现、分析与检测

Xuekang Wang, Zhuoyuan Hao, Shuo Hou, Hao Peng, Juanzi Li, Xiaozhi Wang

机构 * Tsinghua University(清华大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Xi’an Jiaotong University(西安交通大学)

AI总结 本文提出可控黑客环境CHERRL,通过注入已知偏见复现奖励黑客行为,分析其可发现性与可利用性,并探索基于智能体的自动检测方法。

Comments 23 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11013 2026-08-12 cs.CV 新提交

Watching Synthetic Videos: Aligning Cross-modal Representations with Visual Synthesis for Zero-shot Video Captioning

观看合成视频:针对零样本视频字幕生成的视觉合成跨模态表征对齐

Liangyu Fu, Junbo Wang, Yuke Li, Ya Jing, Xuecheng Wu, Zhiyong Wang

机构 * School of Software, Northwestern Polytechnical University(西北工业大学软件学院) School of Information Science and Technology, Beijing University of Technology(北京工业大学信息科学与技术学院) School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) School of Computer Science, The University of Sydney(悉尼大学计算机科学学院)

AI总结 本文提出WSV零样本视频字幕生成框架,通过文本到视频生成模型、抛光器、提示器弥合跨模态差距,在三个公开数据集上取得了B@4 52、CIDEr 95.7的成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10804 2026-08-12 cs.CV cs.AI cs.LG 新提交

BPG: Balancing Plasticity and Generalization for Domain Incremental Learning

BPG:面向领域增量学习的可塑性与泛化能力平衡框架

Qiang Wang, Songlin Dong, Shaokun Wang, Jizhou Han, Xiang Song, Chenhao Ding, Yuhang He, Yihong Gong

机构 * College of Artificial Intelligence, Xi’an Jiaotong University(西安交通大学人工智能学院) Shenzhen University of Advanced Technology(深圳先进技术大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件工程学院)

AI总结 本研究提出BPG框架,通过动态适配的BPG-Adapter与软领域混合的BPG-Inference解决领域增量学习的参数冗余或能力不足问题,在多数据集上实现最优平均准确率并大幅降低遗忘率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19436 2026-08-12 cs.CV cs.AI cs.LG cs.MM 版本更新

VDC-Agent: When Video Detailed Captioners Evolve Themselves via Agentic Self-Reflection

VDC-Agent:当视频详细描述器通过代理自我反思而自我进化

Qiang Wang, Xinyuan Gao, Yuhang He, Jizhou Han, Jiangyang Li, SongLin Dong, Zhiheng Ma, Yihong Gong

机构 * Xi’an Jiaotong University(西安交通大学) Kuaishou Technology(快手科技) Shenzhen University of Advanced Technology(深圳先进技术大学)

AI总结 VDC-Agent通过自我反思机制实现视频详细描述的自我进化,利用自动生成的(描述,评分)对提升描述准确性与评分表现。

Comments Accepted to ECCV 2026. Project Page: https://vdcagent.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23413 2026-08-12 cs.LG 版本更新

URS: A Unified Neural Routing Solver for Cross-Problem Zero-Shot Generalization

URS:一种面向跨问题零样本泛化的统一神经路由求解器

Changliang Zhou, Canhong Yu, Shunyu Yao, Xi Lin, Zhenkun Wang, Yu Zhou, Qingfu Zhang

机构 * School of Automation and Intelligent Manufacturing, Southern University of Science and Technology, Shenzhen, China(自动化与智能制造学院,南方科技大学,深圳,中国) Guangdong Provincial Key Laboratory of Fully Actuated System Control Theory and Technology, Southern University of Science and Technology, Shenzhen, China(广东省全驱动系统控制理论与技术重点实验室,南方科技大学,深圳,中国) College of Computer Science and Software Engineering, Shenzhen University, Shenzhen, China(计算机科学与软件工程学院,深圳大学,深圳,中国) Department of Computer Science, City University of Hong Kong, Hong Kong SAR, China(计算机科学系,香港城市大学,香港特别行政区,中国) School of Mathematics and Statistics, Xi'an Jiaotong University, Xi'an, China(数学与统计学学院,西安交通大学,西安,中国)

AI总结 提出URS,一种统一神经路由求解器,通过统一数据表示和混合偏置模块,实现单个模型在110种车辆路径问题变体(含99种未见变体)上的零样本泛化,并支持高达7000节点的规模。

Comments accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08555 2026-08-11 cs.CV 新提交

SC-Diff: Semantically Calibrated Diffusion for Visible-to-Infrared Image Translation

SC-Diff:用于可见光到红外图像转换的语义校准扩散模型

Junyin Zhang, Siyu Huang, Jianxiong Ye, Haowei Gong, Ruicheng Zhang, Deyu Meng, Chenqiang Gao

机构 * School of Intelligent Systems Engineering, Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区智能系统工程学院) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) School of Mathematics and Statistics, Xi’an Jiaotong University(西安交通大学数学与统计学院)

AI总结 SC-Diff 是一种语义校准潜扩散框架,通过结合语义先验作为条件与自注意力校准,提升可见光转红外图像的语义一致性,生成更适用于红外目标检测的合成训练数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22077 2026-08-11 eess.IV cs.CV physics.optics 版本更新

The Lift Spectrum: How Measurement-to-Space Adaptivity Shapes Robustness in Image-Free Single-Pixel Sensing

提升频谱:测量到空间的适应性如何塑造无图像单像素传感的鲁棒性

Yuyuan Han, Jingwei Li, Xiaoxia Zhang, Long Qiu, Chong Wang, Wenxuan Hao, Jiangyu Han, Xinyu Yao, Yuchen He, Hui Chen, Jianbin Liu, Huaibin Zheng

机构 * Electronic Materials Research Laboratory, Key Laboratory of the Ministry of Education and International Center for Dielectric Research, School of Electronic Science and Engineering, Xi’an Jiaotong University(电子材料研究中心、教育部重点实验室和国际介电研究中心、电子科学与工程学院,西安交通大学) Micius Laboratory, Henan Academy of Sciences(墨子实验室、河南省科学院)

AI总结 研究无图像单像素传感中提升频谱对鲁棒性的影响,提出基于适应程度排序的方法,介绍时空软融合网络及训练方式,通过模拟和实际验证其性能,绘制提升频谱可指导设计,提升了该领域的方法效果。

Comments 25 pages (13 main text + 12 supplementary material), 8 figures, 3 tables. Submitted to IEEE Transactions on Computational Imaging

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25465 2026-08-11 cs.CV cs.AI 版本更新

EchoStyle: Unlocking High-Fidelity Video Stylization with Reverse Data Synthesis

EchoStyle: 通过反向数据合成解锁高保真视频风格化

Huaqiu Li, Jiahao Wang, Sijia Cai, Hualian Sheng, Bing Deng, Jieping Ye, Wenhan Luo

机构 * The Hong Kong University of Science and Technology(香港科技大学) Alibaba Group(阿里巴巴集团) Xi’an Jiaotong University(西安交通大学)

AI总结 提出EchoStyle框架,通过构建视频到视频架构、自动反向合成数据集V-Style20k和初始跟随模式机制,解决视频风格化中的内容泄露、数据稀缺和长视频适应性问题,实现高质量任意长度视频风格化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05695 2026-08-11 cs.CV 版本更新

Let Geometry GUIDE: Layer-wise Unrolling of Geometric Priors in Multimodal LLMs

让几何引导:在多模态大语言模型中逐层展开几何先验

Chongyu Wang, Ting Huang, Chunyu Sun, Xinyu Ning, Di Wang, Hao Tang

机构 * Xi’an Jiaotong University(西安交通大学) Peking University(北京大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) InspireOmni

AI总结 本文提出GUIDE框架,通过多级采样和逐步融合几何先验,提升多模态大语言模型在空间推理任务中的性能。

Comments Revised manuscript with updated experiments, figures, and presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07261 2026-08-10 cs.CL 新提交

Why Knowing Both Hops Is Not Enough: Understanding Two-Hop Generalization in Language Models

仅知道两跳信息是不够:理解语言模型中的两跳泛化

Zili Zhang, Yilin Wang, Heng Wang, Herun Wan, Minnan Luo

机构 * Xi’an Jiaotong University(西安交通大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 本研究针对语言模型两跳查询失败问题,在受控环境训练Transformer,揭示其泛化规律与跨层不匹配机制,提出循环式训练策略以提升分布外两跳泛化能力。

Comments 24 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19491 2026-08-10 cs.CV 版本更新

Thinking in Scales: Accelerating Gigapixel Pathology Image Analysis via Adaptive Continuous Reasoning

尺度思考:通过自适应连续推理加速千兆像素病理图像分析

Jiusong Ge, Yingkang Zhan, Wenjie Zhao, Di Zhang, Ke Wang, Jiashuai Liu, Chunze Yang, Chengzu Li, Jian Zhang, Yuxin Dong, Ni Zhang, Qidong Liu, Mireia Crispin-Ortuzar, Huazhu Fu, Chen Li, Zeyu Gao

机构 * School of Computer Science(计算机科学学院) Technology, Xi’an Jiaotong University, Xi’an, China(技术学院,西安交通大学,西安,中国) Department of Transmedia Art, Xi’an Academy of Fine Arts, Xi’an, China(多媒体艺术系,西安美术学院,西安,中国) Department of Oncology, University of Cambridge, Cambridge, U.K.(肿瘤学系,剑桥大学,剑桥,英国) Language Technology Lab, University of Cambridge, Cambridge, U.K.(语言技术实验室,剑桥大学,剑桥,英国) Institute of High Performance Computing, Agency for Science, Technology(高性能计算研究所,科技研究局)

AI总结 提出PathCTM模型,通过动态尺度切换和注意力引导的区域剪枝实现高效连续推理,大幅减少计算开销并保持诊断性能。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29025 2026-08-06 cs.CV 版本更新

Evaluation-Verification Reward for Consistent Multi-Reference Image Editing

用于一致多参考图像编辑的评估-验证奖励

Yingmao Miao, Pengfei Zhang, Xiaochen Lv, Meng Yu, Lei Sun, Xiangxiang Chu, Chao Shen, Chenhao Lin

机构 * Xi’an Jiaotong University(西安交通大学) Amap, Alibaba(高德,阿里巴巴) Shanghai Jiao Tong University(上海交通大学)

AI总结 针对多参考图像编辑的视觉一致性与奖励模型缺失问题,提出多维度评估-验证奖励EVR,实现无需架构改动的现成编辑器RL微调,性能优于Qwen-Image-Edit并达到或超NanoBanana。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08514 2026-08-05 cs.CV 版本更新

OmniTryOn: Video Try-On Anything at Once!

OmniTryOn: 一次性视频试穿任意物品!

Changliang Xia, Chengyou Jia, Minnan Luo, Zhuohang Dang, Xin Shen, Bowen Ping

机构 * Xi’an Jiaotong University(西安交通大学)

AI总结 提出OmniTryOn框架,通过首帧可穿戴缓存和时空一致RoPE,实现无外部先验的一次性视频多物品试穿,在TryAny-Bench上显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25459 2026-08-05 cs.RO 版本更新

GS-Playground: A High-Throughput Photorealistic Simulator for Vision-Informed Robot Learning

GS-Playground:一种高吞吐量的视觉真实模拟器用于基于视觉的机器人学习

Yufei Jia, Heng Zhang, Ziheng Zhang, Junzhe Wu, Mingrui Yu, Zifan Wang, Dixuan Jiang, Zheng Li, Chenyu Cao, Zhuoyuan Yu, Xun Yang, Haizhou Ge, Yuchi Zhang, Jiayuan Zhang, Zhenbiao Huang, Tianle Liu, Shenyu Chen, Jiacheng Wang, Bin Xie, Xuran Yao, Xiwa Deng, Guangyu Wang, Jinzhi Zhang, Lei Hao, Zhixing Chen, Yuxiang Chen, Anqi Wang, Hongyun Tian, Yiyi Yan, Zhanxiang Cao, Yizhou Jiang, Hanyang Shao, Yue Li, Lu Shi, Bokui Chen, Wei Sui, Hanqing Cui, Yusen Qin, Ruqi Huang, Lei Han, Tiancai Wang, Guyue Zhou

机构 * THU(清华大学) Motphys Dexmal DISCOVER Robotics HKUST(GZ)(香港科技大学(广州)) BIT(北京理工大学) NUS(新加坡国立大学) HITSZ(哈尔滨工业大学) XJTU(西安交通大学) NJU(南京大学) SJTU(上海交通大学) D-Robotics

AI总结 GS-Playground通过高吞吐量的多模态模拟框架,结合高效物理引擎和3DGS渲染管道,提升视觉强化学习的效率,降低大规模视觉RL的门槛,实现感知与物理的无缝衔接。

Comments Robotics: Science and Systems 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01234 2026-08-04 cs.AI 新提交

Learning What to Remember and What to Internalize in LLM Self-Evolution via Adaptive Memory-Parameter Coordination

在大语言模型自进化中通过自适应记忆-参数协调学习该记住什么和该内化什么

Tianyun Ji, Zhenya Huang, Jiayu Liu, Zirui Liu, Yu Su, Hongbin Pei

机构 * University of Science and Technology of China(中国科学技术大学) City University of Hong Kong(香港城市大学) Hefei Normal University(合肥师范学院) Xi’an Jiaotong University(西安交通大学)

AI总结 该研究提出 COVE 框架,通过任务感知路由等方式协调大语言模型自进化的记忆与参数通道,解决单通道进化的灵活性与性能权衡问题,在多任务上实现更稳健高效的改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01104 2026-08-04 cs.CV 新提交

From Patches to Evidence Balls: Class-Conditioned Evidence Retrieval for Few-Shot Whole Slide Image Classification

从图像块到证据球:面向小样本全切片图像分类的类别条件证据检索

Di Zhang, Li Zhang, Jiashuai Liu, Junbo Lu, Zhi Zeng, Jiusong Ge, Chunze Yang, Yi Niu, Jian Chen, Kai He, Zeyu Gao, Chen Li

机构 * XJTU(西安交通大学) JUFE(江西财经大学) University of Cambridge(剑桥大学) NUS(新加坡国立大学)

AI总结 该研究针对小样本全切片图像分类任务,提出类别条件证据检索框架EviBall,通过组织证据球并结合任务特定类别查询,提升分类性能与可解释性,在四项相关任务上优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25498 2026-08-04 cs.SD cs.AI 版本更新

SymphonyGen: 3D Hierarchical Orchestral Generation with Controllable Harmony Skeleton

SymphonyGen:具有可控和声骨架的3D分层交响乐生成

Xuzheng He, Nan Nan, Zhilin Wang, Ziyue Kang, Zhuoru Mo, Ao Li, Yu Pan, Xiaobing Li, Feng Yu, Xiaohong Guan

机构 * Department of AI Music and Music Information Technology, Central Conservatory of Music(中央音乐学院人工智能音乐与音乐信息科技系) Frontier Institute of Science and Technology, and Interdisciplinary Research Center of Frontier Science and Technology, Xi’an Jiaotong University(西安交通大学前沿科学与技术研究院及交叉科学与技术 interdisciplinary research center) University of Science and Technology of China(中国科学技术大学) Shenzhen University(深圳大学)

AI总结 SymphonyGen通过3D分层框架实现当代电影交响乐生成,采用分层解码器架构提升效率,引入短谱条件和GRPO优化,增强和声纯净度与音乐表现力。

Comments Accepted at ISMIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏