MambaVF: State Space Model for Efficient Video Fusion
MambaVF:用于高效视频融合的状态空间模型
机构 * Xi'an Jiaotong University(西安交通大学) ; Nanyang Technological University(南洋理工大学) ; Tsinghua University(清华大学)
AI总结 MambaVF通过基于状态空间模型的高效框架,实现了无需显式运动估计的视频融合,显著提升效率和性能。
高校专区
MambaVF:用于高效视频融合的状态空间模型
机构 * Xi'an Jiaotong University(西安交通大学) ; Nanyang Technological University(南洋理工大学) ; Tsinghua University(清华大学)
AI总结 MambaVF通过基于状态空间模型的高效框架,实现了无需显式运动估计的视频融合,显著提升效率和性能。
Shiva-DiT:基于残差的可微Top-k选择用于高效扩散变换器
机构 * AIOS, Alibaba Group(阿里云人工智能实验室,阿里巴巴集团) ; College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) ; Nanyang Technological University(南洋理工大学)
AI总结 Shiva-DiT通过基于残差的可微Top-k选择,在保持端到端可学习性的同时,实现了高效扩散变换器的剪枝,提升了计算效率并减少了硬件开销。
VGGT-Motion:具有运动感知的校准自由单目SLAM用于长距离一致性
机构 * National Key Laboratory of Science and Technology on Multi-spectral Information Processing(科学与技术多光谱信息处理国家重点实验室) ; Huazhong University of Science and Technology(华中科技大学) ; College of Computing and Data Science(计算与数据科学学院) ; Nanyang Technological University(南洋理工大学)
AI总结 VGGT-Motion通过运动感知子地图构造和锚点驱动的直接Sim(3)对齐策略,实现了高效且稳健的校准自由单目SLAM,提升了长距离轨迹的精度和效率。
Stream-Voice-Anon: 通过神经音频编解码器和语言模型提升实时语音匿名化的效用
机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) ; Institute for Infocomm Research, A STAR, Singapore(信息通信研究所,新加坡) ; The Hong Kong Polytechnic University, Hong Kong(香港理工大学,香港)
AI总结 Stream-Voice-Anon通过神经音频编解码器和语言模型提升实时语音匿名化效果,实现更高的可懂度和情绪保留,同时保持低延迟和隐私保护。
Comments Accepted by ICASSP2026. Demo/code: https://paniquex.github.io/Stream-Voice-Anon/
抵制操纵机器人在表情包加密货币复制交易中的应用:一种基于多智能体的链式推理方法
机构 * UCL, Centre for Blockchain Technologies(伦敦大学区块链技术中心) ; The University of Hong Kong, FinTech Academy(香港大学金融科技学院) ; Nanyang Technological University(南洋理工大学)
AI总结 本文提出一种基于多智能体和链式推理的复制交易系统,以抵御操纵机器人,通过多模态大语言模型提升预测准确度和经济表现,实现加密货币投资的稳健收益。
Journal ref Proceedings of the ACM Web Conference 2026 (WWW'26)
通过条件点稀疏化提升SAM用于跨域少样本分割
机构 * Nanyang Technological University(南洋理工大学) ; Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究所(TeleAI),中国电信) ; Xi'an Jiaotong University(西安交通大学) ; VinUniversity(文大学)
AI总结 本文提出条件点稀疏化方法,通过自适应引导SAM实现跨域少样本分割的更准确结果。
E.M.Ground: 一种具有整体事件感知和匹配的时序地面视频大语言模型
机构 * Interdisciplinary Graduate Programme, Nanyang Technological University, Singapore(南洋理工大学交叉学科研究生项目) ; Xi’an Jiaotong University, China(西安交通大学) ; Alibaba DAMO Academy, Singapore(阿里巴巴达摩院) ; Institute of Science Tokyo, Japan(东京科学研究院) ; VinUniversity, Vietnam(文大学) ; Nanyang Technological University, Singapore(南洋理工大学)
AI总结 E.M.Ground通过引入事件标记、平滑处理和多粒度特征聚合,提升了时序视频地面任务的性能。
SIDeR:语义身份解耦用于无限制面部隐私保护
机构 * School of Computer and Information Engineering, Xiamen University of Technology(厦门理工学院计算机与信息工程学院) ; Department of Electrical and Electronic Engineering, University of Hong Kong(香港大学电子与电气工程系) ; School of Computer Science, Engineering Research Center of Machine Learning and Industry Intelligence, Sichuan University(四川大学计算机科学学院,机器学习与工业智能工程研究中心) ; Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) ; College of Artificial Intelligence, Southwest University(西南大学人工智能学院) ; School of Computer Science, Fudan University(复旦大学计算机科学学院) ; Department of Computer and Information Science, Faculty of Science and Technology, University of Macau(澳门大学科技学院计算机与信息科学系) ; Data61, CSIRO(CSIRO Data61) ; College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)
AI总结 SIDeR通过语义解耦驱动框架实现面部隐私保护,生成视觉匿名的对抗性样本并保持身份一致性,实验显示其在攻击成功率和恢复质量上均优于现有方法。
Comments 14 pages, 8 figures
CyIN:循环信息潜在空间用于连接完整与不完整多模态学习
机构 * School of Electronics and Information Technology, Sun Yat-Sen University(中山大学电子与信息学院) ; School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院) ; School of Computer Science, South China Normal University(华南师范大学计算机科学学院) ; Desay SV Automotive Co., Ltd(德赛股份有限公司) ; Pazhou Laboratory(琶洲实验室)
AI总结 CyIN通过构建循环信息潜在空间,解决多模态学习中完整与不完整数据之间的性能差距,实现统一优化。
Comments Accepted by NeurIPS 2025