arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

Nanyang Technological University(南洋理工大学)

2026-02-24 至 2026-02-24 共收录 14
2602.19582 2026-02-24 cs.LG

Advantage-based Temporal Attack in Reinforcement Learning

基于优势的时序攻击在强化学习中

Shenghong He

机构 * School of Computer Science and Engineering, Sun Yat-sen University(计算机科学与工程学院,中山大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出基于优势的对抗变压器(AAT),通过多尺度因果自注意力机制和加权优势机制,生成具有更强时间相关性的对抗示例,提升强化学习中的攻击性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19454 2026-02-24 cs.CV

HD-TTA: Hypothesis-Driven Test-Time Adaptation for Safer Brain Tumor Segmentation

HD-TTA:基于假设的测试时适应用于更安全的脑肿瘤分割

Kartik Jhawar, Lipo Wang

机构 * Institute for Digital Molecular Analytics and Science(数字分子分析与科学研究所) Nanyang Technological University(南洋理工大学) School of Electrical and Electronic Engineering(电气与电子工程学院)

AI总结 HD-TTA通过生成竞争性几何假设并采用表示引导的selector,提高脑肿瘤分割的安全性与精度。

Comments 11 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19180 2026-02-24 cs.CV

VLM-Guided Group Preference Alignment for Diffusion-based Human Mesh Recovery

基于扩散模型的人体网格恢复中的群体偏好对齐

Wenhao Shen, Hao Wang, Wanqi Yin, Fayao Liu, Xulei Yang, Chao Liang, Zhongang Cai, Guosheng Lin

机构 * Nanyang Technological University(南洋理工大学) HKUST(GZ)(香港科技大学(广州)) SenseTime Research(商汤科技研究院) A*STAR(新加坡科技研究局)

AI总结 本文提出了一种基于群体偏好的扩散模型微调框架,通过双内存增强的批评代理生成质量评分,提升人体网格恢复的物理合理性和图像一致性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19163 2026-02-24 cs.CV cs.MM cs.SD

JavisDiT++: Unified Modeling and Optimization for Joint Audio-Video Generation

JavisDiT++:联合音频视频生成的统一建模与优化

Kai Liu, Yanhao Zheng, Kai Wang, Shengqiong Wu, Rongjunchen Zhang, Jiebo Luo, Dimitrios Hatzinakos, Ziwei Liu, Hao Fei, Tat-Seng Chua

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) University of Toronto(多伦多大学) HiThink Research(HiThink研究) University of Rochester(罗切斯特大学) Nanyang Technological University(南洋理工大学)

AI总结 JavisDiT++通过统一建模与优化方法,在联合音频视频生成任务中实现高质量的同步与语义对齐。

Comments Accepted by ICLR 2026. Homepage: https://JavisVerse.github.io/JavisDiT2-page

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19064 2026-02-24 cs.CV

L3DR: 3D-aware LiDAR Diffusion and Rectification

L3DR:基于3D感知的LiDAR扩散与校正

Quan Liu, Xiaoqin Zhang, Ling Shao, Shijian Lu

机构 * Nanyang Technological University(南洋理工大学) Zhejiang University of Technology(浙江工业大学) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 L3DR通过3D-aware的LiDAR扩散和校正框架,在3D空间中消除RV伪影并恢复局部几何结构,实现更真实的3D几何生成。

Comments In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19058 2026-02-24 cs.CL

Do LLMs and VLMs Share Neurons for Inference? Evidence and Mechanisms of Cross-Modal Transfer

大型语言模型和视觉语言模型是否共享神经元进行推理?证据和跨模态转移的机制

Chenhang Cui, An Zhang, Yuxin Chen, Gelei Deng, Jingnan Zheng, Zhenkai Liang, Xiang Wang, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学) Nanyang Technological University(南洋理工大学)

AI总结 本文研究了大型语言模型和视觉语言模型在推理过程中共享神经元的现象,提出SNRF框架实现低秩融合,提升多模态推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08318 2026-02-24 cs.CV

LinVideo: A Post-Training Framework towards O(n) Attention in Efficient Video Generation

LinVideo: 一种面向高效视频生成的O(n)注意力后训练框架

Yushi Huang, Xingtong Ge, Ruihao Gong, Chengtao Lv, Jun Zhang

机构 * Hong Kong University of Science and Technology(香港科技大学) Beihang University(北航) Sensetime Research(商汤科技研究院) Nanyang Technological University(南洋理工大学)

AI总结 LinVideo提出一种高效的无数据后训练框架,通过选择性迁移将部分自注意力模块替换为线性注意力,从而在保持性能的同时显著提升视频生成效率。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23377 2026-02-24 cs.CV cs.AI cs.SD eess.AS

JavisDiT: Joint Audio-Video Diffusion Transformer with Hierarchical Spatio-Temporal Prior Synchronization

JavisDiT:具有层次化时空先验同步的联合音频视频扩散变换器

Kai Liu, Wei Li, Lai Chen, Shengqiong Wu, Yanhao Zheng, Jiayi Ji, Fan Zhou, Jiebo Luo, Ziwei Liu, Hao Fei, Tat-Seng Chua

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学) University of Rochester(罗切斯特大学) Nanyang Technological University(南洋理工大学)

AI总结 JavisDiT通过层次化时空先验同步机制,实现了高质量的音频视频同步生成,解决了现实场景中的同步评估问题。

Comments Accepted by ICLR 2026. Homepage: https://javisverse.github.io/JavisDiT-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.12817 2026-02-24 cs.CV cs.AI

Learning to See the Elephant in the Room: Self-Supervised Context Reasoning in Humans and AI

学习房间中的大象:人类和人工智能中的自监督上下文推理

Xiao Liu, Soumick Sarker, Ankur Sikarwar, Bryan Atista Kiely, Gabriel Kreiman, Zenglin Shi, Mengmi Zhang

机构 * College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学) CFAR and I2R, Agency for Science, Technology and Research(CFAR和I2R,科技研究局) Boston Children’s Hospital, Harvard Medical School(哈佛医学院儿童医院)

AI总结 本文提出SeCo模型,通过自监督学习实现上下文推理,展示了上下文关联在场景理解中的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18739 2026-02-24 cs.LG

When World Models Dream Wrong: Physical-Conditioned Adversarial Attacks against World Models

当世界模型做梦错误:针对世界模型的物理条件对抗攻击

Zhixiang Guo, Siyuan Liang, Andras Balogh, Noah Lunberry, Rong-Cheng Tu, Mark Jelasity, Dacheng Tao

机构 * Nanyang Technological University(南洋理工大学) University of Szeged(塞格德大学)

AI总结 本文提出PhysCond-WMA攻击方法,通过扰动物理条件通道诱导世界模型的语义、逻辑或决策层面的扭曲,揭示生成式世界模型的安全性漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18724 2026-02-24 cs.AI

Task-Aware Exploration via a Predictive Bisimulation Metric

通过预测双模拟度量实现任务感知探索

Dayang Liang, Ruihan Liu, Lipeng Wan, Yunlong Liu, Bo An

机构 * Department of Automation, Xiamen University, Xiamen, China(自动化系,厦门大学) Department of Computer Science, Beijing Normal-Hong Kong Baptist University, Zhuhai, China(计算机科学系,北京师范大学-香港 Baptist大学) School of Artificial Intelligence, Xian Jiaotong University, Xian, China(人工智能学院,西安交通大学) College of Computing and Data Science, Nanyang Technological University, Singapore(计算与数据科学学院,南洋理工大学)

AI总结 TEB通过预测双模拟度量实现任务感知探索,有效解决稀疏奖励下视觉强化学习中的探索难题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14979 2026-02-24 cs.CV cs.AI

From Pixels to Words -- Towards Native Vision-Language Primitives at Scale

从像素到词语 -- 向大规模原生视觉-语言原始语义迈进

Haiwen Diao, Mingxuan Li, Silei Wu, Linjun Dai, Xiaohua Wang, Hanming Deng, Lewei Lu, Dahua Lin, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) SenseTime Research(商汤科技研究院) Xi’an Jiaotong University(西安交通大学)

AI总结 NEO通过原生视觉-语言基础构建,实现了从零开始的视觉感知发展,有效缓解了视觉-语言冲突,推动了大规模原生VLM的发展。

Comments 21 pages, 8 figures, Accepted by ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16670 2026-02-24 cs.CR cs.AI

BitHydra: Towards Bit-flip Inference Cost Attack against Large Language Models

BitHydra: 面向大语言模型的位翻转推理成本攻击

Xiaobei Yan, Yiming Li, Hao Wang, Han Qiu, Tianwei Zhang

机构 * Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学)

AI总结 BitHydra通过位翻转攻击针对大语言模型的推理成本进行攻击,利用ADMM方法高效实现无限生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15937 2026-02-24 cs.AI

Advancing Mobile GUI Agents: A Verifier-Driven Approach to Practical Deployment

推进移动GUI代理:一种以验证器驱动的方法用于实际部署

Gaole Dai, Shiqi Jiang, Ting Cao, Yuanchun Li, Yuqing Yang, Rui Tan, Mo Li, Lili Qiu

机构 * Nanyang Technological University(南洋理工大学) Microsoft Research(微软研究院) Tsinghua University(清华大学)

AI总结 V-Droid通过验证器驱动的方法提升移动GUI任务自动化代理的性能与效率

Comments "V-Droid: Advancing Mobile GUI Agent Through Generative Verifiers", got accepted to MobiCom 2026

详情

展开后加载摘要…

URL PDF HTML 收藏