arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

Korea Advanced Institute of Science and Technology(韩国科学技术院)

2026-03-11 至 2026-03-11 共收录 8
2603.09408 2026-03-11 cs.CV cs.AI cs.LG

Reviving ConvNeXt for Efficient Convolutional Diffusion Models

复兴 ConvNeXt 以实现高效的卷积扩散模型

Taesung Kwon, Lorenzo Bianchi, Lennart Wittke, Felix Watine, Fabio Carrara, Jong Chul Ye, Romann Weber, Vinicius Azevedo

机构 * KAIST(韩国科学技术院) ETH Zürich(苏黎世联邦理工学院) ISTI-CNR(意大利国家研究理事会信息与自动化研究所) University of Pisa(比萨大学)

AI总结 本文提出全卷积扩散模型 FCDM-XL,通过使用 ConvNeXt 结构实现高效扩散模型,以更少的 FLOPs 和训练步骤达到与 DiT-XL 相当的性能。

Comments CVPR 2026. Official implementation: https://github.com/star-kwon/FCDM

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09222 2026-03-11 cs.CL

LooComp: Leverage Leave-One-Out Strategy to Encoder-only Transformer for Efficient Query-aware Context Compression

LooComp: 通过留一法策略提升仅编码器Transformer的查询感知上下文压缩效率

Thao Do, Dinh Phu Tran, An Vo, Seon Kwon Kim, Daeyoung Kim

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

AI总结 LooComp通过留一法策略提升仅编码器Transformer的查询感知上下文压缩效率,实现高效压缩与高吞吐量推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08483 2026-03-11 cs.CV cs.AI cs.LG

X-AVDT: Audio-Visual Cross-Attention for Robust Deepfake Detection

X-AVDT:用于鲁棒深度伪造检测的音频视觉交叉注意力

Youngseo Kim, Kwan Yun, Seokhyeon Hong, Sihun Cha, Colette Suhjung Koo, Junyong Noh

机构 * Visual Media Lab, KAIST(韩国科学技术院视觉媒体实验室)

AI总结 X-AVDT通过利用生成器内部的音频视觉一致性线索,提出了一种鲁棒且具有通用性的深度伪造检测方法,有效提升了检测性能。

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13672 2026-03-11 cs.LG cs.CV

Directional Textual Inversion for Personalized Text-to-Image Generation

方向性文本反转用于个性化文本到图像生成

Kunhee Kim, NaHyeon Park, Kibeom Hong, Hyunjung Shim

机构 * KAIST(韩国科学技术院) Sookmyung Woman’s University(成均馆女子大学)

AI总结 方向性文本反转通过优化方向提升文本到图像生成的个性化效果,实现更稳定的语义连贯性。

Comments ICLR 2026; Project page: https://kunheek.github.io/dti

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09079 2026-03-11 cs.CV cs.AI cs.RO

GST-VLA: Structured Gaussian Spatial Tokens for 3D Depth-Aware Vision-Language-Action Models

GST-VLA: 结构化高斯空间标记用于3D深度感知视觉-语言-动作模型

Md Selim Sarowar, Omer Tariq, Sungho Kim

机构 * Yeungnam University(延世大学) Korea Advanced Institute of Science and Technology, KAIST(韩国科学技术院)

AI总结 GST-VLA通过结构化高斯空间标记和深度感知链式思维提升3D视觉-语言-动作模型的精度和性能。

Comments The results presented in this paper are preliminary. Please note that the experiments are currently ongoing, and the final data is subject to change upon the completion of the study. All ideas, results, methods, and any content herein are the sole property of the authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09056 2026-03-11 cs.RO cs.LG

Quality over Quantity: Demonstration Curation via Influence Functions for Data-Centric Robot Learning

质量优于数量:通过影响函数进行演示数据的 curated

Haeone Lee, Taywon Min, Junsu Kim, Sinjae Kang, Fangchen Liu, Lerrel Pinto, Kimin Lee

机构 * KAIST(韩国科学技术院) University of California, Berkeley(加州大学伯克利分校) New York University(纽约大学)

AI总结 本文提出 QoQ 方法,通过影响函数识别高质量演示数据,提升机器人学习性能。

Comments Accepted to ICRA 2026, 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08835 2026-03-11 cs.AI cs.CL cs.LG

MASEval: Extending Multi-Agent Evaluation from Models to Systems

MASEval: 从模型到系统的多智能体评估扩展

Cornelius Emde, Alexander Rubinstein, Anmol Goel, Ahmed Heakl, Sangdoo Yun, Seong Joon Oh, Martin Gubri

机构 * Parameter Lab(参数实验室) University of Oxford(牛津大学) University of Tübingen(图宾根大学) TU Darmstadt(德累斯顿理工大学) MBZUAI NAVER AI Lab(NAVER AI实验室) KAIST(韩国科学技术院)

AI总结 MASEval通过系统层面的比较揭示框架选择与模型选择同等重要,为智能体系统设计提供新途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01549 2026-03-11 cs.CV cs.AI cs.RO

Pri4R: Learning World Dynamics for Vision-Language-Action Models with Privileged 4D Representation

Pri4R: 通过特权4D表示学习视觉-语言-动作模型的世界动态

Jisoo Kim, Jungbin Cho, Sanghyeok Chu, Ananya Bal, Jinhyung Kim, Gunhee Lee, Sihaeng Lee, Seung Hwan Kim, Bohyung Han, Hyunmin Lee, Laszlo A. Jeni, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能研究中心) LG AI Research(LG人工智能研究) Yonsei University(延世大学) Seoul National University(首尔国立大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 Pri4R通过特权4D表示学习视觉-语言-动作模型的世界动态,提升操控任务性能

详情

展开后加载摘要…

URL PDF HTML 收藏