arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Korea Advanced Institute of Science and Technology(韩国科学技术院)

2026-02-25 至 2026-02-25 共收录 7
2602.20666 2026-02-25 cs.CV

BoxSplitGen: A Generative Model for 3D Part Bounding Boxes in Varying Granularity

BoxSplitGen:一种用于不同粒度3D部件边界框的生成模型

Juil Koo, Wei-Tung Lin, Chanho Park, Chanhyeok Park, Minhyuk Sung

机构 * KAIST(韩国科学技术院) NVIDIA(英伟达)

AI总结 BoxSplitGen通过迭代分割边界框生成不同粒度的3D部件边界框,提升3D创作中从粗到细的生成效果。

Comments Project page: https://boxsplitgen.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20583 2026-02-25 cs.CV

PropFly: Learning to Propagate via On-the-Fly Supervision from Pre-trained Video Diffusion Models

PropFly: 通过预训练视频扩散模型的实时监督学习进行传播

Wonyong Seo, Jaeho Moon, Jaehyup Lee, Soo Ye Kim, Munchurl Kim

机构 * KAIST(韩国科学技术院) Kyungpook National University(庆北国立大学) Adobe Research(Adobe研究院)

AI总结 PropFly通过预训练视频扩散模型的实时监督学习,实现基于传播的视频编辑,无需配对数据集,提升编辑质量和一致性。

Comments The first two authors contributed equally to this work (equal contribution)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05662 2026-02-25 cs.RO cs.CV

DeLTa: Demonstration and Language-Guided Novel Transparent Object Manipulation

DeLTa: 人机交互与语言引导的新透明物体操控演示

Taeyeop Lee, Gyuree Kang, Bowen Wen, Youngho Kim, Seunghyeok Back, In So Kweon, David Hyunchul Shim, Kuk-Jin Yoon

机构 * KAIST(韩国科学技术院) NVIDIA(英伟达) KIMM(韩国智能媒体实验室)

AI总结 DeLTa通过整合深度估计、6D姿态估计和视觉-语言规划,实现基于自然语言指令的精确长周期透明物体操控,无需额外训练或类别先验。

Comments Project page: https://sites.google.com/view/DeLTa25/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25774 2026-02-25 cs.CV cs.AI cs.LG

PCPO: Proportionate Credit Policy Optimization for Aligning Image Generation Models

PCPO:比例信用政策优化用于对齐图像生成模型

Jeongjae Lee, Jong Chul Ye

机构 * KAIST(韩国科学技术院)

AI总结 PCPO通过稳定的目标重构和时间步重新加权,解决图像生成模型训练中的不稳定性问题,从而提升收敛速度和图像质量。

Comments 35 pages, 20 figures. ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21825 2026-02-25 cs.AI

DS-STAR: Data Science Agent for Solving Diverse Tasks across Heterogeneous Formats and Open-Ended Queries

DS-STAR:跨异构格式和开放性查询的多样化任务数据科学代理

Jaehyun Nam, Jinsung Yoon, Jiefeng Chen, Raj Sinha, Jinwoo Shin, Tomas Pfister

机构 * Google Cloud(谷歌云) KAIST(韩国科学技术院)

AI总结 DS-STAR是一种专门设计用于跨异构数据格式和开放性查询的代理,能生成高质量研究报告并超越传统问答能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08456 2026-02-25 cs.CV

Improving Motion in Image-to-Video Models via Adaptive Low-Pass Guidance

通过自适应低通引导改进图像到视频模型中的运动

June Suk Choi, Kyungmin Lee, Sihyun Yu, Yisol Choi, Jinwoo Shin, Kimin Lee

机构 * KAIST(韩国科学技术院)

AI总结 本研究提出自适应低通引导方法,通过调整图像频率内容提升图像到视频生成的动态效果,同时保持图像质量和文本对齐度。

Comments Project page: http://choi403.github.io/ALG

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14719 2026-02-25 cs.RO

DiSPo: Diffusion-SSM based Policy Learning for Coarse-to-Fine Action Discretization

DiSPo:基于扩散-状态空间模型的策略学习用于粗到细动作离散化

Nayoung Oh, Jaehyeong Jang, Moonkyeong Jung, Daehyung Park

机构 * Korea Advanced Institute of Science and Technology(韩国高级科学研究院)

AI总结 DiSPo通过结合扩散-状态空间模型和步骤缩放方法,实现了高效且灵活的粗到细动作离散化学习,显著提升了成功率和推理效率。

Comments Accepted by ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏