arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Hong Kong University of Science and Technology(香港科技大学)

2025-11-25 至 2025-11-25 共收录 12
2511.19437 2025-11-25 cs.CV

LumiTex: Towards High-Fidelity PBR Texture Generation with Illumination Context

LumiTex: 向高保真PBR纹理生成迈进:基于照明上下文

Jingzhi Bao, Hongze Chen, Lingting Zhu, Chenyu Liu, Runze Zhang, Keyang Luo, Zeyu Hu, Weikai Chen, Yingda Yin, Xin Wang, Zehong Lin, Jun Zhang, Xiaoguang Han

机构 * CUHK(SZ)(香港中文大学(深圳)) HKUST(香港理工大学) HKU(香港大学) PKU(北京大学) LIGHTSPEED

AI总结 LumiTex通过结合光照上下文和几何引导的修补模块,实现了高保真的PBR纹理生成,提升了材料分解和无缝纹理完成的性能。

Comments Project page: https://lumitex.vercel.app

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19261 2025-11-25 cs.CV

LAST: LeArning to Think in Space and Time for Generalist Vision-Language Models

LAST: 为通用视觉-语言模型学习在空间和时间中的思考

Shuai Wang, Daoan Zhang, Tianyi Bai, Shitong Shao, Jiebo Luo, Jiaheng Wei

机构 * HKUST(GZ)(香港科技大学(广州)) University of Rochester(罗切斯特大学)

AI总结 LAST通过学习在空间和时间上思考,提升通用视觉-语言模型对3D空间和长视频的理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18922 2025-11-25 cs.CV

One4D: Unified 4D Generation and Reconstruction via Decoupled LoRA Control

One4D:通过解耦LoRA控制实现统一的4D生成与重建

Zhenxing Mi, Yuxin Wang, Dan Xu

机构 * The Hong Kong University of Science and Technology(香港科技大学)

AI总结 One4D通过解耦LoRA控制实现4D生成与重建的统一框架,提升视频扩散模型在几何重建中的性能

Comments Project page: https://mizhenxing.github.io/One4D

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18902 2025-11-25 cs.LG cs.AI

VADE: Variance-Aware Dynamic Sampling via Online Sample-Level Difficulty Estimation for Multimodal RL

VADE:基于在线样本级难度估计的方差感知动态采样用于多模态强化学习

Zengjie Hu, Jiantao Qiu, Tianyi Bai, Haojin Yang, Binhang Yuan, Qi Jing, Conghui He, Wentao Zhang

机构 * Peking University(北京大学) Shanghai AI Lab(上海人工智能实验室) HKUST(香港科技大学)

AI总结 VADE通过在线样本级难度估计实现方差感知动态采样,提升多模态强化学习的性能与样本效率,减少计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18834 2025-11-25 cs.CV cs.AI

FlowSteer: Guiding Few-Step Image Synthesis with Authentic Trajectories

FlowSteer: 通过真实轨迹引导少步图像合成

Lei Ke, Hubery Yin, Gongye Liu, Zhengyao Lv, Jingcai Guo, Chen Li, Wenhan Luo, Yujiu Yang, Jing Lyu

机构 * Tsinghua University(清华大学) WeChat Vision, Tencent Inc.(腾讯公司微信视觉部门) The Hong Kong University of Science and Technology(香港科学与技术大学) The University of Hong Kong(香港大学) The Hong Kong Polytechnic University(香港理工大学)

AI总结 FlowSteer通过引导学生沿教师真实生成轨迹提升ReFlow蒸馏效果,解决分布不匹配和优化调度器问题,提升少步图像合成质量。

Comments Few-Step Image Synthesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18831 2025-11-25 cs.CV

VideoCompressa: Data-Efficient Video Understanding via Joint Temporal Compression and Spatial Reconstruction

VideoCompressa: 通过联合时间压缩和空间重建实现数据高效的视频理解

Shaobo Wang, Tianle Niu, Runkang Yang, Deshan Liu, Xu He, Zichen Wen, Conghui He, Xuming Hu, Linfeng Zhang

机构 * EPIC Lab, SJTU(上海交通大学EPIC实验室) KTH(瑞典皇家理工学院) Shanghai AI Laboratory(上海人工智能实验室) HKUST(香港科技大学)

AI总结 VideoCompressa通过联合时间压缩和空间重建,实现视频数据高效合成,显著提升数据效率和模型性能。

Comments 15 pages, 6 tables, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15253 2025-11-25 cs.HC cs.AI

PresentCoach: Dual-Agent Presentation Coaching through Exemplars and Interactive Feedback

PresentCoach: 通过典范和交互反馈的双智能体演示指导

Sirui Chen, Jinsong Zhou, Xinli Xu, Xiaoyu Yang, Litao Guo, Ying-Cong Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

AI总结 PresentCoach通过双智能体系统,结合典范和交互反馈,提供高效的演示技能指导,提升学习者在教育和专业领域的表现能力。

Comments 13pages,6figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15065 2025-11-25 cs.CV cs.AI

Reasoning via Video: The First Evaluation of Video Models' Reasoning Abilities through Maze-Solving Tasks

通过视频推理:首次评估视频模型在迷宫解决任务中的推理能力

Cheng Yang, Haiyuan Wan, Yiran Peng, Xin Cheng, Zhaoyang Yu, Jiayi Zhang, Junchi Yu, Xinlei Yu, Xiawu Zheng, Dongzhan Zhou, Chenglin Wu

机构 * DeepWisdom Tsinghua University(清华大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Renmin University of China(中国人民大学) University of Oxford(牛津大学) National University of Singapore(新加坡国立大学) Xiamen University(厦门大学) Hong Kong University of Science and Technology (GuangZhou)(香港科技大学(广州))

AI总结 本文首次评估视频模型在迷宫解决任务中的推理能力,提出VR-Bench基准,展示视频生成在空间推理中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20840 2025-11-25 cs.RO cs.AI cs.MM

Learning Primitive Embodied World Models: Towards Scalable Robotic Learning

学习原始具身世界模型:迈向可扩展的机器人学习

Qiao Sun, Liujia Yang, Wei Tang, Wei Huang, Kaixin Xu, Yongchao Chen, Mingyu Liu, Jiange Yang, Haoyi Zhu, Yating Wang, Tong He, Yilun Chen, Xili Dai, Nanyang Ye, Qinying Gu

机构 * Shanghai AI Lab(上海人工智能实验室) Fudan(复旦大学) SJTU(上海交通大学) NJUST(南京理工大学) THU(清华大学) Harvard(哈佛大学) ZJU(浙江大学) NJU(南京大学) USTC(中国科学技术大学) Tongji(同济大学) HKUST (GZ)(香港科技大学(广州))

AI总结 提出原始具身世界模型(PEWM)以解决具身数据稀疏和高维问题,通过短视界视频生成实现细粒度对齐、降低学习复杂度并提高数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10353 2025-11-25 cs.CV

Motion-R1: Enhancing Motion Generation with Decomposed Chain-of-Thought and RL Binding

Motion-R1: 通过分解的链式推理与RL绑定增强运动生成

Runqi Ouyang, Haoyun Li, Zhenyuan Zhang, Xiaofeng Wang, Zeyu Zhang, Zheng Zhu, Guan Huang, Sirui Han, Xingang Wang

机构 * GigaAI CASIA HKUST(香港科技大学)

AI总结 Motion-R1通过结合分解的链式推理与强化学习,提升运动生成的质量和可解释性,实现多项指标的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06359 2025-11-25 cs.RO

Occlusion-Aware Contingency Safety-Critical Planning for Autonomous Driving

遮挡感知的应急安全关键规划用于自动驾驶

Lei Zheng, Rui Yang, Minzhe Zheng, Zengqi Peng, Michael Yu Wang, Jun Ma

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) School of Engineering(工程学院) Cheng Kar-Shun Robotics Institute(陈家顺机器人研究所)

AI总结 本文提出一种遮挡感知的应急安全关键规划方法,通过可达性分析和递推规划框架提升自动驾驶在动态遮挡环境中的安全性和效率。

Comments 14 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18572 2025-11-25 cs.CV cs.LG

GeoReasoner: Geo-localization with Reasoning in Street Views using a Large Vision-Language Model

GeoReasoner: 基于大规模视觉-语言模型的街景地理定位

Ling Li, Yu Ye, Yao Zhou, Bingchuan Jiang, Wei Zeng

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Tongji University(同济大学) Independent Researcher(独立研究者) Information Engineering University(信息工程大学)

AI总结 GeoReasoner通过整合外部知识和改进的微调方法,提升了街景地理定位的性能,优于现有模型并节省训练资源。

详情

展开后加载摘要…

URL PDF HTML 收藏