arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Southern California(南加州大学)

2025-12-30 至 2025-12-30 共收录 9
2512.23705 2025-12-30 cs.CV

Diffusion Knows Transparency: Repurposing Video Diffusion for Transparent Object Depth and Normal Estimation

扩散知道透明:将视频扩散用于透明物体深度和法线估计

Shaocong Xu, Songlin Wei, Qizhe Wei, Zheng Geng, Hong Li, Licheng Shen, Qianpu Sun, Shu Han, Bin Ma, Bohan Li, Chongjie Ye, Yuhang Zheng, Nan Wang, Saining Zhang, Hao Zhao

机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院) University of Southern California(南加州大学) Tsinghua University(清华大学) Beihang University(北航) Wuhan University(武汉大学) Shanghai Jiao Tong University(上海交通大学) European Institute of Innovation and Technology Ningbo(创新与技术欧洲研究所宁波) FNii, The Chinese University of Hong Kong, Shenzhen(FNii,香港中文大学(深圳)) National University of Singapore(新加坡国立大学)

AI总结 本文提出DKT模型,利用视频扩散模型估计透明物体的深度和法线,实现零样本SOTA,提升现实和合成视频中的透明感知性能。

Comments Project Page: https://daniellli.github.io/projects/DKT/; Code: https://github.com/Daniellli/DKT; Dataset: https://huggingface.co/datasets/Daniellesry/TransPhy3D

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23109 2025-12-30 cs.LG cs.AI stat.ML

How Much Data Is Enough? Uniform Convergence Bounds for Generative & Vision-Language Models under Low-Dimensional Structure

需要多少数据?在低维结构下生成式与视觉-语言模型的统一收敛界限

Paul M. Thompson

机构 * Stevens Institute for Neuroimaging and Informatics, University of Southern California(神经影像与信息学研究所,南加州大学)

AI总结 研究在低维结构下生成式和视觉-语言模型的统一收敛界限,探讨数据量与模型校准之间的关系。

Comments 13 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22795 2025-12-30 cs.CL cs.AI cs.LG

CNSight: Evaluation of Clinical Note Segmentation Tools

CNSight:临床笔记分段工具评估

Risha Surana, Adrian Law, Sunwoo Kim, Rishab Sridhar, Angxiao Han, Peiyu Hong

机构 * University of Southern California(南加州大学)

AI总结 CNSight评估了多种临床笔记分段工具,发现大型API模型在分段任务中表现最佳,尤其在句子级和自由文本分段上取得了较高的F1值,为后续的信息提取和自动化摘要等任务提供了基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22785 2025-12-30 q-bio.NC cs.LG

Nonlinear Dynamical Modeling of Human Intracranial Brain Activity with Flexible Inference

非线性动态建模用于人类颅内脑活动的灵活推断

Kiarash Vaziri, Lucine L. Oganesian, HyeongChan Jo, Roberto M. C. Vera, Charles Y. Liu, Brian Lee, Maryam M. Shanechi

机构 * Ming Hsieh Department of Electrical and Computer Engineering, Viterbi School of Engineering, University of Southern California(明希学院电气与计算机工程系,维特比工程学院,南加州大学) Keck School of Medicine, University of Southern California(凯克医学院,南加州大学)

AI总结 DFINE通过结合线性动态模型与非线性神经网络,有效建模多站点人类颅内脑电图动态,提升神经预测准确性并增强BCIs应用的灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12695 2025-12-30 cs.LG cs.AI cs.DC stat.ML

A Closer Look at Personalized Fine-Tuning in Heterogeneous Federated Learning

对异构联邦学习中个性化微调的深入探讨

Minghui Chen, Hrad Ghoukasian, Ruinan Jin, Zehua Wang, Sai Praneeth Karimireddy, Xiaoxiao Li

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) McMaster University(麦马斯特大学) University of Southern California(南加州大学)

AI总结 本文提出LP-FT方法,通过缓解特征扭曲来提升异构联邦学习中个性化与泛化能力的平衡,揭示了联邦特征扭曲现象并提供了部署鲁棒个性化的方法指导。

Comments 33 pages, 6 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05526 2025-12-30 cs.CV

When Deepfake Detection Meets Graph Neural Network:a Unified and Lightweight Learning Framework

当深度伪造检测遇见图神经网络:一种统一且轻量级的学习框架

Haoyu Liu, Chaoyu Gong, Mengke He, Jiate Li, Kai Han, Siqiang Luo

机构 * Nanyang Technological University(南洋理工大学) University of Southern California(南加州大学) The University of Hong Kong(香港大学)

AI总结 本文提出SSTGNN,一种统一且轻量级的深度伪造检测框架,通过图神经网络联合处理空间、时间及频谱信息,实现高效且准确的伪造检测。

Comments Accepted to KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.17381 2025-12-30 cs.LG cs.AI

Application-Driven Innovation in Machine Learning

应用驱动的机器学习创新

David Rolnick, Alan Aspuru-Guzik, Sara Beery, Bistra Dilkina, Priya L. Donti, Marzyeh Ghassemi, Hannah Kerner, Claire Monteleoni, Esther Rolf, Milind Tambe, Adam White

机构 * McGill University(麦吉尔大学) Mila -- Quebec AI Institute, Montreal, Canada(魁北克AI研究所) University of Toronto(多伦多大学) Vector Institute, Toronto, Canada(向量研究所) Massachusetts Institute of Technology, Cambridge, USA(麻省理工学院) University of Southern California, Los Angeles, USA(南加州大学) Arizona State University, Tempe, USA(亚利桑那州立大学) Inria Paris, Paris, France(巴黎研究所) University of Colorado Boulder, Boulder, USA(科罗拉多大学博尔德分校) Harvard University, Cambridge, USA(哈佛大学) University of Alberta(阿尔伯塔大学) Alberta Machine Intelligence Institute, Edmonton, Canada(阿尔伯塔人工智能研究所)

AI总结 本文探讨了应用驱动研究在机器学习中的重要性,指出其对算法创新和领域影响的潜力,并提出改进现有评估和教学实践的建议。

Comments 12 pages, 3 figures

Journal ref Published at ICML 2024 in the Position Papers track

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22626 2025-12-30 cs.CV

Envision: Embodied Visual Planning via Goal-Imagery Video Diffusion

Envision:通过目标图像视频扩散进行具身视觉规划

Yuming Gu, Yizhi Wang, Yining Hong, Yipeng Gao, Hao Jiang, Angtian Wang, Bo Liu, Nathaniel S. Dennler, Zhengfei Kuang, Hao Li, Gordon Wetzstein, Chongyang Ma

机构 * University of Southern California(南加州大学) ByteDance(字节跳动) Stanford University(斯坦福大学) Massachusetts Institute of Technology(麻省理工学院) MBZUAI

AI总结 Envision 通过目标图像视频扩散模型实现具身视觉规划,提升目标对齐和空间一致性,支持下游机器人任务。

Comments Page: https://envision-paper.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22183 2025-12-30 cs.CV cs.AI cs.CL

Unbiased Visual Reasoning with Controlled Visual Inputs

通过受控视觉输入实现无偏视觉推理

Zhaonan Li, Shijie Lu, Fei Wang, Jacob Dineen, Xiao Ye, Zhikun Xu, Siyi Liu, Young Min Cho, Bangzheng Li, Daniel Chang, Kenny Nguyen, Qizheng Yang, Muhao Chen, Ben Zhou

机构 * Arizona State University(亚利桑那州立大学) University of Southern California(南加州大学) University of Pennsylvania(宾夕法尼亚大学) University of California, Davis(加州大学戴维斯分校)

AI总结 VISTA通过解耦感知与推理,利用受控接口和强化学习训练,提升了视觉推理的鲁棒性和中立性。

详情

展开后加载摘要…

URL PDF HTML 收藏