Native Audio-Visual Alignment for Generation
原生音视频对齐生成
机构 * ERNIE Team, Baidu Inc.(百度公司ERNIE团队)
AI总结 提出NAVA框架,通过原生音视频对齐和上下文条件联合去噪,实现高质量、同步且可控的音视频生成。
Comments Project page: https://ernie-research.github.io/NAVA/
大厂专区
原生音视频对齐生成
机构 * ERNIE Team, Baidu Inc.(百度公司ERNIE团队)
AI总结 提出NAVA框架,通过原生音视频对齐和上下文条件联合去噪,实现高质量、同步且可控的音视频生成。
Comments Project page: https://ernie-research.github.io/NAVA/
RAISE:将RAG设计视为架构搜索问题
机构 * City University of Hong Kong(香港城市大学) ; Baidu Inc.(百度公司)
AI总结 本文提出将检索增强生成(RAG)系统的设计选择形式化为架构搜索问题,并构建RAISE框架和基准,通过标准化搜索空间和预算评估13种优化算法在7个数据集上的表现,发现优化性能高度依赖任务。
ActTraitBench: 通过人类行为验证量化大型语言模型中的知识-决策差距
机构 * Peking University(北京大学) ; Baidu Inc(百度公司)
AI总结 提出ActTraitBench框架,基于人类数据建立心理测量方面与行为范式的一一映射,并通过分位数映射校准LLM评分分布,揭示LLM在自我报告与行为决策之间的知识-决策差距,并引入CoCA干预来缓解该差距。
面向情感支持对话的用户感知主动知识获取
机构 * Harbin Institute of Technology, China(哈尔滨工业大学) ; Baidu Inc., Beijing, China(百度公司)
AI总结 提出用户感知主动知识获取(UKA)框架,通过理论心智不确定性估计和主动学习,在情感支持对话中高效获取用户对齐的对话知识,提升对话质量和用户对齐。
PassNet: 为图编译器通生成扩展大型语言模型
机构 * Baidu, Inc.(百度公司)
AI总结 针对编译器默认优化在长尾子图上性能不佳的问题,提出PassNet生态系统,包含大规模数据集和基准测试,通过微调小模型在少量轨迹上即可接近前沿模型性能。
Comments Code and data available at https://github.com/PaddlePaddle/PassNet
Code-QA-Bench:在仓库级问答中分离代码推理与文档记忆
机构 * Baidu Inc(百度公司)
AI总结 提出Code-QA-Bench框架,通过答案优先生成和三条件实验设计,自动构建仓库级代码理解基准,以区分代码推理、文档回忆和预训练记忆的影响。
加速GPU上的稀疏Transformer推理
机构 * SSSLab, Dept. of CST China University of Petroleum-Beijing Beijing China(SSSLab,计算机科学与技术系中国石油大学(北京)北京中国) ; Baidu Inc. Beijing China(百度公司北京中国) ; School of Computer Science Shanghai Jiao Tong University Shanghai China(计算机科学学院上海交通大学上海中国) ; China University of Petroleum-Beijing Beihang University Beijing China(中国石油大学(北京)北京航空航天大学北京中国) ; China University of Petroleum-Beijing(中国石油大学(北京)) ; Beihang University(北京航空航天大学) ; Baidu Inc.(百度公司) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 针对稀疏Transformer推理加速问题,提出STOF框架,通过分析建模将多头注意力映射为行式或块式核并采用独特存储格式,结合两阶段搜索的算子融合方案,在GPU上实现高达1.6倍的多头注意力计算加速和1.4倍的端到端推理加速。