MonarchRT: Efficient Attention for Real-Time Video Generation
MonarchRT:实时视频生成中的高效注意力机制
机构 * Carnegie Mellon University(卡内基梅隆大学) ; University at Buffalo(布法罗大学) ; Morpheus AI
AI总结 MonarchRT通过结构化注意力参数化方法,实现高效实时视频生成,达到95%的注意力稀疏性,优于现有内核性能。
高校专区
MonarchRT:实时视频生成中的高效注意力机制
机构 * Carnegie Mellon University(卡内基梅隆大学) ; University at Buffalo(布法罗大学) ; Morpheus AI
AI总结 MonarchRT通过结构化注意力参数化方法,实现高效实时视频生成,达到95%的注意力稀疏性,优于现有内核性能。
通过互信息正则化生成模型改进语音情感识别
机构 * College of Computing and Data Science at Nanyang Technological University(南洋理工大学计算机与数据科学学院) ; University of Southern Queensland(南方昆士兰大学) ; NCS Group(NCS集团) ; Language Technologies Institute, School of Computer Science, Carnegie Mellon University(计算机科学学院语言技术研究所,卡内基梅隆大学)
AI总结 本文提出了一种基于互信息正则化的生成模型,通过跨模态对齐和特征合成提升语音情感识别的性能。
scPilot:面向自动化单细胞分析与发现的大型语言模型推理
机构 * UC San Diego(UC圣地亚哥大学) ; MBZUAI ; CMU(卡内基梅隆大学) ; Texas A&M(德克萨斯A&M大学)
AI总结 scPilot通过组学原生推理提升单细胞分析的准确性与可解释性,实现自动化细胞类型注释和轨迹重建。
Comments Accepted at NeurIPS 2025 Main Conference
面向检索的蒸馏:Transformer-SSM混合模型
机构 * Carnegie Mellon University(卡内基梅隆大学) ; MBZUAI(穆斯林人工智能研究院) ; Cartesia AI(Cartesia人工智能)
AI总结 本文提出检索感知蒸馏方法,通过保留关键注意力头并蒸馏其余头部,实现更高效的Transformer-SSM混合模型,显著降低内存消耗并提升检索性能。
情境化、动态化和主观化:与行业从业者共同展望具有理论思维能力的日常人工智能设计
机构 * Human-Computer Interaction Institute(人机交互研究所) ; School of Design(设计学院) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 本文通过与行业从业者协同设计,提出具有理论思维能力的日常AI应具备情境化、动态化和主观化三大设计原则,以支持持续的人机交互。
Comments 16 pages, preprint for ACM CHI 2026 Conference
Journal ref Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems (CHI '26), April 13--17, 2026, Barcelona, Spain
ReTracing:通过身体、机器和生成系统进行考古学研究
机构 * Department of Machine Learning(机器学习系) ; Carnegie Mellon University(卡内基梅隆大学) ; SIPA Technology Policy and Innovation(技术政策与创新研究所) ; Columbia University(哥伦比亚大学)
AI总结 ReTracing通过AI、人类和机器人互动,探索生成系统如何通过编舞运动反映社会文化偏见。
评估LLM在智能环境中的少样本时间推理用于人类活动预测
机构 * organization= Department of Civil \& Environmental Engineering, Carnegie Mellon University , addressline= 5000 Forbes Ave , city= Pittsburgh , state= PA , postcode= 15213 , country= USA ; organization= Department of Mechanical Engineering, Carnegie Mellon University , addressline= 5000 Forbes Ave , city= Pittsburgh , state= PA , postcode= 15213 , country= USA
AI总结 本文研究了预训练语言模型在智能环境中的少样本时间推理能力,通过评估其在人类活动预测中的表现,发现其在低数据环境下具备强大的时间理解能力。
通过3D手-物体轨迹重建从RGB人类视频中学习灵巧操作策略
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Georgia Institute of Technology(佐治亚理工学院) ; Stanford University(斯坦福大学)
AI总结 VIDEOMANIP通过3D手-物体轨迹重建从RGB视频直接学习灵巧操作策略,实现无需设备的高效训练和高成功率抓取
DSO:直接转向优化以减轻偏差
机构 * Apple(苹果公司) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 DSO通过强化学习优化激活转换,在VLMs和LLMs中实现公平性与能力的最佳平衡,提供推理时的偏见控制能力。
宴会派对基准:多模态数据集和比较评估结果
机构 * Karlsruhe Institute of Technology, Germany(卡尔斯鲁厄理工学院) ; Carnegie Mellon University, USA(卡内基梅隆大学) ; Interactive-AI LLC(Interactive-AI公司) ; Meta AI, UK(Meta AI)
AI总结 本文提出多模态上下文感知识别任务,通过结合音频和视觉线索提升重叠对话识别性能,展示多模态在解决宴会派对问题中的关键作用。
Comments Accepted at ICASSP 2026
通过对比微调和蒸馏实现轻量且通用的声学场景表示
机构 * Meta Reality Labs(Meta现实实验室) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 ContrastASC通过对比微调和蒸馏实现轻量且通用的声学场景表示,提升少样本适应能力的同时保持闭合集性能。
并行与适应性:多智能体大语言模型系统中的可扩展文档理解
机构 * University of California, Santa Cruz(加州大学圣克ruz分校) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 本文提出一种多智能体大语言模型系统协调框架,通过动态任务路由、双向反馈和并行评估机制,提升文档理解的适应性和效率。
Comments Accepted at AAAI 2026 Workshop on WoMAPF, Camera ready version
SonicSieve:利用声学微结构在智能手机上实现定向语音提取
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Tsinghua University(清华大学) ; Zhejiang University(浙江大学)
AI总结 SonicSieve通过生物启发式声学微结构在智能手机上实现定向语音提取,提升信号质量并优于传统麦克风阵列。