arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

Carnegie Mellon University(卡内基梅隆大学)

2026-02-13 至 2026-02-13 共收录 13
2602.12271 2026-02-13 cs.CV cs.LG

MonarchRT: Efficient Attention for Real-Time Video Generation

MonarchRT:实时视频生成中的高效注意力机制

Krish Agarwal, Zhuoming Chen, Cheng Luo, Yongqi Chen, Haizhong Zheng, Xun Huang, Atri Rudra, Beidi Chen

机构 * Carnegie Mellon University(卡内基梅隆大学) University at Buffalo(布法罗大学) Morpheus AI

AI总结 MonarchRT通过结构化注意力参数化方法,实现高效实时视频生成,达到95%的注意力稀疏性,优于现有内核性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10078 2026-02-13 cs.SD cs.LG

Improving Speech Emotion Recognition with Mutual Information Regularized Generative Model

通过互信息正则化生成模型改进语音情感识别

Chung-Soo Ahn, Rajib Rana, Sunil Sivadas, Carlos Busso, Jagath C. Rajapakse

机构 * College of Computing and Data Science at Nanyang Technological University(南洋理工大学计算机与数据科学学院) University of Southern Queensland(南方昆士兰大学) NCS Group(NCS集团) Language Technologies Institute, School of Computer Science, Carnegie Mellon University(计算机科学学院语言技术研究所,卡内基梅隆大学)

AI总结 本文提出了一种基于互信息正则化的生成模型,通过跨模态对齐和特征合成提升语音情感识别的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11609 2026-02-13 cs.AI q-bio.GN

scPilot: Large Language Model Reasoning Toward Automated Single-Cell Analysis and Discovery

scPilot:面向自动化单细胞分析与发现的大型语言模型推理

Yiming Gao, Zhen Wang, Jefferson Chen, Mark Antkowiak, Mengzhou Hu, JungHo Kong, Dexter Pratt, Jieyuan Liu, Enze Ma, Zhiting Hu, Eric P. Xing

机构 * UC San Diego(UC圣地亚哥大学) MBZUAI CMU(卡内基梅隆大学) Texas A&M(德克萨斯A&M大学)

AI总结 scPilot通过组学原生推理提升单细胞分析的准确性与可解释性,实现自动化细胞类型注释和轨迹重建。

Comments Accepted at NeurIPS 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11374 2026-02-13 cs.LG cs.AI

Retrieval-Aware Distillation for Transformer-SSM Hybrids

面向检索的蒸馏:Transformer-SSM混合模型

Aviv Bick, Eric P. Xing, Albert Gu

机构 * Carnegie Mellon University(卡内基梅隆大学) MBZUAI(穆斯林人工智能研究院) Cartesia AI(Cartesia人工智能)

AI总结 本文提出检索感知蒸馏方法,通过保留关键注意力头并蒸馏其余头部,实现更高效的Transformer-SSM混合模型,显著降低内存消耗并提升检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11342 2026-02-13 cs.HC cs.AI

Situated, Dynamic, and Subjective: Envisioning the Design of Theory-of-Mind-Enabled Everyday AI with Industry Practitioners

情境化、动态化和主观化:与行业从业者共同展望具有理论思维能力的日常人工智能设计

Qiaosi Wang, Jini Kim, Avanita Sharma, Alicia, Lee, Jodi Forlizzi, Hong Shen

机构 * Human-Computer Interaction Institute(人机交互研究所) School of Design(设计学院) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文通过与行业从业者协同设计,提出具有理论思维能力的日常AI应具备情境化、动态化和主观化三大设计原则,以支持持续的人机交互。

Comments 16 pages, preprint for ACM CHI 2026 Conference

Journal ref Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems (CHI '26), April 13--17, 2026, Barcelona, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11242 2026-02-13 cs.CV

ReTracing: An Archaeological Approach Through Body, Machine, and Generative Systems

ReTracing:通过身体、机器和生成系统进行考古学研究

Yitong Wang, Yue Yao

机构 * Department of Machine Learning(机器学习系) Carnegie Mellon University(卡内基梅隆大学) SIPA Technology Policy and Innovation(技术政策与创新研究所) Columbia University(哥伦比亚大学)

AI总结 ReTracing通过AI、人类和机器人互动,探索生成系统如何通过编舞运动反映社会文化偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11176 2026-02-13 cs.CL cs.AI cs.CE cs.LG

Evaluating Few-Shot Temporal Reasoning of LLMs for Human Activity Prediction in Smart Environments

评估LLM在智能环境中的少样本时间推理用于人类活动预测

Maral Doctorarastoo, Katherine A. Flanigan, Mario Bergés, Christopher McComb

机构 * organization= Department of Civil \& Environmental Engineering, Carnegie Mellon University , addressline= 5000 Forbes Ave , city= Pittsburgh , state= PA , postcode= 15213 , country= USA organization= Department of Mechanical Engineering, Carnegie Mellon University , addressline= 5000 Forbes Ave , city= Pittsburgh , state= PA , postcode= 15213 , country= USA

AI总结 本文研究了预训练语言模型在智能环境中的少样本时间推理能力,通过评估其在人类活动预测中的表现,发现其在低数据环境下具备强大的时间理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09013 2026-02-13 cs.RO cs.CV

Dexterous Manipulation Policies from RGB Human Videos via 3D Hand-Object Trajectory Reconstruction

通过3D手-物体轨迹重建从RGB人类视频中学习灵巧操作策略

Hongyi Chen, Tony Dong, Tiancheng Wu, Liquan Wang, Yash Jangir, Yaru Niu, Yufei Ye, Homanga Bharadhwaj, Zackory Erickson, Jeffrey Ichnowski

机构 * Carnegie Mellon University(卡内基梅隆大学) Georgia Institute of Technology(佐治亚理工学院) Stanford University(斯坦福大学)

AI总结 VIDEOMANIP通过3D手-物体轨迹重建从RGB视频直接学习灵巧操作策略,实现无需设备的高效训练和高成功率抓取

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15926 2026-02-13 cs.LG cs.CL cs.CY

DSO: Direct Steering Optimization for Bias Mitigation

DSO:直接转向优化以减轻偏差

Lucas Monteiro Paes, Nivedha Sivakumar, Yinong Oliver Wang, Masha Fedzechkina, Barry-John Theobald, Luca Zappella, Nicholas Apostoloff

机构 * Apple(苹果公司) Carnegie Mellon University(卡内基梅隆大学)

AI总结 DSO通过强化学习优化激活转换,在VLMs和LLMs中实现公平性与能力的最佳平衡,提供推理时的偏见控制能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23276 2026-02-13 cs.CL

A Cocktail-Party Benchmark: Multi-Modal dataset and Comparative Evaluation Results

宴会派对基准:多模态数据集和比较评估结果

Thai-Binh Nguyen, Katerina Zmolikova, Pingchuan Ma, Ngoc Quan Pham, Christian Fuegen, Alexander Waibel

机构 * Karlsruhe Institute of Technology, Germany(卡尔斯鲁厄理工学院) Carnegie Mellon University, USA(卡内基梅隆大学) Interactive-AI LLC(Interactive-AI公司) Meta AI, UK(Meta AI)

AI总结 本文提出多模态上下文感知识别任务,通过结合音频和视觉线索提升重叠对话识别性能,展示多模态在解决宴会派对问题中的关键作用。

Comments Accepted at ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03728 2026-02-13 cs.SD cs.LG eess.AS eess.SP

Lightweight and Generalizable Acoustic Scene Representations via Contrastive Fine-Tuning and Distillation

通过对比微调和蒸馏实现轻量且通用的声学场景表示

Kuang Yuan, Yang Gao, Xilin Li, Xinhao Mei, Syavosh Zadissa, Tarun Pruthi, Saeed Bagheri Sereshki

机构 * Meta Reality Labs(Meta现实实验室) Carnegie Mellon University(卡内基梅隆大学)

AI总结 ContrastASC通过对比微调和蒸馏实现轻量且通用的声学场景表示,提升少样本适应能力的同时保持闭合集性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17061 2026-02-13 cs.MA cs.AI cs.IR

Parallelism Meets Adaptiveness: Scalable Documents Understanding in Multi-Agent LLM Systems

并行与适应性:多智能体大语言模型系统中的可扩展文档理解

Chengxuan Xia, Qianye Wu, Sixuan Tian, Yilun Hao

机构 * University of California, Santa Cruz(加州大学圣克ruz分校) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出一种多智能体大语言模型系统协调框架,通过动态任务路由、双向反馈和并行评估机制,提升文档理解的适应性和效率。

Comments Accepted at AAAI 2026 Workshop on WoMAPF, Camera ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10793 2026-02-13 cs.SD cs.HC cs.LG eess.AS

SonicSieve: Bringing Directional Speech Extraction to Smartphones Using Acoustic Microstructures

SonicSieve:利用声学微结构在智能手机上实现定向语音提取

Kuang Yuan, Yifeng Wang, Xiyuxing Zhang, Chengyi Shen, Swarun Kumar, Justin Chan

机构 * Carnegie Mellon University(卡内基梅隆大学) Tsinghua University(清华大学) Zhejiang University(浙江大学)

AI总结 SonicSieve通过生物启发式声学微结构在智能手机上实现定向语音提取,提升信号质量并优于传统麦克风阵列。

详情

展开后加载摘要…

URL PDF HTML 收藏