arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Stanford University(斯坦福大学)

2026-02-19 至 2026-02-19 共收录 10
2602.16687 2026-02-19 cs.SD cs.CL eess.AS

Scaling Open Discrete Audio Foundation Models with Interleaved Semantic, Acoustic, and Text Tokens

通过交错语义、音频和文本标记扩展开放离散音频基础模型

Potsawee Manakul, Woody Haosheng Gan, Martijn Bartelds, Guangzhi Sun, William Held, Diyi Yang

机构 * Stanford University(斯坦福大学) University of Southern California(南加州大学) University of Cambridge(剑桥大学)

AI总结 本文提出SODA模型,通过交错语义、音频和文本标记扩展开放离散音频基础模型,实现通用音频生成和跨模态能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16664 2026-02-19 cs.CV

Unpaired Image-to-Image Translation via a Self-Supervised Semantic Bridge

无配对图像到图像翻译的自监督语义桥

Jiaming Liu, Felix Petersen, Yunhe Gao, Yabin Zhang, Hyojin Kim, Akshay S. Chaudhari, Yu Sun, Stefano Ermon, Sergios Gatidis

机构 * Stanford University(斯坦福大学) LLNL(劳伦斯利弗莫尔国家实验室) Johns Hopkins University(约翰霍普金斯大学)

AI总结 本文提出自监督语义桥框架,通过整合外部语义先验实现无配对图像到图像翻译的高保真度,提升医学图像合成效果。

Comments 36 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00074 2026-02-19 cs.AI cs.CL cs.LG

Language and Experience: A Computational Model of Social Learning in Complex Tasks

语言与经验:复杂任务中的社会学习计算模型

Cédric Colas, Tracey Mills, Ben Prystawski, Michael Henry Tessler, Noah Goodman, Jacob Andreas, Joshua Tenenbaum

机构 * MIT(麻省理工学院) Stanford University(斯坦福大学) Google DeepMind(谷歌DeepMind)

AI总结 本文提出了一种计算模型,通过结合语言指导与直接经验,模拟复杂任务中的社会学习过程,并展示了人类与模型之间的知识传递机制。

Comments Code: github.com/ccolas/language_and_experience Demo: cedriccolas.com/demos/language_and_experience

Journal ref ICLR 2026; CogSci 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.04536 2026-02-19 cs.CL cs.AI cs.LG

Evaluating Language Model Agency through Negotiations

通过谈判评估语言模型的代理能力

Tim R. Davidson, Veniamin Veselovsky, Martin Josifoski, Maxime Peyrard, Antoine Bosselut, Michal Kosinski, Robert West

机构 * EPFL(瑞士联邦理工学院) UGA(普罗万大学) CNRS(法国国家科学研究中心) LIG(里莫恩-盖朗实验室) Stanford University(斯坦福大学)

AI总结 通过谈判游戏评估语言模型的代理能力,发现封闭源模型更擅长完成任务,合作谈判游戏最具挑战性,且强模型可能输给弱对手。

Comments Accepted to ICLR 2024, code and link to project data are made available at https://github.com/epfl-dlab/LAMEN

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16313 2026-02-19 cs.CL

MemoryArena: Benchmarking Agent Memory in Interdependent Multi-Session Agentic Tasks

MemoryArena:评估多会话代理任务中的代理记忆

Zexue He, Yu Wang, Churan Zhi, Yuanzhe Hu, Tzu-Ping Chen, Lang Yin, Ze Chen, Tong Arthur Wu, Siru Ouyang, Zihan Wang, Jiaxin Pei, Julian McAuley, Yejin Choi, Alex Pentland

机构 * Stanford University(斯坦福大学) Princeton University(普林斯顿大学) University of Pittsburgh(匹兹堡大学)

AI总结 MemoryArena是一个用于评估多会话代理任务中代理记忆的统一评估环境,揭示了现有长上下文记忆基准在代理任务中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16182 2026-02-19 cs.RO

World Model Failure Classification and Anomaly Detection for Autonomous Inspection

自主检测机器人的世界模型故障分类与异常检测

Michelle Ho, Muhammad Fadhil Ginting, Isaac R. Ward, Andrzej Reinke, Mykel J. Kochenderfer, Ali-akbar Agha-Mohammadi, Shayegan Omidshafiei

机构 * Stanford University(斯坦福大学) Field AI

AI总结 本文提出了一种结合监督分类与异常检测的混合框架,用于自主检测任务中的故障分类和异常检测,实现了超过90%的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16050 2026-02-19 cs.AI cs.CL

Evidence-Grounded Subspecialty Reasoning: Evaluating a Curated Clinical Intelligence Layer on the 2025 Endocrinology Board-Style Examination

基于证据的专科推理:在2025年内分泌学委员会式考试上评估一个经过精心编纂的临床智能层

Amir Hosseinian, MohammadReza Zare Shahneh, Umer Mansoor, Gilbert Szeto, Kirill Karlin, Nima Aghaeepour

机构 * January AI Stanford University(斯坦福大学)

AI总结 本文提出基于证据的专科推理系统Mirror,在内分泌学考试中超越了现有LLM,展现出高准确率和证据可追溯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16008 2026-02-19 cs.SD cs.AI cs.CL cs.LG

MAEB: Massive Audio Embedding Benchmark

MAEB:大规模音频嵌入基准

Adnan El Assadi, Isaac Chung, Chenghao Xiao, Roman Solomatin, Animesh Jha, Rahul Chand, Silky Singh, Kaitlyn Wang, Ali Sartaz Khan, Marc Moussa Nasser, Sufen Fong, Pengfei He, Alan Xiao, Ayush Sunil Munot, Aditya Shrivastava, Artem Gazizov, Niklas Muennighoff, Kenneth Enevoldsen

机构 * Carleton University(卡尔顿大学) Durham University(杜伦大学) Stanford University(斯坦福大学) Aarhus University(奥胡斯大学) Indian Institute of Technology, Kharagpur(印度理工学院,卡里格普) Harvard University(哈佛大学)

AI总结 MAEB是一个涵盖多语言音频任务的基准,揭示了不同模型在音频与语言任务上的性能差异,展示了音频编码器在跨模态任务中的表现关联性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15870 2026-02-19 cs.CL

VDLM: Variable Diffusion LMs via Robust Latent-to-Text Rendering

VDLM: 通过鲁棒的潜在到文本渲染实现变量扩散语言模型

Shuhui Qu

机构 * Stanford University(斯坦福大学)

AI总结 VDLM通过分离语义规划与文本渲染,利用嵌入空间后训练和鲁棒解码技术,在扩散语言模型中实现更高效的多步推理和长形式生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12281 2026-02-19 cs.RO cs.AI cs.SY eess.SY

Scaling Verification Can Be More Effective than Scaling Policy Learning for Vision-Language-Action Alignment

在视觉-语言-动作对齐中,验证比策略学习更具效率

Jacky Kwok, Xilun Zhang, Mengdi Xu, Yuejiang Liu, Azalia Mirhoseini, Chelsea Finn, Marco Pavone

机构 * Stanford University(斯坦福大学) NVIDIA Research(NVIDIA研究)

AI总结 本文提出CoVer-VLA验证方法,通过测试时验证在视觉-语言-动作对齐中实现22%的在分布和13%的分布外收益,同时在现实世界实验中进一步提升45%。

详情

展开后加载摘要…

URL PDF HTML 收藏