arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Washington(华盛顿大学)

2025-12-19 至 2025-12-19 共收录 5
2512.16853 2025-12-19 cs.CV cs.AI

GenEval 2: Addressing Benchmark Drift in Text-to-Image Evaluation

GenEval 2:解决文本到图像评估中的基准漂移问题

Amita Kamath, Kai-Wei Chang, Ranjay Krishna, Luke Zettlemoyer, Yushi Hu, Marjan Ghazvininejad

机构 * FAIR at Meta(Meta 的 FAIR 部门) University of Washington(华盛顿大学) University of California, Los Angeles(洛杉矶大学) Allen Institute for AI(人工智能研究院)

AI总结 GenEval 2通过改进的视觉概念覆盖和组合性,解决文本到图像评估中的基准漂移问题,提供更符合人类判断的评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16842 2025-12-19 cs.CV cs.AI cs.RO

OPENTOUCH: Bringing Full-Hand Touch to Real-World Interaction

OPENTOUCH:将全手触觉带入现实世界交互

Yuxin Ray Song, Jinzhou Li, Rao Fu, Devin Murphy, Kaichen Zhou, Rishi Shiv, Yaqi Li, Haoyu Xiong, Crystal Elaine Owens, Yilun Du, Yiyue Luo, Xianyi Cheng, Antonio Torralba, Wojciech Matusik, Paul Pu Liang

机构 * MIT(麻省理工学院) Duke University(杜克大学) Brown University(布朗大学) University of Washington(华盛顿大学) Harvard University(哈佛大学)

AI总结 OpenTouch是首个现实场景的第一人称全手触觉数据集,通过同步视频-触觉-姿态数据和详细注释,推动多模态感知和机器人操作研究。

Comments https://opentouch-tactile.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08697 2025-12-19 cs.SE cs.AI cs.CL

BigCodeArena: Unveiling More Reliable Human Preferences in Code Generation via Execution

BigCodeArena: 通过执行揭示更多可靠的代码生成人类偏好

Terry Yue Zhuo, Xiaolong Jin, Hange Liu, Juyong Jiang, Tianyang Liu, Chen Gong, Bhupesh Bishnoi, Vaisakhi Mishra, Marek Suppa, Noah Ziems, Saiteja Utpala, Ming Xu, Guangyu Song, Kaixin Li, Yuhan Cao, Bo Liu, Zheng Liu, Sabina Abdurakhmanova, Wenhao Yu, Mengzhao Jia, Jihan Yao, Kenneth Hamilton, Kumar Shridhar, Minh Chien Vu, Dingmin Wang, Jiawei Liu, Zijian Wang, Qian Liu, Binyuan Hui, Meg Risdal, Ahsen Khaliq, Atin Sood, Zhenchang Xing, Wasi Uddin Ahmad, John Grundy, David Lo, Banghua Zhu, Xiaoning Du, Torsten Scholak, Leandro von Werra

机构 * Monash University(墨尔本大学) CSIRO’s Data61(CSIRO的数据61) Purdue University(普渡大学) Independent(独立) HKUST (Guangzhou)(香港科技大学(广州)) UCSD(加州大学圣地亚哥分校) UVA(弗吉尼亚大学) CNRS, France(法国国家科学研究中心) IBM Cisco(思科) Comenius University in Bratislava(布拉提斯拉瓦康门纽斯大学) University of Notre Dame(Notre Dame大学) Uber Tano Labs(Tano实验室) NUS(国立大学新加坡) Institute of Automation, CAS(中国科学院自动化研究所) Tencent AI Lab(腾讯AI实验室) University of Washington(华盛顿大学) Nevsky Collective(Nevsky集体) ETH Zurich(苏黎世联邦理工学院) Detomo Inc(Detomo公司) University of Oxford(牛津大学) UIUC(伊利诺伊大学香槟分校) Google(谷歌) NVIDIA Singapore Management University(新加坡管理学院) ServiceNow Research(ServiceNow研究) Hugging Face

AI总结 BigCodeArena通过执行揭示更多可靠的代码生成人类偏好,提出自动评分基准评估LLM编码质量。

Comments Built with love by the BigCode community :)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16000 2025-12-19 cs.IT cs.LG math.AP math.DS math.IT

Information theory and discriminative sampling for model discovery

信息论与判别采样用于模型发现

Yuxuan Bao, J. Nathan Kutz

机构 * Department of Applied Mathematics, University of Washington(应用数学系,华盛顿大学) Department of Electrical and Computer Engineering, University of Washington(电气与计算机工程系,华盛顿大学)

AI总结 本文通过信息论与判别采样方法,提升数据驱动模型发现的效率和性能,优化采样策略以减少数据需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11900 2025-12-19 cs.CL

Finding Flawed Fictions: Evaluating Complex Reasoning in Language Models via Plot Hole Detection

寻找有缺陷的虚构作品:通过情节漏洞检测评估语言模型的复杂推理

Kabir Ahuja, Melanie Sclar, Yulia Tsvetkov

机构 * Paul G. Allen Center for Computer Science & Engineering(保罗·G·艾伦计算机科学与工程中心) University of Washington(华盛顿大学)

AI总结 本研究提出通过情节漏洞检测评估语言模型的复杂推理能力,发现先进模型在检测漏洞时表现不佳,且生成故事易引入漏洞。

Comments CoLM 2025 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏