arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Cambridge(剑桥大学)

2026-08-28 至 2026-08-28 共收录 7
2608.27219 2026-08-28 cs.CL 新提交

BALMS: Benchmarking Agentic LLMs for Longitudinal Mental Health Sensing

BALMS:面向纵向心理健康感知的智能体大语言模型基准测试

Yu Yvonne Wu, Arvind Pillai, Yuliang Chen, Yuwei Zhang, Sudarshan Regmi, Tess Z. Griffin, Michael V. Heinz, Lisa A. Marsch, Nicholas C. Jacobson, Andrew Campbell

机构 * Dartmouth College(达特茅斯学院) University of Cambridge(剑桥大学)

AI总结 该研究提出首个面向纵向心理健康感知的智能体大语言模型基准BALMS,经多数据集、任务与主干评估发现零样本智能体表现有限,思维链提示有提升但存不足,凸显了对特定智能体的需求。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27115 2026-08-28 cs.CL 新提交

Cross-Lingual Alignment Without Joint Training: Do Monolingual Language Models Converge on Universal Representations?

无联合训练的跨语言对齐:单语言模型是否会收敛到通用表示?

Ej Zhou, Suchir Salhan, Catherine Arnett, Anna Korhonen

机构 * University of Cambridge(剑桥大学) EleutherAI

AI总结 该研究发现无联合训练时,单语言模型可通过语言结构和信息承载形成跨语言对齐,提出用Procrustes旋转映射模型隐藏状态,为模块化多语言系统构建提供方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26306 2026-08-28 cs.AI 新提交

Approved Too Late: Verdict Staleness in LLM-Guarded Self-Adaptive Systems

批准过迟:LLM防护的自适应系统中的裁决陈旧性

Ilai Shraga, Roei Eshel, Lior Gorelik

机构 * University of Cambridge(剑桥大学) Maccabim-Re’ut High School(马卡比姆-鲁特高中) The Open University of Israel(以色列开放大学)

AI总结 该研究针对LLM防护的自适应系统存在的裁决陈旧性问题,提出新鲜度受限防护(FBS)方法,可显著降低批准过期率,同时制定新鲜度契约规范批准的有效性。

Comments Accepted at the 2026 IEEE International Conference on Autonomic Computing and Self-Organizing Systems (ACSOS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26187 2026-08-28 cs.CL cs.AI cs.LG cs.LO 新提交

When the Canonical Completion Is Wrong: Formalizing and Measuring the Jump in Large Language Models

当规范补全出错时:大型语言模型中跃迁的形式化与测量

Dai Shi, Xiaoyu Li, José Miguel Hernández-Lobato

机构 * University of Cambridge(剑桥大学) University of New South Wales(新南威尔士大学)

AI总结 本文针对大型语言模型的“跃迁”进行形式化定义与测量,发现模型在第二步会放弃默认补全完成跃迁,更高难度失败源于推理预算或约束问题,而非回归默认,为相关争论提供了新依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26182 2026-08-28 cs.AI cs.HC cs.RO 新提交

Why did My Robot Just Change Personality? Prompting Guidelines for a Grounded Robot Persona in LLM-Based HRI

我的机器人为什么刚改变了人格?面向基于大语言模型(LLM)的人机交互(HRI)的具身机器人人格提示设计指南

Ashita Ashok, Franziska Babel, Patrick Holthaus, Rucha Khot, Karla Bransky, Fethiye Irmak Dogan, Karsten Berns, Silvia Rossi, Minha Lee, Guy Laban

机构 * RPTU Kaiserslautern(凯泽斯劳滕工业大学) Linköping University(林雪平大学) University of Hertfordshire(赫特福德大学) Eindhoven University of Technology(埃因霍温理工大学) Australian National University(澳大利亚国立大学) University of Cambridge(剑桥大学) University of Naples Federico II(那不勒斯费德里科二世大学) Ben-Gurion University of the Negev(本-古里安大学内盖夫分校) The Azrieli National Center for Autism and Neurodevelopment Research(阿兹列利国家自闭症与神经发育研究中心)

AI总结 本文针对基于LLM的HRI中机器人人格模糊等问题,提出含八个组件的提示设计框架及指南,为HRI研究提供结构化设计与报告辅助,强调提示设计需作为社会技术问题处理。

Comments Accepted for publication at the 35th IEEE International Conference on Robot and Human Interactive Communication (RO-MAN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26159 2026-08-28 cs.CL cs.AI 新提交

Self-Generated Text Recognition: Quality Heuristics, Cross-Task Transfer, and Downstream Bias in LLM Evaluation

自生成文本识别:LLM评估中的质量启发式、跨任务迁移与下游偏差

Jesse St. Amand, Callum Canavan, Sohaib Imran, Joseph Hewson, Aaron Lutz, Shi Feng, Puria Radmard, Lennie Wells

机构 * George Washington University(乔治·华盛顿大学) Geodesic Research(吉奥戴斯克研究机构) University of Cambridge(剑桥大学)

AI总结 该研究聚焦LLM的自生成文本识别(SGTR)能力,明确了导致过往研究结论分歧的实验设计因素,发现SGTR性能可跨任务迁移,且训练SGTR会引发下游偏差,强调需监控SGTR以保障AI安全。

Comments 22 pages, 9 figures (4 main body, 5 appendix), 11 tables (1 main body, 10 appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26118 2026-08-28 cs.CL 新提交

ElementCheck: Complexity-Aware Long-Form Text Factuality Evaluation via Sentence Elements

ElementCheck:基于句子元素的复杂度感知长文本事实性评估

Xinming Wang, Haoran Du, Yi Chen, Jian Xu, Hongming Yang, Han Hu, Yulong Chen, Cheng-Lin Liu, Xu-Yao Zhang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Zhongguancun Academy(中关村学院) Fudan University(复旦大学) Tencent(腾讯) University of Cambridge(剑桥大学) University of Aberdeen(阿伯丁大学)

AI总结 ElementCheck是一种基于句子元素的复杂度感知框架,通过提取实体对构建元素图,在FastFact-Sent等基准上提升了五个主干模型的长文本事实性验证性能,且优化了准确率与成本的权衡。

Comments 25 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏