arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Cambridge(剑桥大学)

2026-08-28 至 2026-08-28 共收录 10
2608.27219 2026-08-28 cs.CL 新提交

BALMS: Benchmarking Agentic LLMs for Longitudinal Mental Health Sensing

BALMS:面向纵向心理健康感知的智能体大语言模型基准测试

Yu Yvonne Wu, Arvind Pillai, Yuliang Chen, Yuwei Zhang, Sudarshan Regmi, Tess Z. Griffin, Michael V. Heinz, Lisa A. Marsch, Nicholas C. Jacobson, Andrew Campbell

机构 * Dartmouth College(达特茅斯学院) University of Cambridge(剑桥大学)

AI总结 该研究提出首个面向纵向心理健康感知的智能体大语言模型基准BALMS,经多数据集、任务与主干评估发现零样本智能体表现有限,思维链提示有提升但存不足,凸显了对特定智能体的需求。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27115 2026-08-28 cs.CL 新提交

Cross-Lingual Alignment Without Joint Training: Do Monolingual Language Models Converge on Universal Representations?

无联合训练的跨语言对齐:单语言模型是否会收敛到通用表示?

Ej Zhou, Suchir Salhan, Catherine Arnett, Anna Korhonen

机构 * University of Cambridge(剑桥大学) EleutherAI

AI总结 该研究发现无联合训练时,单语言模型可通过语言结构和信息承载形成跨语言对齐,提出用Procrustes旋转映射模型隐藏状态,为模块化多语言系统构建提供方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26306 2026-08-28 cs.AI 新提交

Approved Too Late: Verdict Staleness in LLM-Guarded Self-Adaptive Systems

批准过迟:LLM防护的自适应系统中的裁决陈旧性

Ilai Shraga, Roei Eshel, Lior Gorelik

机构 * University of Cambridge(剑桥大学) Maccabim-Re’ut High School(马卡比姆-鲁特高中) The Open University of Israel(以色列开放大学)

AI总结 该研究针对LLM防护的自适应系统存在的裁决陈旧性问题,提出新鲜度受限防护(FBS)方法,可显著降低批准过期率,同时制定新鲜度契约规范批准的有效性。

Comments Accepted at the 2026 IEEE International Conference on Autonomic Computing and Self-Organizing Systems (ACSOS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26187 2026-08-28 cs.CL cs.AI cs.LG cs.LO 新提交

When the Canonical Completion Is Wrong: Formalizing and Measuring the Jump in Large Language Models

当规范补全出错时:大型语言模型中跃迁的形式化与测量

Dai Shi, Xiaoyu Li, José Miguel Hernández-Lobato

机构 * University of Cambridge(剑桥大学) University of New South Wales(新南威尔士大学)

AI总结 本文针对大型语言模型的“跃迁”进行形式化定义与测量,发现模型在第二步会放弃默认补全完成跃迁,更高难度失败源于推理预算或约束问题,而非回归默认,为相关争论提供了新依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26182 2026-08-28 cs.AI cs.HC cs.RO 新提交

Why did My Robot Just Change Personality? Prompting Guidelines for a Grounded Robot Persona in LLM-Based HRI

我的机器人为什么刚改变了人格?面向基于大语言模型(LLM)的人机交互(HRI)的具身机器人人格提示设计指南

Ashita Ashok, Franziska Babel, Patrick Holthaus, Rucha Khot, Karla Bransky, Fethiye Irmak Dogan, Karsten Berns, Silvia Rossi, Minha Lee, Guy Laban

机构 * RPTU Kaiserslautern(凯泽斯劳滕工业大学) Linköping University(林雪平大学) University of Hertfordshire(赫特福德大学) Eindhoven University of Technology(埃因霍温理工大学) Australian National University(澳大利亚国立大学) University of Cambridge(剑桥大学) University of Naples Federico II(那不勒斯费德里科二世大学) Ben-Gurion University of the Negev(本-古里安大学内盖夫分校) The Azrieli National Center for Autism and Neurodevelopment Research(阿兹列利国家自闭症与神经发育研究中心)

AI总结 本文针对基于LLM的HRI中机器人人格模糊等问题,提出含八个组件的提示设计框架及指南,为HRI研究提供结构化设计与报告辅助,强调提示设计需作为社会技术问题处理。

Comments Accepted for publication at the 35th IEEE International Conference on Robot and Human Interactive Communication (RO-MAN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26159 2026-08-28 cs.CL cs.AI 新提交

Self-Generated Text Recognition: Quality Heuristics, Cross-Task Transfer, and Downstream Bias in LLM Evaluation

自生成文本识别:LLM评估中的质量启发式、跨任务迁移与下游偏差

Jesse St. Amand, Callum Canavan, Sohaib Imran, Joseph Hewson, Aaron Lutz, Shi Feng, Puria Radmard, Lennie Wells

机构 * George Washington University(乔治·华盛顿大学) Geodesic Research(吉奥戴斯克研究机构) University of Cambridge(剑桥大学)

AI总结 该研究聚焦LLM的自生成文本识别(SGTR)能力,明确了导致过往研究结论分歧的实验设计因素,发现SGTR性能可跨任务迁移,且训练SGTR会引发下游偏差,强调需监控SGTR以保障AI安全。

Comments 22 pages, 9 figures (4 main body, 5 appendix), 11 tables (1 main body, 10 appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26118 2026-08-28 cs.CL 新提交

ElementCheck: Complexity-Aware Long-Form Text Factuality Evaluation via Sentence Elements

ElementCheck:基于句子元素的复杂度感知长文本事实性评估

Xinming Wang, Haoran Du, Yi Chen, Jian Xu, Hongming Yang, Han Hu, Yulong Chen, Cheng-Lin Liu, Xu-Yao Zhang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Zhongguancun Academy(中关村学院) Fudan University(复旦大学) Tencent(腾讯) University of Cambridge(剑桥大学) University of Aberdeen(阿伯丁大学)

AI总结 ElementCheck是一种基于句子元素的复杂度感知框架,通过提取实体对构建元素图,在FastFact-Sent等基准上提升了五个主干模型的长文本事实性验证性能,且优化了准确率与成本的权衡。

Comments 25 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01942 2026-08-28 cs.CV cs.CL cs.MM 版本更新

CultureVidBench: Benchmarking Cultural Understanding in Text-to-Video Generation

CultureVidBench:文本到视频生成中的文化理解基准测试

Xianjing Han, Yuhan Su, Yang Deng, Dong Ma, Wee Peng Tay, Bin Zhu

机构 * Nanyang Technological University(南洋理工大学) Centrale Supélec(中央高等电力学院) Singapore Management University(新加坡管理大学) University of Cambridge(剑桥大学)

AI总结 本研究推出CultureVidBench基准,评估7款T2V模型的文化理解能力,发现现有模型难捕捉细粒度文化细节,尤其针对代表性不足的文化区域与线索。

Comments EMNLP 2026 Main Conference, Project page: this https URL (https://hanxjing.github.io/CultureVidBench/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08000 2026-08-28 cs.CL cs.AI 版本更新

Summarization is Not Dead Yet

摘要生成尚未消亡

Dongqi Liu, Chenxi Whitehouse, Zheng Zhao, Zhuchen Cao, Jian Li, Yabiao Wang

机构 * Saarland University(萨尔大学) Max Planck Institute for Informatics(马克斯·普朗克信息学研究所) University of Cambridge(剑桥大学) University of Edinburgh(爱丁堡大学) Zhejiang University(浙江大学) Tencent YouTu Lab(腾讯优图实验室)

AI总结 通过多维度评估,发现人类参考摘要在信息量和忠实度上仍优于大语言模型,后者仅在表面连贯性和流畅性上占优,表明摘要生成研究仍有挑战。

Comments EMNLP 2026 Main & Long Conference Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15129 2026-08-28 cs.CL cs.AI cs.HC 版本更新

The BS-meter: Detecting Politics and Labour through ChatGPT's Language

BS-计:通过ChatGPT的语言检测政治与劳工相关议题

Alessandro Trevisan, Harry Giddens, Sarah Dillon, Alan F. Blackwell

机构 * University of Cambridge(剑桥大学)

AI总结 本文对比科学文献与ChatGPT生成文本的语言特征,构建扯淡的统计模型,探究其能否关联法兰克福式人工扯淡与政治、职场语境中的自然扯淡,相关成果可用于通过ChatGPT语言检测政治与劳工议题。

Comments 17 pages, 5 figures. Accepted for publication in AI&SOCIETY

详情

展开后加载摘要…

URL PDF HTML 收藏