arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

Apple(苹果)

2026-06-05 至 2026-06-05 共收录 2
2606.02907 2026-06-05 cs.CL cs.AI

Linear Probes Detect Task Format, Not Reasoning Mode in Language Model Hidden States

线性探针检测语言模型隐藏状态中的任务格式,而非推理模式

Subramanyam Sahoo, Vinija Jain, Aman Chadha, Divya Chaudhary

机构 * Horizon Research(远景研究) Meta Apple(苹果公司) Northeastern University(东北大学)

AI总结 通过线性探针实验发现,大语言模型隐藏状态中看似分离的推理模式实际上由任务格式(如来源、选项数、响应长度)混淆导致,而非真正的推理计算结构。

Comments Accepted in the 6th Workshop on Trustworthy NLP, ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23600 2026-06-05 cs.CL

Personality Shapes Gender Bias in Persona-Conditioned LLM Narratives Across English and Hindi: An Empirical Investigation

性格在英语和印地语中影响人物条件化大语言模型叙事中的性别偏见:一项实证研究

Tanay Kumar, Shreya Gautam, Aman Chadha, Vinija Jain, Francesco Pierri

机构 * Politecnico di Milano(米兰理工学院) Apple(苹果公司) Meta

AI总结 本研究探讨了在英语和印地语中,人物条件化大语言模型叙事中的性别偏见如何受到性格特征的影响,发现性格特质与性别偏见的幅度和方向显著相关,特别是黑暗三联体性格特质与性别刻板印象的表示更相关,但这些关联在不同模型和语言中有所变化。

详情

展开后加载摘要…

URL PDF HTML 收藏