Geometric Factual Recall in Transformers
变换器中的几何事实回忆
机构 * New York University(纽约大学) ; Flatiron Institute(Flatiron研究所)
专题命中 其他推理 :chain-of-thought(abstract);分类 cs.CL
AI总结 研究探讨了变换器模型如何通过几何方式记忆事实关联,证明嵌入维度与事实数量呈对数关系,并展示了多跳查询中的容量-深度权衡。
Comments Preprint
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
变换器中的几何事实回忆
机构 * New York University(纽约大学) ; Flatiron Institute(Flatiron研究所)
专题命中 其他推理 :chain-of-thought(abstract);分类 cs.CL
AI总结 研究探讨了变换器模型如何通过几何方式记忆事实关联,证明嵌入维度与事实数量呈对数关系,并展示了多跳查询中的容量-深度权衡。
Comments Preprint
通过答案可信度评分估计问题难度
机构 * University of Innsbruck(因斯布鲁克大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL
AI总结 本文提出Q-DAPS方法,通过计算候选答案可信度的熵来估计问题难度,在四个数据集上表现优异,具有可解释性和鲁棒性。
Comments Accepted at ACL 2026
Journal ref Proceedings of the 64rd Annual Meeting of the Association for Computational Linguistics (ACL 2026)
语言模型对谁进行对齐?在高风险竞争需求下测量主导层级
机构 * Thomson Reuters Foundational Research(汤姆森·路透基础研究) ; University of Oxford(牛津大学) ; Imperial College London(帝国理工学院伦敦分校)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 研究探讨了在高风险专业场景中语言模型如何在用户、机构权威和专业规范之间进行对齐,发现模型在任务执行中常忽视专业规范,且对齐层级在不同领域和模型间不稳定。
OmniRefine: 一种面向对齐的协作压缩方法以提高多模态大语言模型的效率
机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) ; Pengcheng Laboratory(鹏城实验室)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出OmniRefine,一种无需训练的两阶段框架,通过跨模态对齐和协作压缩提升多模态大语言模型的推理效率与性能稳定性。
原生AI资产智能
机构 * Sola Security(Sola安全)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出原生AI资产智能框架,通过结构化方法整合异构安全数据,实现一致、上下文感知和主动的资产推理。框架结合建模层和评分层,通过敏感性分析和消融研究验证其在资产优先级和安全态势推理中的有效性。
Comments 23 pages, 4 figures, 8 tables. Preprint
探测音频-视觉大语言模型中的跨模态信息枢纽
机构 * Department of Electrical Engineering, Korea Advanced Institute of Science ; The Graduate School of Advanced Imaging Science, Multimedia \& Film, Chung-Ang University, Seoul, Republic of Korea
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 本文研究了音频-视觉大语言模型中音频与视觉模态间的跨模态信息流动,发现信息主要存储在sink tokens中,并提出一种无需训练的hallucination缓解方法。
Comments Accepted by ICML 2026
当智能体过度信任环境证据:一个可扩展的智能体框架,用于基准测试LLM智能体中的证据 grounding 缺陷
机构 * The University of Sydney(悉尼大学) ; Nanjing University(南京大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出EnvTrustBench框架,用于评估智能体在环境证据过时、错误或恶意时的可靠性问题,通过生成多个任务场景并验证结果,揭示证据 grounding 是智能体可靠性的重要挑战。
通过目标层面黑客的视角探查RLVR训练不稳定性
机构 * School of Physics, Peking University(北京大学物理学院) ; Tongyi Lab(通义实验室) ; Alibaba Group(阿里巴巴集团) ; Kavli Institute for Astronomy and Astrophysics, Peking University(北京大学天文与天体物理研究院) ; National Astronomical Observatories, Chinese Academy of Sciences(中国科学院国家天文台)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 本文通过目标层面黑客视角揭示RLVR训练不稳定性的根源,分析MoE模型中训练-推理差异异常增长的机制,为设计稳定的RLVR算法提供指导。
Comments Accepted by ICML 2026
HiDream-O1-Image:一种原生统一的图像生成基础模型,具有像素级统一的Transformer
专题命中 其他推理 :reasoning(abstract)
AI总结 本文提出HiDream-O1-Image,通过像素空间扩散Transformer实现多模态输入的结构统一,无需外部VAE或离散文本编码器,提升生成和编辑任务的性能,实验表明其在多种生成任务中表现优异。
Comments Source codes and models are available at Github: https://github.com/HiDream-ai/HiDream-O1-Image and Huggingface: https://huggingface.co/HiDream-ai/HiDream-O1-Image
元宇宙并非一个独立的空间:法律、代码与数字空间的递归治理(对马克·芬莱《治理元宇宙:数字空间中的法律、秩序与自由》(2025)的评论文章)
专题命中 其他推理 :reasoning(abstract)
AI总结 本文探讨马克·芬莱对元宇宙作为社会和想象空间的治理问题,指出其核心概念“元宇宙”和“新法律”理论不足,强调治理需考虑代码、平台和法律的递归互动。
Comments Forthcoming, Journal of Law & Society (2026)