On the use of foundation models in cognitive science
基础模型在认知科学中的应用
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 本文针对将基础模型作为认知模型的挑战,提出四阶段推理框架,明确连接假设作用,强调行为对齐需结合理论承诺等才具科学意义。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
基础模型在认知科学中的应用
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 本文针对将基础模型作为认知模型的挑战,提出四阶段推理框架,明确连接假设作用,强调行为对齐需结合理论承诺等才具科学意义。
SurveyReview:面向综述评估者的审稿人对齐基准
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 针对现有LLM评估综述未与人类审稿人对齐的问题,提出SurveyReview基准及SurveyAlign基线,大幅提升自动评估与人类审稿人的对齐程度,为该领域提供参考。
CMU-Drive与V2V-VLA:具备推理能力的协同多智能体统一驾驶基准及车对车视觉-语言-动作模型
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 本文提出协同多智能体统一驾驶基准CMU-Drive及车对车视觉-语言-动作模型V2V-VLA,解决现有VLA模型缺乏协同能力的问题,构建了协同自动驾驶研究的首个基准并将相关资源开源。
面向厘米级洪水深度估计的、由机械可解释性引导的视觉-语言模型选择性微调
专题命中 安全评测 :alignment(abstract);分类 cs.LG
AI总结 该研究针对城市洪水缺乏厘米级实时深度估计的问题,提出三种视觉-语言模型,通过机械可解释性分析确定关键交叉注意力层进行选择性微调,在合成与真实基准测试中均实现高精度洪水深度估计,大幅减少可训练参数。
Comments This Paper is accepted in International Conference on Machine Learning and Application (ICMLA) 2026
MetaSpace:面向具身智能体空间认知的变形测试
机构 * Hong Kong University of Science and Technology(香港科技大学)
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 MetaSpace是评估具身智能体空间认知的框架,基于变形测试原则生成测试用例,在三个场景中检测到SOTA MLLM驱动智能体的90422个空间认知错误,其SC分数远低于人类基准。
Comments 30 pages, 17 figures. Published in Proceedings of the ACM on Programming Languages (OOPSLA1)
Journal ref Proceedings of the ACM on Programming Languages, 10, OOPSLA1 (April 2026), 343-372
法官知道自己何时知晓:基于大语言模型的A/B测试预测的校准弃权(不执行)
专题命中 安全评测 :trustworthy(abstract);分类 cs.CL
AI总结 该研究探究多模态LLM能否仅通过网页截图预测A/B测试结果,发现Gemini 3 Flash法官表现不佳,提出投票边际关卡隔离置信判断可提升性能,还在人类中重现了共识与真实结果脱节的现象,并发布了相关研究资源。
Comments 15 pages. Pre-registered experimental program with a public, tiered claims ledger; includes powered negative results, a label-validity audit, a cross-judge shared-prior measurement (n_eff ~ 2 of 16 votes), and a first-party 15-expert human baseline. Pre-registrations, statistical harness, human responses, and the full experiment ledger are released
开放权重AI模型风险管理中的开放技术问题
专题命中 安全评测 :safety(abstract);分类 cs.CY
AI总结 本文指出开放权重AI模型风险管理存在16项涉及多环节的技术挑战,强调相关研究需兼顾开放性,以实现其益处并减轻危害。
Comments Published in Transactions on Machine Learning Research (03/2026) Reviewed on OpenReview: https: // openreview. net/ forum? id= 8QyGLnFkzc
通过部分信息分解理解多模态语言模型中的模态交互
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 引入部分信息分解(PID)框架,分离感官和语言输入的独特、冗余和协同贡献,揭示多模态大模型中的模态使用模式,并扩展至三模态系统。
Comments Accepted by ICML 2026
PortBench: 一种相关性感知的、全流水线的LLM驱动投资组合管理基准
机构 * Yantai Research Institute of Harbin Engineering University(哈尔滨工程大学烟台研究院) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 提出PortBench基准,通过静态QA和动态五阶段分配流水线评估LLM在投资组合管理中的表现,发现多数模型无法超越等权重分配,且存在推理错误累积和压力下大幅回撤的问题。
Comments Project page: https://portbench.github.io/
理解并缓解过早自信以提升大语言模型推理能力
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Tsinghua University(清华大学)
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 针对大语言模型长思维链中逻辑跳跃和过早自信问题,提出渐进式自信塑造强化学习目标,无需外部标签或奖励模型,通过奖励逐步自信增长并惩罚过早承诺,显著提升推理准确性和质量。
Med-CRAFT:通过知识图谱遍历自动构建可解释的多跳视频工作负载
机构 * Beijing Institute of Technology(北京理工大学) ; The Hong Kong Polytechnic University(香港理工大学) ; Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 Med-CRAFT通过知识图谱遍历自动构建可解释的多跳视频工作负载,生成具有细粒度时间选择性和多跳逻辑复杂性的医疗视频推理基准。
Comments 23 pages, 4 figures, 10 tables
MirrorWorld:利用视频扩散模型生成镜像反射
专题命中 安全评测 :alignment(abstract);分类 cs.LG
AI总结 MirrorWorld是一种反射感知视频修复框架,通过语义关系蒸馏和几何变换对齐建模场景与镜像的关系,在视频镜像反射重建任务上优于现有方法。
Comments Project Page: https://youjunzhao.github.io/MirrorWorld/
面向决策与智能体AI的因果数据管理生态系统
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI
AI总结 本文针对AI生态系统决策混杂问题,提出构建共享可查询的因果世界系统(CWS),为面向决策与智能体AI的因果数据管理生态系统提供支持。
Comments Accepted at ACM AI Leadership Summit 2026
长时程智能体轨迹归因:统一基准与细粒度标注框架
机构 * Huawei Technologies Ltd.(华为技术有限公司)
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 针对现有智能体轨迹基准缺乏细粒度归因分析支持的问题,提出轨迹归因任务,构建含1300余条标注轨迹的统一基准与标注框架,定义两项评估任务并发布可复用标注技能。
Comments 17 pages, 4 figures, 7 tables
我该如何为我的机器人选择基础模型?支持社会机器人的社区评估框架
机构 * Honda Research Institute Japan(本田研究所日本分部) ; University of Cambridge(剑桥大学)
专题命中 安全评测 :safety(abstract);分类 cs.CL
AI总结 针对社会机器人选择基础模型的难题,本文提出三层评估漏斗范式,梳理五个评估维度的适用评估方法,呼吁社区共建评估框架。
Comments 5 pages, 1 figure, 1 table. Accepted at the FoRMA workshop (Foundation Models in the RO-MAN Age: Responsible Development for Social Robotics) at IEEE RO-MAN 2026, Kitakyushu, Japan. Workshop homepage: https://sites.google.com/cam.ac.uk/forma/
用于认知扭曲检测的多视角三元组交互图神经网络
机构 * Gachon University(嘉泉大学) ; Yonsei University(延世大学)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 针对现有认知扭曲检测方法忽略扭曲思维心理结构的问题,提出MTI-GNN模型,在多数据集上验证其性能优于基线模型及生成模型,且各视角均有效。
TA-RAG:将语气感知作为检索增强生成的设计要务
机构 * Swinburne University of Technology(斯威本科技大学)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 该研究针对标准RAG系统存在的语境脱耦问题,提出TA-RAG框架,将交流对齐与事实准确性并列为核心设计目标,明确语气感知是高风险语境下RAG系统的设计要务。
视界差距:长视界大语言模型智能体的规划、记忆、执行、训练与评估
机构 * DeepGrounding(深地研究机构) ; AlphaAvatar(阿尔法 Avatar 公司)
专题命中 安全评测 :safety(abstract);分类 cs.CL
AI总结 本文提出长视界大语言模型智能体存在的视界差距,调研1547篇相关论文,厘清长视界等属性,分析领域应对措施并提出开放测量问题。
Comments 39 pages, 6 figures
三维医学基础模型能看穿MRI伪影吗?一项关于表示鲁棒性的对照研究
机构 * Pioneer Centre for AI, University of Copenhagen(哥本哈根大学先锋人工智能中心)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 本文对照评估五种三维医学基础模型的表示鲁棒性,发现其鲁棒性与模型及伪影类型相关,部分模型对伪影更敏感,仅靠大规模预训练无法保证伪影不变性,需部署前评估鲁棒性。
Comments Accepted at the ECCV 2026 Workshop on Artificial Intelligence for Medical 3D Vision (AI4M3D)
CLARA:通过结果分析澄清自然语言癌症基因组学查询中的语言歧义
专题命中 安全评测 :safety(abstract);分类 cs.LG
AI总结 本研究提出CLARA框架,通过将自然语言癌症基因组学查询转为带类型的科学查询规范,执行多种解释并在结果分歧时澄清,在基准测试中展现出良好的歧义区分能力,揭示了安全与负担的权衡。
Comments Preprint of an article submitted for consideration in the Pacific Symposium on Biocomputing (PSB 2027). Copyright 2026 World Scientific Publishing Company. https://psb.stanford.edu/
大的、明亮的还是不可见的:3D CT基础模型的冻结特征基准测试
机构 * Technical University of Munich (TUM)(慕尼黑工业大学(TUM)) ; TUM University Hospital(慕尼黑工业大学医院) ; Imperial College London(伦敦帝国理工学院) ; Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) ; UKE Hamburg(汉堡大学医院)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 本研究对10个冻结CT编码器开展基准测试,发现性能主要取决于异常的对比度与空间范围,小型低对比度病变仍是挑战,需区域或病变级预训练。
ChainClaw:一种用于可靠链上执行的分层智能体框架
机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, Beihang University(北京航空航天大学未来区块链与隐私计算高精尖创新中心) ; Beihang University(北京航空航天大学) ; School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) ; School of Mathematical Sciences, Beihang University(北京航空航天大学数学科学学院) ; Zhongguancun Laboratory(中关村实验室)
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 ChainClaw是基于OpenClaw的分层区块链原生智能体框架,通过三层架构解决链上执行的反应性、不可逆性和可观测性缺口,在自建基准上的安全性和任务完成度均优于代表性基线。
Comments 8 pages,3 figures
不同扰动,不同机制:理解用于零样本方言鲁棒性的持续预训练
机构 * University of Notre Dame(圣母大学)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 本研究针对大型语言模型,系统对比6种训练条件下的6种扰动持续预训练策略,发现字符噪声CPT可提升零样本方言鲁棒性且保留标准性能,不同策略的鲁棒机制存在差异,为相关策略选择提供指导。
基于教学适宜性指数评估和改进基于大语言模型(LLM)的AI导师的教学适配性
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 该研究提出教学适宜性指数(PSI)评估LLM导师的教学适配性,评估4类LLM并发现PSI引导的反馈可显著提升弱表现案例的适配性。
Comments This paper has already been accepted and presented at the IEEE 27th International Conference on Information Reuse and Integration for Data Science (IRI 2026) from July 31 to August 2, 2026, in Seattle, WA, USA
抽象事件因果规则:归纳与应用
机构 * School of Electronic Information and Communications, Huazhong University of Science and Technology(华中科技大学电子信息与通信学院)
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI
AI总结 本研究针对现有实例级因果对泛化缺陷,提出抽象事件因果规则(AECR)及相关归纳系统,构建知识库并设计 AR-GCAE 模型注入 AECR,在 CGEP 任务中提升了事件因果推理与预测性能,尤其对稀有未见样本效果显著。
RESPClinBench:呼吸专科医疗中的多模态临床决策与纵向疾病管理基准测试
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Macau University of Science and Technology(澳门科技大学) ; First Affiliated Hospital of Guangzhou Medical University(广州医科大学附属第一医院) ; Guangzhou Institute of Respiratory Health(广州呼吸健康研究院)
专题命中 安全评测 :safety(abstract);分类 cs.CL
AI总结 该研究开发了呼吸专科多模态临床决策与纵向疾病管理基准RESPClinBench,在两个数据集上评估7种大模型,识别模型在肺结节评估和COPD管理的局限,为模型选择提供临床依据。
SkillCorpus:整合与评估面向现实世界大语言模型智能体的开放技能生态系统
专题命中 安全评测 :safety(abstract);分类 cs.CL
AI总结 研究针对大语言模型智能体技能文件碎片化等问题,提出SkillCorpus框架,通过多阶段管道过滤技能并与检索选择堆栈配对,经多基准端到端评估,整合该框架能带来一致收益,明确了其对实际智能体任务的作用边界。
EvoMap背后:表征一个自进化的智能体间协作网络
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI
AI总结 通过分析EvoMap网络中的150万资产和12.8万智能体,揭示其设计选择在可重用性、演化和可审计性方面的权衡,发现奖励机制导致98%资产未被重用、评分系统易被操纵以及验证机制存在缺陷。
深度研究代理能否检索和组织?通过专家分类法评估合成差距
机构 * Fudan University(复旦大学) ; Hunyuan Team, Tencent(腾讯 Hunyuan 团队)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 本文提出TaxoBench基准,评估深度研究代理在检索和组织论文方面的能力,发现两者在能力与对齐方面均存在瓶颈。
临床输入引导前沿AI模型做出准确和有害的决策
专题命中 安全评测 :safety(abstract);分类 cs.LG
AI总结 研究评估了临床输入如何影响AI模型在诊断生成和下一步建议中的表现,发现专家上下文显著提升诊断准确性,而对抗性上下文导致诊断退化,且模型在多轮对话中表现出不同的特性。