Human-like Object Grouping in Self-supervised Vision Transformers
自监督视觉Transformer中的类人物体分组
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 本文通过行为基准测试,探讨自监督视觉模型在物体感知上的类人特性,发现基于DINO目标的Transformer模型在预测人类反应时间方面表现最佳,且Gram矩阵结构对感知对齐有驱动作用。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
自监督视觉Transformer中的类人物体分组
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 本文通过行为基准测试,探讨自监督视觉模型在物体感知上的类人特性,发现基于DINO目标的Transformer模型在预测人类反应时间方面表现最佳,且Gram矩阵结构对感知对齐有驱动作用。
SycoEval-EM:急诊护理模拟临床场景中大语言模型的谄媚评估
机构 * UNC Chapel Hill(UNC夏洛特山分校) ; University of Waterloo(滑铁卢大学) ; Stanford University(斯坦福大学)
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 提出SycoEval-EM多智能体模拟框架,评估19个LLM在急诊医学中对患者说服的鲁棒性,发现谄媚率呈双峰分布,静态医学基准无法预测安全表现。
Comments 19 pages, 10 figures
超越黑箱:代理AI工具使用的可解释性
机构 * Quantitative Analytics, Barclays(巴克莱证券量化分析部)
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 本文提出了一种基于稀疏自编码器(SAEs)和线性探针的机制可解释性工具包,旨在提升代理AI在长周期任务中对工具调用的可观测性和可解释性,通过分析模型内部状态来识别工具决策的关键特征,从而揭示代理失败的深层原因。
Comments 12 pages, 4 figures, 17 tables
一个提示,多种声音:在基于大语言模型的均衡中建模听众差异
机构 * Bang & Olufsen A/S, Struer, Denmark(丹麦Bang & Olufsen A/S公司,Struer) ; Department of Electronic Systems, Aalborg University(奥胡斯大学电子系统系) ; Pioneer Centre for AI, Copenhagen, Denmark(哥本哈根先锋人工智能中心)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 本文提出利用大语言模型将自然语言提示映射到均衡设置,通过上下文学习和参数高效微调技术,实现更灵活的音频均衡控制。
Comments 13 pages, 15 figures, 2 tables, Accepted for publication in the IEEE Journal of Selected Topics in Signal Processing
基于学习的自动化对抗红队测试用于大型语言模型的鲁棒性评估
机构 * Independent Researcher(独立研究者) ; Hunan University(湖南大学) ; Shenzhen Kaihong Digital Industry Development Co., Ltd.(深圳凯鸿数字产业开发有限公司) ; Central University of Finance and Economics(中央财经大学) ; Chongqing University(重庆大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Stevens Institute of Technology(斯蒂文斯理工学院) ; Cornell University(康奈尔大学) ; Oak Ridge National Laboratory(橡树岭国家实验室) ; Zhengzhou University of Light Industry(郑州轻工业大学) ; Xidian University(西安电子科技大学) ; The University of Texas at Dallas(德克萨斯大学达拉斯分校) ; AI Safety Research Lab, Institute of Advanced Computing(高级计算研究所人工智能安全研究实验室) ; University of Malaya(马来亚大学) ; Emory University(埃默里大学) ; Department of Nephrology, Affiliated Hospital of Guangdong Medical University(广东医学院附属医院肾内科)
专题命中 安全评测 :safety(abstract);分类 cs.CL
AI总结 本文提出一种学习驱动的自动化红队测试框架,用于高效发现大型语言模型的漏洞,通过元提示引导的对抗性提示生成和分层执行检测流程,在六个威胁类别中实现标准化评估,实验发现47个漏洞,包括21个高严重性失败和12种新攻击模式。
Comments ACL ARR minor revision
EvolveTool-Bench:评估LLM生成的工具库作为软件 artifact 的质量
机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Uber Technologies(优步科技公司)
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 本文提出EvolveTool-Bench,通过评估LLM生成的工具库在软件工程流程中的质量,揭示任务完成率之外的软件质量风险,强调需将工具库视为首要软件 artifact。
Comments 11 pages, 4 figures; accepted at KDD 2026 Workshop on Agentic AI Evaluation and Trustworthiness
NEST:新生编码隐写思想
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 探讨模型在无害文本中隐藏秘密推理的隐写思维链,通过分类系统评估34个模型的隐写能力极限,测量相关指标并与基线比较,发现前沿模型无法联合推理嵌入,编码能力已达标,强调持续评估隐写风险的必要性。
知识梳理:系统化大语言模型提示安全:分类法、数据集以及攻击与防御的统一评估
机构 * University of Connecticut(康涅狄格大学) ; University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) ; Independent(独立研究者)
专题命中 安全评测 :jailbreak(abstract);分类 cs.AI
AI总结 研究大语言模型提示安全问题,提出相关分类法,形式化评估元数据,发布模块化平台,通过匹配评估揭示多种因素对安全结论有重大影响,支持可重复、成本感知且基于分类法的评估。
部署后评估的聚合个体报告
专题命中 安全评测 :safety(abstract);分类 cs.CY
AI总结 针对部署后模型评估需求,提出聚合个体报告机制,依靠公众个体报告来评估系统,探讨个体经验在评估中的作用及实施流程等。
人工智能中的聋人问题:人工智能语言技术与语言权利的侵蚀
专题命中 安全评测 :trustworthy(abstract);分类 cs.CY
AI总结 探讨人工智能语言技术、手语翻译和语言获取的相互作用,指出技术存在缺陷,批判将人工智能替代口译员的框架,呼吁聋人主导培养公平包容的人工智能系统。
Journal ref Language and Law / Linguagem e Direito, Vol. 12(1), 2025, pp. 100-121
无分布偏差界以及领域知识在通过交叉验证风险估计进行模型选择学习中的作用
机构 * Mathematical Sciences Institute and France-Australia Mathematical Sciences and Interactions ANU-CNRS International Research Lab(数学科学研究所和法澳数学科学与互动ANU-CNRS国际研究实验室) ; Department of Applied Mathematics, Institute of Mathematics and Statistics, Universidade de São Paulo(应用数学系、数学与统计研究所、圣保罗大学)
专题命中 安全评测 :alignment(abstract);分类 cs.LG
AI总结 本文在经典统计学习理论中,构建通过交叉验证风险估计进行模型选择学习的通用无分布框架,建立基于VC维的偏差界,引入学习空间探讨候选模型结构对泛化的影响,通过案例和模拟研究展示其优势并提供模型选择指导。
Comments arXiv admin note: text overlap with arXiv:2109.03866
LLM 代理能力评估的统一框架
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Chongqing University of Posts and Telecommunications(重庆邮电大学) ; North China Electric Power University(华北电力大学)
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 提出一个统一框架,通过标准化配置、固定 ReAct 架构和离线设置,分离框架与环境效应,实现 LLM 代理能力的公平评估,并在 7 个基准、24 个领域、15 个模型上进行了大规模实证分析。
表面礼貌,实践错误:一个用于修复多语言孟加拉语生成中敬语失误的定制数据集
机构 * United International University(国际大学)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 本文提出了一个定制数据集BLADE,用于改进多语言孟加拉语生成中敬语处理的准确性,通过系统微调和评估领先的开源架构,如DeepSeek-8B和LLaMA-3.2-3B,以提高结构忠实度和敬语对齐度。
StatEval:大型语言模型在统计学中的综合基准
机构 * Shanghai University of Finance and Economics(上海财经大学)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 提出StatEval基准,包含10万+问题,覆盖本科到研究级统计推理,并开发TRACE管道和自适应评分方法,揭示LLM在基础任务上表现尚可但研究级推理薄弱。
规则导向的视觉语言导航:通过语义推理和几何校正弥合感知与合规性
机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; Beijing Normal University(北京师范大学) ; Guangzhou University(广州大学)
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 本文提出Rule-VLN,首个大规模城市规则合规导航基准,通过语义推理和几何校正模块提升导航安全性,实验表明该模块显著提升导航能力。
ActivityNarrated: 一种面向可穿戴人类活动理解的开放性叙事范式
机构 * DFKI Kaiserslautern(德国人工智能研究中心凯泽斯劳滕) ; RPTU(莱茵兰-普法尔茨州凯泽斯劳滕-兰道工业大学)
专题命中 安全评测 :alignment(abstract);分类 cs.LG
AI总结 本文提出一种开放性叙事范式,通过将可穿戴传感器数据与自然语言描述对齐,实现开放词汇环境下的人类活动理解,实验表明其在跨参与者评估中表现优于传统闭合集方法。
LLM如何看待创造力:具有可解释推理的视觉创造力零样本评分
机构 * Harvard University(哈佛大学) ; Pennsylvania State University(宾夕法尼亚州立大学)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 研究多模态大模型能否零样本评估视觉创造力,并分析其推理过程的可解释性。实验表明模型评分与人类高度一致,但推理并未提升评分准确性。
Comments 21 pages, 9 figures
DMind Benchmark:面向Web3领域LLM能力的全面评估
机构 * Zhejiang University(浙江大学) ; Nanyang Technological University(南洋理工大学)
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI
AI总结 提出DMind Benchmark,覆盖Web3九个子领域,结合客观知识与开放推理任务,评估31个LLM,发现模型在安全审计等高推理任务中存在显著弱点。
智能体情节控制
机构 * East China Normal University(华东师范大学) ; Tongji University(同济大学) ; Shanghai Jiao Tong University(上海交通大学) ; Shanghai University of International Business and Economics(上海对外经贸大学) ; Shenzhen Loop Area Institute(深圳河套学院)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 提出智能体情节控制(AEC),利用大语言模型增强情节强化学习,通过语义增强器和关键状态识别器提升数据效率和泛化能力,在BabyAI-Text环境中实现2-6倍数据效率提升。
Comments Accepted to Findings of the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)
OI-Bench:用于评估大语言模型对指令干扰敏感性的选项注入基准
机构 * Department of Computer Science, National Yang Ming Chiao Tung University(国家阳明交通大学计算机科学系)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 提出选项注入基准OI-Bench,通过在多选题界面中嵌入误导性指令,系统评估12个LLM对16种指令干扰的脆弱性,揭示模型存在显著漏洞。
Vis-CoT:一种用于LLM思维链推理中交互式可视化和干预的人机协同框架
专题命中 安全评测 :trustworthy(abstract);分类 cs.CL
AI总结 提出Vis-CoT框架,将线性思维链文本转换为交互式推理图,允许用户可视化逻辑流程、识别错误步骤并通过剪枝和嫁接进行干预,显著提升推理准确性和用户信任。
Comments arXiv admin note: This paper has been withdrawn by arXiv due to unverifiable authorship and affiliation
代理软件工程:基础支柱与研究路线图
机构 * Queen's University(女王大学) ; Concordia University(Concordia大学) ; Nara Institute of Science and Technology(奈ara科学和技术研究院) ; Huawei Canada(华为加拿大)
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI
AI总结 提出代理软件工程(SE 3.0)时代,以“面向人类的SE”和“面向代理的SE”双重模式为基础,重新定义软件工程支柱,并设计代理命令环境(ACE)和代理执行环境(AEE)两种工作台,实现双向人机协作,推动从代理编码到真正代理软件工程的演进。
VISTA:面向视觉规格到网页应用编码智能体的端到端基准
机构 * University of Arizona(亚利桑那大学) ; Zoom ; Stony Brook University(石溪大学)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 提出VISTA基准,通过多维度输入条件和评估指标,衡量基于LLM的智能体从视觉规格生成功能完整、视觉一致的网页应用的能力。
Comments Project page: https://kaboider.github.io/VIS_APP/
业务即规则:面向LLM的业务规则流建模基准与框架
机构 * Zhejiang University of Technology(浙江工业大学) ; Zhejiang Key Laboratory of Visual Information Intelligent Processing(浙江省视觉信息智能处理重点实验室) ; University of Aberdeen(阿伯丁大学) ; University of Birmingham(伯明翰大学)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 提出BREX基准(409份真实业务文档与2855条专家标注规则)和ExIde框架,通过可执行伪代码生成显式建模规则依赖,在13个LLM上验证了可执行接地作为归纳偏置的有效性。
CHUCKLE -- 当人类教AI学习情感的简便方式
机构 * New York Institute of Technology, Department of Computer Science(纽约理工学院计算机科学系) ; New York University, Electrical and Computer Engineering Department(纽约大学电气与计算机工程系)
专题命中 安全评测 :alignment(abstract);分类 cs.LG
AI总结 CHUCKLE提出一种基于人类感知的课程学习框架,通过众包数据集中的标注者一致性和共识定义样本难度,提升LSTM和Transformer的性能,同时减少梯度更新次数,提高训练效率和模型鲁棒性。
Journal ref Proc. Interspeech 2026, Sydney, Australia, Aug. 2026
“我说了那些我自己需要听到的话”:新加坡的同伴支持作为情感、组织和社会技术实践
机构 * Singapore University of Technology and Design(新加坡科技设计大学)
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI
AI总结 通过访谈20名新加坡同伴支持者,揭示其动机、情感劳动和社会文化维度,提出文化响应式数字工具设计方向,并探讨AI如何负责任地增强同伴支持。
Comments 20 pages, 3 tables
CareTransition-Audit:用于高效护理过渡的出院总结审计基准
机构 * Department of Computer Science \& Engineering, University of Minnesota-Twin Cities, Minneapolis, USA ; Centific AI Research, Redmond, USA
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 提出基于大语言模型的自动化框架,通过46项检查清单审计出院总结完整性,在MIMIC-IV数据集上基准测试11个模型,最佳模型与临床医生标签的Cohen's kappa约0.5,所有模型难以识别模糊文档。
Comments Accepted as a poster at IEEE-ICHI 2026; Accepted at SD4H@ICML
Omnilingual SONAR:跨语言与跨模态句子嵌入,连接大规模多语言文本与语音
机构 * FAIR at Meta(Meta的FAIR)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 提出OmniSONAR模型,通过渐进式训练和教师-学生蒸馏,在数千种语言上实现文本、语音、代码和数学表达式的统一语义嵌入,在跨语言检索和翻译任务上显著降低错误率,并支持零样本语音翻译。
TransLaw:模拟香港判例法专业翻译的大规模数据集与多智能体基准
机构 * City University of Hong Kong, Hong Kong SAR, China(香港城市大学)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 针对香港判例法英译中资源匮乏、法律术语和格式要求严格的问题,构建了首个大规模句对齐平行语料库HKCFA Judgment 97-22,并提出多智能体框架TransLaw,通过分解翻译任务、集成法律词汇库和检索增强生成,显著提升翻译质量,但仍未达到人类专家的风格自然度。
Comments Accepted at ICML 2026 - AI for Law
DeMaVLA:面向可泛化可变形物体操作的视觉-语言-动作基础模型
机构 * Tongji University(同济大学)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 提出DeMaVLA模型,采用VLM骨干与动作专家结合流匹配生成连续动作,通过剪枝Transformer层提升效率,并利用大规模真实世界数据和人类反馈数据聚合训练,实现可变形物体折叠操作的多类别泛化。
Comments 14 pages, 2 figures