Proxy Compression for Language Modeling
代理压缩用于语言建模
机构 * University of Hong Kong(香港大学)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG
AI总结 本文提出代理压缩方法,通过联合训练原始字节序列和压缩视图,提升语言模型训练效率,并在代码建模中显著优于纯字节级基线。
Comments ICML 2026
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
代理压缩用于语言建模
机构 * University of Hong Kong(香港大学)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG
AI总结 本文提出代理压缩方法,通过联合训练原始字节序列和压缩视图,提升语言模型训练效率,并在代码建模中显著优于纯字节级基线。
Comments ICML 2026
大型语言模型的维度意图保真度评估:基于结构化提示消融的证据
机构 * Huizhou Lateni AI Technology Co., Ltd.(惠州拉提尼人工智能技术有限公司) ; Huizhou University(惠州大学)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 本文提出一种维度意图保真度评估框架,通过2880个跨三语言、三任务领域和六种LLM的结构化提示消融研究,分别衡量结构恢复和意图保真度,揭示了系统性的结构保真度分裂,并证明了维度保真度评分比整体评分更可靠。
Comments Preprint. 30 tasks, 3 languages, 6 LLMs, 2,880 outputs; includes human evaluation and structured prompt ablation
Vibe Code Bench:评估AI模型在端到端Web应用开发中的表现
机构 * Massachusetts Institute of Technology(麻省理工学院)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 本文提出Vibe Code Bench,通过100个Web应用规格和964个浏览器工作流评估AI模型在端到端应用开发中的性能,揭示了可靠开发仍为前沿挑战,并提出评估协议和人类对齐研究。
Comments 23 pages, 8 figures. Accepted to ACM CAIS 2026. Live leaderboard: https://www.vals.ai/benchmarks/vibe-code. Benchmark first released Nov 2025
相位记忆网络:用于可扩展显式记忆的稳定反向传播通过时间
机构 * College of Pharmacy(药学院) ; Chungnam National University(Chungnam国立大学) ; Department of Computer Science & Engineering(计算机科学与工程系)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG
AI总结 本文提出Phasor Memory Network,通过相位动力学和分层可学习锚点解决显式记忆的稳定性问题,实验证明其在Copy-Paste任务中达到高精确度,且在参数规模上超越了Mamba模型。
VERA-MH概念论文
机构 * Spring Health ; Yale University School of Medicine(耶鲁大学医学院)
专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.CY
AI总结 VERA-MH旨在通过自动化评估AI聊天机器人在心理健康中的安全性,尤其关注自杀风险。该系统利用用户代理和判断代理进行模拟对话评分,已初步测试了GPT-5、Claude Opus和Claude Sonnet。
Qwen-Scope:将稀疏特征转化为大语言模型的开发工具
机构 * Qwen Team(Qwen团队)
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.LG
AI总结 Qwen-Scope通过稀疏自编码器为大语言模型提供开发工具,支持推理引导、评估分析、数据驱动工作流和训练优化,展示了SAEs在模型诊断与改进中的实用性。
VERDI:基于验证的LLM裁判的单次调用置信度估计方法
机构 * Indeed Inc(Indeed公司)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG
AI总结 VERDI通过分解推理过程提取置信度信号,无需额外调用,提升验证型LLM裁判的可信度评估。
Comments 16 pages, 6 figures
评估失败的标度定律:为什么简单的平均在数据稀疏性和项目难度差异下崩溃,以及项目响应理论如何在不同领域中恢复真实值
机构 * Independent Researcher(独立研究员)
专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG
AI总结 本文研究了简单平均在数据稀疏性和项目难度差异下导致评估排名失真问题,通过模拟实验展示了项目响应理论(IRT)在不同领域中保持高排名相关性的能力。
Comments 15 pages, 4 tables, 1 figure. Code at https://github.com/testofschool/evaluation-failure-scaling-law
基于扰动观测的黑盒大语言模型规划器鲁棒性表征:适应性压力测试
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI
AI总结 本文研究了在扰动观测下大语言模型规划器的鲁棒性,提出适应性压力测试方法,通过蒙特卡洛树搜索高效搜索提示扰动空间,发现导致模型高不确定或崩溃的场景和配置。
Comments Accepted to ACL Findings 2026; 31 pages, 26 figures, 6 tables
共识采样用于更安全的生成式AI
机构 * OpenAI ; MIT(麻省理工学院) ; Tel Aviv University(特拉维夫大学)
专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG
AI总结 本文提出共识采样算法,通过聚合多个概率分布提升生成模型安全性,其在保证安全性的前提下有效避免分歧,通过R-鲁棒性理论保障信息泄露和对抗影响的界限,实验验证了其在合成分布和图像生成中的有效性。
一种通过Weisfeiler-Leman着色系统生成图XAI基准的方法
机构 * Department of Computer Science, University of Pisa(意大利比萨大学计算机科学系)
专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG
AI总结 本文提出一种自动化生成图XAI基准的方法,利用Weisfeiler-Leman算法提取子图特征,构建了OpenGraphXAI基准集,用于评估图解释器的有效性。
Journal ref Data Mining and Knowledge Discovery, vol. 40(4), article no. 42 (2026)
在视觉-语言模型中可靠性在哪里存在:注意力、隐藏状态和因果回路的机制研究
机构 * UC Santa Barbara(加州大学圣巴巴拉分校) ; UC Berkeley(加州大学伯克利分校) ; NVIDIA(英伟达) ; Algoverse AI Research(Algoverse人工智能研究) ; Brown University(布朗大学)
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG
AI总结 本文通过机制性研究发现,视觉-语言模型的可靠性主要体现在隐藏状态几何、分层边际形成和稀疏晚层回路,而非注意力图的锐度。
Comments 15 pages, 4 figures, 10 tables. Accepted at the ICLR 2026 Workshop on Multimodal Reasoning. Code and probe-training pipelines: https://github.com/itsloganmann/VLM-Reliability-Probe
TRACE:基于可问责引用证据的旅游推荐
机构 * UNSW Sydney(新南威尔士大学悉尼分校) ; University of Adelaide(阿德莱德大学) ; Yonsei University(延世大学) ; USTC(中国科学技术大学)
专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI
AI总结 TRACE通过多轮对话结合评论引用和显式拒绝机制,解决旅游推荐中信任、可验证性和适应性问题,提出三项能力差距并验证评估方法。
文本恐怖谷:LLM信息检索中的非单调性能退化
机构 * University of Chicago(芝加哥大学) ; Northwestern University(西北大学)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 研究探讨了文本碎片化对LLM信息检索性能的影响,发现性能呈现U型曲线,提出模式过渡假说解释LLM在不同文本状态下的工作模式变化。
Comments 18 pages, 9 figures
当常规聊天变得有毒:个性化代理中无意的长期状态污染
机构 * The Hong Kong Polytechnic University(香港理工大学) ; Hong Kong University of Science and Technology, HKUST (Guangzhou)(香港科学与技术大学(广州))
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.LG
AI总结 研究探讨了个性化代理中因常规交互导致的长期状态污染问题,提出ULSPB基准和Harm Score指标,并通过StateGuard防御机制降低安全风险。
Comments 23 pages
DeEscalWild:一个用于自动缓和训练的现实世界基准数据集
机构 * Department of Computer Science and Engineering(计算机科学与工程系) ; Department of Industrial, Manufacturing, and Systems Engineering(工业、制造与系统工程系) ; University of Texas at Arlington(德克萨斯大学阿灵顿分校)
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI
AI总结 本文提出DeEscalWild基准数据集,通过多阶段流程从公开视频库中提取真实警察与平民互动数据,用于训练小型语言模型的缓和任务,实验表明经过该数据微调的SLMs在多个指标上优于基线模型。
Comments 20 pages
DOGMA: 将结构信息编织进数据导向的单细胞转录组学分析
机构 * Department of Computer Science, Beijing Institute of Technology(北京理工大学计算机科学系) ; The Hong Kong University of Science and Technology (GZ)(香港科学与技术大学(广州))
专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 DOGMA通过多级生物先验知识对原始数据进行结构重塑和语义增强,结合统计对齐和细胞本体学,提升细胞图谱的生物基础性和跨物种对齐能力。
Comments 34 pages, 4 figures
图自监督学习在现实世界噪声中的鲁棒性:基于文本驱动的生物医学图的案例研究
机构 * National Institute of Informatics(国家信息研究所) ; Institute of Science Tokyo(东京科学研究所)
专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 本文研究了图自监督学习在现实世界噪声下的鲁棒性,提出NATD-GSSL框架,通过对比噪声图与清洁图评估方法,发现关系重建对噪声敏感而特征重建更鲁棒,GNN架构对噪声也有显著影响。
数据集、开发者和模型如何影响低资源语言中的偏见?:孟加拉语的案例
机构 * Department of Computer Science University of Toronto Toronto Ontario Canada(计算机科学系多伦多大学多伦多安大略加拿大) ; Faculty of Information University of Toronto Toronto Ontario Canada(信息学院多伦多大学多伦多安大略加拿大) ; Department of Information Science University of Colorado Boulder Boulder Colorado United States(信息科学系科罗拉多大学波德 Boulder科罗拉多美国) ; University of Toronto(多伦多大学) ; University of Colorado Boulder(科罗拉多大学波德)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.CY
AI总结 本文研究了孟加拉语中基于性别、宗教和国籍身份的偏见问题,通过分析mBERT和BanglaBERT模型发现,尽管语义内容相似,但模型仍存在偏见,揭示了算法审计中方法论和数据来源的重要性。
在语言模型中通过代理实现自动化可解释性和特征发现
机构 * Harvard University(哈佛大学)
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI
AI总结 本文提出一个自主多代理框架,用于自动化大型语言模型的内部特征发现与解释,通过两个耦合循环提升解释精度和可验证性。
欧盟人工智能法案所排除的治理:自主AI代理在智能城市关键基础设施中的问责制
机构 * Higher Colleges of Technology(高等技术学院) ; Central Michigan University(中央密歇根大学)
专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.CY
AI总结 本文探讨了欧盟人工智能法案在智能城市关键基础设施中自主AI代理问责制的不足,提出AgentGov-SC治理架构以弥补监管空白。
Comments 24 pages, 3 figures, 8 tables. Submitted to Computer Law & Security Review
TRIP-Evaluate: 一个用于评估交通领域大模型的开放多模态基准
机构 * School of Transportation(交通学院) ; Southeast University(东南大学) ; School of Artificial Intelligence and Computer Science(人工智能与计算机科学学院) ; Jiangnan University(江南大学) ; Department of Civil and Environmental Engineering(土木与环境工程系) ; Hong Kong Polytechnic University(香港理工大学)
专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG
AI总结 TRIP-Evaluate是首个开放多模态交通评估基准,通过837项任务覆盖车辆、交通管理、旅行者和规划设计功能,提供能力、模态和难度标签,支持跨模态诊断,揭示大模型在多步工程计算、规则约束推理和多模态场景理解方面的不足。
Comments 19 pages, 12 figures
2026 年人工智能与机器学习在智能制造中的路线图
机构 * Center for Industrial Artificial Intelligence, Department of Mechanical Engineering, University of Maryland, College Park(工业人工智能中心,机械工程系,马里兰大学College Park分校) ; Department of Management, Economics and Industrial Engineering, Politecnico di Milano(管理、经济与工业工程系,米兰理工学院) ; Department of Industrial and Systems Engineering, The Hong Kong Polytechnic University(工业与系统工程系,香港理工大学) ; Centre for Advanced Manufacturing & Supply Chains, World Economic Forum(先进制造与供应链研究中心,世界经济论坛) ; Department of Mechanical Engineering, Indian Institute of Technology Indore(机械工程系,印度理工学院Indore分校) ; Future Information Innovative College, Fudan University(未来信息创新学院,复旦大学) ; Department of Mechanical Engineering, Seoul National University(机械工程系,首尔国立大学) ; Department of Mechanical and Information Engineering, University of Seoul(机械与信息工程系,首尔大学) ; Onepredict Corp.(Onepredict公司) ; School of Mechanical and Aerospace Engineering, Nanyang Technological University(机械与航空航天工程学院,南洋理工大学) ; Singapore Centre for 3D Printing, Nanyang Technological University(新加坡3D打印中心,南洋理工大学) ; Mechanical Engineering, Purdue University(机械工程系,普渡大学) ; Digital Twin International Research Center, International Institute for Interdisciplinary and Frontiers, Beihang University(数字孪生国际研究中心, interdisciplinary and Frontiers 国际研究院,北京航空航天大学) ; School of Automation Science and Electrical Engineering, Beihang University(自动化科学与电气工程学院,北京航空航天大学) ; Department of Engineering, University of Cambridge(工程系,剑桥大学) ; Center for Advanced Manufacturing, University of Southern California(先进制造中心,南加州大学) ; School of Sustainability Engineering and Environmental Engineering, Purdue University(可持续工程与环境工程系,普渡大学) ; School of Mechanical Engineering, Sungkyunkwan University(机械工程系,全南大学) ; Intelligent Maintenance and Operations Systems, EPFL(智能维护与运营系统,苏黎世联邦理工学院) ; Department of Mechanical Engineering, Massachusetts Institute of Technology(机械工程系,麻省理工学院) ; J. Mike Walker ’66 Department of Mechanical Engineering, Texas A&M University(J. Mike Walker ’66 机械工程系,德克萨斯A&M大学) ; Department of Mechanical and Process Engineering, ETH Zürich(机械与工艺工程系,苏黎世联邦理工学院)
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG
AI总结 本文探讨人工智能与机器学习在智能制造中的发展现状与未来方向,涵盖基础理论、应用领域及新兴技术,旨在推动创新与产业应用。
Comments This paper has been accepted for publication in the Journal Machine Learning: Engineering
稀疏字典学习在机制可解释性中的统一理论:分段双凸性与虚假极值
机构 * National University of Singapore(新加坡国立大学) ; Indian Institute of Technology, Dhanbad(印度德里理工学院) ; Chinese University of Hong Kong(香港中文大学) ; Hong Kong University of Science and Technology(香港科学与技术大学) ; Peking University(北京大学)
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG
AI总结 本文提出稀疏字典学习的统一理论,揭示其分段双凸性及虚假极值问题,通过线性表示基准揭示路径学,提出特征锚定技术提升特征恢复性能。
D3-Gym:构建现实世界可验证环境用于数据驱动发现
机构 * The Ohio State University(俄亥俄州立大学) ; Cisco Research(思科研究)
专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 D3-Gym通过构建首个自动化的可验证环境数据集,提升科学数据驱动发现的模型能力,验证信号质量高,训练效果显著。
任务表述对大语言模型中假设的影响
机构 * AI.DA STC ST Engineering(AI.DA STC ST工程)
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI
AI总结 研究探讨了任务表述如何导致大语言模型产生假设,影响其适应能力,通过囚徒困境实验发现中性表述可减少假设影响。
Taxon: 基于语义对齐的LLM专家指导的层级税码预测
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Alibaba Group(阿里巴巴集团) ; Guangdong Laboratory of Artificial Intelligence and Digital Economy (Shenzhen)(广东人工智能与数字经济实验室(深圳))
专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 本文提出Taxon框架,通过语义对齐和专家指导实现层级税码预测,结合多专家架构和语义一致性模型,在实际业务中提升准确性与鲁棒性。
人工智能风险仓库:人工智能风险的全面元综述、数据库和分类
机构 * MIT AI Risk Initiative(麻省理工学院人工智能风险倡议)
专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG
AI总结 本文构建了首个公开可访问的人工智能风险数据库,通过系统综述和专家咨询,分类了777个风险,涵盖因果因素和领域分类,为协调管理AI风险提供基础。
Journal ref Patterns 101517 (2026)
Woosh:一种声音效果基础模型
机构 * Sony AI(索尼人工智能)
专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 本文介绍了Sony AI发布的Woosh声音效果基础模型,提供高质量音频编码器/解码器、文本-音频对齐模型及文本到音频和视频到音频生成模型,展示了其在公开和私有数据上的竞争力。
从独白到广场:基于去中心化辩论的记忆增强型LLM代理用于优化建模
机构 * Antai College of Economics and Management(上海交通大学安泰经济管理学院) ; University of Chicago Booth School of Business(芝加哥大学布斯商学院) ; The Chinese University of Hong Kong, Shenzhen (CUHK-Shenzhen)(香港中文大学(深圳)) ; School of Economics and Management(清华大学经济管理学院)
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG
AI总结 本文提出Agora-Opt框架,结合去中心化辩论与读写记忆库,实现优化建模的模块化代理系统,通过去中心化辩论协议实现多代理团队的协同优化,提升建模可靠性。
Comments Working Paper