Optimal Deterministic Multicalibration and Omniprediction
最优确定性多校准与全预测
机构 * University of Pennsylvania(宾夕法尼亚大学)
专题命中 安全评测 :trustworthy(abstract);分类 cs.LG
AI总结 本文提出一种确定性算法,实现多校准的极小化最优样本复杂度,并推广到结果不可区分性,解决确定性预测器是否必要的问题。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
最优确定性多校准与全预测
机构 * University of Pennsylvania(宾夕法尼亚大学)
专题命中 安全评测 :trustworthy(abstract);分类 cs.LG
AI总结 本文提出一种确定性算法,实现多校准的极小化最优样本复杂度,并推广到结果不可区分性,解决确定性预测器是否必要的问题。
CareTransition-Audit:用于高效护理过渡的出院总结审计基准
机构 * Department of Computer Science \& Engineering, University of Minnesota-Twin Cities, Minneapolis, USA ; Centific AI Research, Redmond, USA
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 提出基于大语言模型的自动化框架,通过46项检查清单审计出院总结完整性,在MIMIC-IV数据集上基准测试11个模型,最佳模型与临床医生标签的Cohen's kappa约0.5,所有模型难以识别模糊文档。
Comments Accepted as a poster at IEEE-ICHI 2026; Accepted at SD4H@ICML
Omnilingual SONAR:跨语言与跨模态句子嵌入,连接大规模多语言文本与语音
机构 * FAIR at Meta(Meta的FAIR)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 提出OmniSONAR模型,通过渐进式训练和教师-学生蒸馏,在数千种语言上实现文本、语音、代码和数学表达式的统一语义嵌入,在跨语言检索和翻译任务上显著降低错误率,并支持零样本语音翻译。
TransLaw:模拟香港判例法专业翻译的大规模数据集与多智能体基准
机构 * City University of Hong Kong, Hong Kong SAR, China(香港城市大学)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 针对香港判例法英译中资源匮乏、法律术语和格式要求严格的问题,构建了首个大规模句对齐平行语料库HKCFA Judgment 97-22,并提出多智能体框架TransLaw,通过分解翻译任务、集成法律词汇库和检索增强生成,显著提升翻译质量,但仍未达到人类专家的风格自然度。
Comments Accepted at ICML 2026 - AI for Law
通过正-无标签学习量化与审计大语言模型评估
机构 * Department of Mathematics and Statistics(数学与统计学系) ; Georgia State University(佐治亚州立大学) ; Department of Statistics(统计学系) ; University of Manitoba(曼尼托巴大学)
专题命中 安全评测 :alignment(abstract);分类 cs.LG
AI总结 针对大语言模型作为评估者存在的系统性偏差(如冗长偏好),提出基于部分最优传输的几何审计框架,利用少量人工验证正样本校正偏差,无需重训练即可提升与人类偏好的一致性。
RECOM:开放式 Reddit 问答中自动评估指标的有效性与区分性权衡
机构 * University of Alabama Huntsville(阿拉巴马大学亨茨维尔分校) ; University of North Alabama(北阿拉巴马大学) ; Stanford University(斯坦福大学) ; Meta AI ; Amazon GenAI(亚马逊生成人工智能)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 提出 RECOM 数据集,发现自动评估指标在开放式问答中无法同时兼顾有效性和区分性,余弦相似度有效性高但区分性差,BERTScore 区分性受长度影响且有效性弱。
SAMA:面向统一低资源多模态信息抽取的语义锚定对齐增强
机构 * School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 提出语义锚定对齐增强框架SAMA,通过构建结构化语义锚引导多专家多模态大模型生成高保真文本,并利用锚保留扩散机制合成图像,结合双约束过滤模块,在低资源多模态信息抽取任务中显著提升性能。
Comments Accepted by IEEE Transactions on Multimedia
SafeClawBench: 区分工具使用LLM代理中的语义、审计证据和沙箱危害
机构 * Peking University(北京大学) ; Beijing Jiaotong University(北京交通大学) ; SUIBE(上海外国语大学) ; Huawei(华为) ; Tsinghua University(清华大学)
专题命中 安全评测 :prompt injection(abstract);分类 cs.AI
AI总结 提出SafeClawBench基准,通过三个独立端点(语义攻击接受、审计可见危害证据、沙箱观察危害)评估工具使用LLM代理的安全性,揭示不同失败模式并支持可复现比较。
Comments 32 pages, 5 figures
理解和测量LLM行为中的认知萎缩
机构 * York University(约克大学) ; Vector Institute(向量研究所) ; Rotman Research Institute(罗特曼研究学院) ; Dalhousie University(达尔豪斯大学) ; Centre for Addiction & Mental Health(成瘾与心理健康中心) ; KITE Research Institute(KITE研究机构)
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 针对LLM在心理健康支持中缺乏过程行为评估的问题,提出认知萎缩概念及基准,通过临床标注和专家评估揭示模型普遍存在中度至高度萎缩行为。
LiveStarPro: 具有分层记忆的主动式流视频理解用于长时域流
机构 * IEEE
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 提出LiveStarPro,通过流验证解码、流因果注意力掩码和树结构分层记忆三个组件,实现长时域流媒体视频的主动理解,在语义正确性和时序误差上分别提升28.9%和降低18.2%。
使用认知模型改进语言模型对人类说服博弈的模拟
机构 * Princeton University(普林斯顿大学)
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 提出方程到行为提示和强化学习方法,使语言模型匹配认知模型(如贝叶斯更新、动机推理),在说服博弈中提升模拟人类决策多样性的能力。
基于基础模型编排工作流的代理辅助行人保护设计
机构 * Honda Motor Co., Ltd.(本田汽车有限公司)
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 提出首个基础模型编排的碰撞安全设计工作流,集成代理模型、多目标进化搜索、几何生成器和自然语言接口,将行人保护评估时间从数小时降至秒级。
Journal ref ICLR 2026 Workshop The 2nd Workshop on Foundation Models for Science
教育中的LLM作为评判者:基于课程标准的评分流水线
机构 * NSW Department of Education(新南威尔士州教育部) ; South Australian Department for Education(南澳大利亚州教育部) ; OC Selective exam preparation platform(OC精英考试备考平台) ; Studitory: HSC preparation platform(Studitory: HSC备考平台)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 提出一种基于课程标准的可配置LLM评判流水线,用于高利害考试评分,通过整合授权课程工件和评分指南,提高评分一致性、透明度和与官方实践的契合度。
分布式通用智能体网络:架构、关键机制与原型
机构 * College of Electronics and Information Engineering, Shenzhen University(深圳大学电子与信息工程学院)
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI
AI总结 提出分布式通用智能体网络架构,通过协议适配层连接上层任务语义与底层网络操作,解决语义公告传播、可信身份与多主题声誉、语义梯度机制设计三大核心问题,实现开放可信的智能体协作。
野外AI系统审计的探讨
专题命中 安全评测 :safety(abstract);分类 cs.CY
AI总结 本文提出将AI系统审计视为在不确定性下监控约束违规的统计问题,强调开发全生命周期审计框架,以持续评估公平性、安全性等风险控制约束。
Comments Accepted to KDD 2026 (Blue Sky Ideas Track)
当规则学习时:一种用于法律案例检索的自演化智能体
机构 * Center of Information Research, AMS(AMS信息研究中心) ; Discipline and Technology Research Center for Large Model Intelligence Applications(大模型智能应用学科与技术研究中心) ; Hebei University of Engineering(河北工程大学)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 提出一种自演化框架,通过LLM智能体自动生成并优化查询重写规则,无需参数训练即可增强BM25在法律案例检索中的性能。
Comments To appear in ACL 2026
面向大规模汽车软件需求的集群感知双层测试规格生成
机构 * CairoMotive Cairo, Egypt(开罗动力埃及)
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 提出一种“先聚类后总结”流水线,通过嵌入、降维、聚类、多级摘要和双层测试生成,解决大规模需求下LLM处理依赖缺失和上下文窗口限制问题,提升集成测试覆盖率并高效扩展。
当认知图遇见大语言模型:恐慌情绪唤醒预测的BDEI认知路径
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 安全评测 :safety(abstract);分类 cs.CL
AI总结 提出PanicCognitivePath框架,通过心理安全距离模型融合多域信号,引入显式情绪节点构建BDEI认知路径,将LLM限制于单步参数估计,实现恐慌情绪唤醒时间预测,准确率提升10.68%。
DeMaVLA:面向可泛化可变形物体操作的视觉-语言-动作基础模型
机构 * Tongji University(同济大学)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 提出DeMaVLA模型,采用VLM骨干与动作专家结合流匹配生成连续动作,通过剪枝Transformer层提升效率,并利用大规模真实世界数据和人类反馈数据聚合训练,实现可变形物体折叠操作的多类别泛化。
Comments 14 pages, 2 figures
像锤子一样,它能建造,也能破坏:Reddit上网络安全运营中大语言模型的使用、认知与采纳
机构 * Arizona State University(亚利桑那州立大学) ; Technische Universität Berlin(柏林技术大学)
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 通过对Reddit网络安全论坛892篇帖子进行混合方法分析,研究安全从业者使用LLM工具的模式、认知和采纳情况,发现LLM主要用于低风险、生产力导向任务,企业级安全平台受关注,但可靠性、验证开销和安全问题限制了其自主性。
Comments This paper appears in the Proceedings of the Twenty-Second Symposium on Usable Privacy and Security (SOUPS) 2026
DiffAttn: 基于扩散的驾驶员视觉注意力预测与LLM增强语义推理
机构 * School of vehicle and Mobility, Tsinghua University(清华大学车辆与移动性学院) ; Beijing Key Laboratory of Human-Computer Interaction, Institute of Software, Chinese Academy of Sciences(北京人机交互重点实验室,中国科学院软件研究所) ; Remote Sensing and Earth Observation Laboratory, University of Copenhagen(远程感知与地球观测实验室,哥本哈根大学) ; California PATH, University of California, Berkeley(加州PATH,加州大学伯克利分校)
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 提出DiffAttn框架,将驾驶员视觉注意力预测建模为条件扩散去噪过程,结合Swin Transformer、特征融合金字塔和LLM增强语义推理,在四个数据集上达到最先进性能。
大型语言模型的隐性协调
机构 * Department of Computer Science, Bar-Ilan University(巴伊兰大学计算机科学系) ; Department of Computer Science, University of Oxford(牛津大学计算机科学系) ; Institute for Decentralized AI (IDAI)(去中心化人工智能研究所)
专题命中 安全评测 :safety(abstract);分类 cs.LG
AI总结 研究大型语言模型在多智能体无通信协调中的焦点涌现能力,通过博弈和搜救任务评估,发现模型在多数场景匹配或超越人类,但在数值常识和文化显著性任务中失败,并提出无学习策略改善协调。
Comments Code: https://github.com/EmanueleLM/focal-points
m2sv: 地图到街景空间推理的可扩展基准
机构 * University of Hawai'i at M\=anoa, Honolulu, HI, USA
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 提出m2sv基准,通过匹配朝北俯视图与街景图像推断相机方向,评估VLM空间推理能力;最佳模型准确率65.2%,低于人类72.0%,揭示几何对齐与推理一致性的差距。
AI作为学习、实践和参与科学的伙伴:警惕性是高效增强的关键
专题命中 安全评测 :trustworthy(abstract);分类 cs.CY
AI总结 本文探讨AI作为科学学习、实践和参与伙伴的三种形式,提出人类对AI输出的认知警惕性是决定增强效果的关键约束,并详细阐述了警惕性的组成、机制及测量方法。
渐进式知识引导的大型语言模型框架用于轴承故障诊断
机构 * Harbin Institute of Technology, China(哈尔滨工业大学,中国) ; Eastern Institute of Technology, China(东方技术研究所,中国)
专题命中 安全评测 :safety(abstract);分类 cs.CL
AI总结 提出渐进式物理引导多尺度振动信号处理框架,通过81维测量描述符、故障自适应分割和隐式知识编码,在四个数据集上实现98.49%诊断精度并降低12.6倍计算成本。
PaperJury: 有界LaTeX修订的正当程序审查
机构 * Vast Intelligence Lab(vast 智能实验室)
专题命中 安全评测 :safety(abstract);分类 cs.CL
AI总结 提出PaperJury系统,通过确定性编排与语义代理分离,实现LaTeX论文的对抗性审查、裁决和修订,确保有界安全编辑和终止结果。
Comments 10 pages, 5 figures
AME:生成式AI市场中的多类型贡献者归属框架
机构 * University of Shanghai for Science and Technology(上海理工大学) ; Fudan University(复旦大学)
专题命中 安全评测 :trustworthy(abstract);分类 cs.LG
AI总结 针对生成式AI中多阶段协作的价值分配问题,提出AME框架,整合异构数据贡献评估、数据权利映射和可信执行,实现与人类判断一致的低成本价值分配。
SciText2Eq: 评估大语言模型在科学创造力中的可解释方程生成
机构 * Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) ; Wageningen University & Research(瓦赫宁根大学及研究中心)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 研究大语言模型从科学文本生成数学方程的能力,构建AI论文数据集,提出可解释方程生成流程,并设计结合自动指标、LLM评估和人工判断的评估协议,发现LLM在语义准确性上表现不足。
Comments Accepted by findings of ACL 2026
UrbanWell: 面向时空城市福祉分析的多模态大语言模型基准测试
机构 * University of Helsinki(赫尔辛基大学) ; Zhongguancun Academy(中关村学院) ; University of Oxford(牛津大学) ; Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 提出UrbanWell基准,通过卫星和街景图像联合建模,系统评估多模态大语言模型在环境、空间可达性、城市形态、活力和主观感知等5类城市福祉指标上的时空推理能力,并定义时序预测和趋势分类任务。
Comments accepted by KDD Datasets and Benchmarks Track 2026
ToolMenuBench: 用于可靠高效LLM智能体的工具菜单过滤策略基准测试
机构 * Independent Researcher(独立研究者) ; United States of America(美国)
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 提出ToolMenuBench基准,评估多步LLM智能体中工具菜单构建策略,发现因果最小工具过滤在任务成功率、令牌使用和风险暴露间取得最佳平衡。