Admissibility Alignment
可接受性对齐
专题命中 安全评测 :alignment(title,abstract);分类 cs.AI
AI总结 本文提出MAP-AI架构,通过蒙特卡洛方法评估决策策略的可接受性,实现AI对齐的动态决策理论属性。
Comments 24 pages, 2 figures, 2 tables.. Decision-theoretic alignment under uncertainty
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
可接受性对齐
专题命中 安全评测 :alignment(title,abstract);分类 cs.AI
AI总结 本文提出MAP-AI架构,通过蒙特卡洛方法评估决策策略的可接受性,实现AI对齐的动态决策理论属性。
Comments 24 pages, 2 figures, 2 tables.. Decision-theoretic alignment under uncertainty
基于大语言模型的汽车系统功能安全与安全设计
机构 * European Chips Joint Undertaking(欧洲芯片联合计划) ; Federal Ministry of Research, Technology and Space of Germany(德国联邦科研、技术和空间 ministry)
专题命中 安全评测 :safety(title,abstract);分类 cs.AI
AI总结 本文提出利用大语言模型提升汽车系统功能安全与安全设计的方法,通过事件链模型和MDE方法实现安全拓扑设计和代码分析。
ITSELF: 基于注意力引导的细粒度对齐用于视觉-语言检索
机构 * University of Information Technology(信息技术大学) ; Vietnam National University(越南国家大学)
专题命中 安全评测 :alignment(title,abstract);分类 cs.AI
AI总结 ITSELF通过基于注意力引导的细粒度对齐框架,在视觉-语言检索任务中实现最先进的性能和跨数据集泛化能力。
Comments Accepted at WACV Main Track 2026
MACA:一种将可信大语言模型提炼为高效检索器的框架
机构 * JP Morgan Chase(摩根大通公司) ; IIIT Hyderabad(海得拉巴印度理工学院)
专题命中 安全评测 :trustworthy(title);alignment(abstract);分类 cs.AI
AI总结 MACA通过提炼可信LLM为高效检索器,提升检索准确率并减少LLM调用成本
CSSBench: 评估轻量级大语言模型对中文特定对抗模式的安全性
机构 * Nanyang Technological University(南洋理工大学) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Huazhong University of Science and Technology(华中科技大学)
专题命中 安全评测 :safety(title,abstract);分类 cs.CL
AI总结 CSSBench通过评估中文特定对抗模式,揭示轻量级大语言模型在中文环境下的安全挑战,为实际应用提供安全评估框架。
Comments 18 pages
SAMUeL:通过软对齐注意力和潜在扩散实现高效的语音条件音乐生成
机构 * Division of Engineering Science University of Toronto(工程科学系 马尼托瓦大学) ; Innovative Cognitive Computing Center King Mongkut's University of Technology Thonburi(创新认知计算中心 王后大学技术吞武里)
专题命中 安全评测 :alignment(title,abstract);分类 cs.LG
AI总结 SAMUeL通过软对齐注意力和潜在扩散技术,实现高效的语音条件音乐生成,参数减少220倍,推理速度提升52倍,性能优于OpenAI Jukebox。
Comments 7 pages, 3 figures, accepted to IEEE/WIC WI-IAT
SDEval: 多模态大语言模型的安全动态评估
专题命中 安全评测 :safety(title,abstract)
AI总结 SDEval通过动态调整安全基准分布和复杂度,提升多模态大语言模型的安全评估效果,缓解数据污染并揭示模型安全局限。
Comments AAAI 2026 poster
通过情感推理验证器实现多模态大语言模型的情感一致性推理
机构 * Corresponding author(通讯作者)
专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI
AI总结 本文提出情感推理验证器和解释奖励,通过引导模型生成与目标情绪一致的推理,提升多模态大语言模型在情绪识别中的解释准确性与一致性。
Comments 15 pages, 11 figures
Aletheia: 通过正则化逆混淆矩阵量化推理模型中的认知信念
机构 * Zhejiang University(浙江大学)
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 Aletheia通过正则化逆混淆矩阵量化推理模型中的认知信念,探索AI科学诚信的测量方法。
Comments 6 pages, 2 figures
BiPrompt:面向视觉与文本去偏的双重视觉语言模型双向提示优化
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG
AI总结 BiPrompt通过双重视觉语言模型双向提示优化,同时减轻视觉和文本中的非因果特征依赖,提升模型在分布偏移下的鲁棒性和因果推理能力。
Comments Accepted at the AAAI 2026 Workshop AIR-FM, Assessing and Improving Reliability of Foundation Models in the Real World
细化溯源推断:从模型行为检测LLM细化训练提示
机构 * National University of Singapore(新加坡国立大学)
专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 本文提出RePro框架,通过教师强制的似然特征与logit排名信号融合,实现对LLM细化训练提示的溯源推断,具有跨模型和训练设置的泛化能力。
通过顺序信息提升实现LLM生成的任何时间有效性答案充分性证书
机构 * Department of Computer Science, Iowa State University(计算机科学系,爱荷华州立大学) ; Department of Civil, Construction & Environmental Engineering, Iowa State University(土木、建设与环境工程系,爱荷华州立大学)
专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG
AI总结 通过顺序信息提升实现LLM生成的任何时间有效性答案充分性证书,利用经验动态形式提升方法,在减少生成长度的同时保持delta级误差控制,并通过轻量级正确性门提升端任务正确性。
自回归语义视觉重建有助于VLMs更好地理解
机构 * Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院) ; AutoLab, Westlake University(西湖大学AutoLab) ; Zhejiang University(浙江大学) ; Shanghai AI Lab(上海人工智能实验室) ; University of Southern California(美国南加州大学)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 自回归语义视觉重建通过提升多模态理解能力,改进了VLMs对视觉信息的把握
大型语言模型的知识蒸馏与数据集蒸馏:新兴趋势、挑战与未来方向
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG
AI总结 本文综述了大型语言模型的知识蒸馏与数据集蒸馏技术,探讨了其在压缩模型、保持推理能力及语言多样性方面的挑战与未来发展方向。
通过判别损失和高斯噪声注入训练更鲁棒的分类模型
机构 * Ampere Software Technology(Ampere软件技术公司) ; Institut de mathématiques de Toulouse(图卢兹数学研究所) ; Institut de Recherche en Informatique de Toulouse(图卢兹计算机研究所) ; Laboratoire Jean Alexandre Dieudonné, Université Côte d’Azur(坎特伯雷大学Dieudonné实验室)
专题命中 安全评测 :alignment(abstract);分类 cs.LG
AI总结 本文提出通过判别损失和高斯噪声注入提升模型鲁棒性,增强特征判别性和类别分离性,同时减少损失曲率以提升鲁棒性。
Comments Published in Transactions on Machine Learning Research (TMLR)
AI代理系统:架构、应用与评估
机构 * School of Electrical, Computer and Energy Engineering, Arizona State University(电气、计算机与能源工程学院,亚利桑那州立大学)
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 本文综述了AI代理系统在架构、应用与评估方面的最新进展,探讨了代理组件、协调模式及部署设置,并分析了设计权衡与评估挑战。
基于回忆的推理:评估基于RAG的心理健康对话系统中通用架构与专门微调的有效性
专题命中 安全评测 :safety(abstract);分类 cs.CL
AI总结 本文通过比较通用推理模型与领域特定微调模型,发现通用模型在同理心和上下文理解方面表现更优,表明强大的推理能力比专门训练更能提升心理健康对话系统的效果。
ScienceDB AI: 基于大语言模型的代理推荐系统用于大规模科学数据共享服务
机构 * Computer Network Information Center, Chinese Academy of Sciences, Beijing, China(中国科学院计算机网络信息中心)
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI
AI总结 ScienceDB AI 是首个基于大语言模型的对话推荐系统,专为大规模科学数据共享服务设计,通过自然语言对话和深度推理实现精准的数据集推荐。
Comments 12 pages, 9 figures
AlignUSER: 通过世界模型对齐LLM代理以评估推荐系统
机构 * Woven by Toyota(丰田织物)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 AlignUSER通过世界模型驱动的代理学习,利用人类交互数据提升推荐系统评估的准确性与真实用户行为的对齐程度。
LSRE: 隐式语义规则编码用于自动驾驶中的实时语义风险检测
机构 * School of Vehicle and Mobility, Tsinghua University(车辆与移动系统学院,清华大学)
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 LSRE通过隐式语义规则编码实现自动驾驶中的实时语义风险检测,以10 Hz速度提供高效准确的危险预判。
增强大语言模型在时序点过程中的时间感知能力
机构 * School of Computer Science and Technology, Tongji University, Shanghai 201804, China(计算机科学与技术学院,同济大学) ; College of Cyber Security, Jinan University, Guangzhou 510632, China(网络安全学院,暨南大学) ; Department of Computer Science, University of Illinois Chicago, Chicago, USA(计算机科学系,伊利诺伊大学芝加哥分校)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 TPP-TAL通过增强LLMs的时间感知能力,改进了时序点过程中的时间似然估计和事件预测准确性。
Comments preprint
Octopus: 一种轻量级的实体感知多表数据发现与单元格级检索系统
专题命中 安全评测 :alignment(abstract)
AI总结 Octopus是一种无需训练的轻量级系统,通过细粒度实体识别和直接扫描表内容,实现多表数据发现和单元格级值检索,提高准确性和效率。
在实践中可解释人工智能意味着什么?来自长期临床案例研究的评估要求
专题命中 安全评测 :trustworthy(abstract)
AI总结 本文通过长期临床案例研究,探讨了在专家领域中构建可信AI系统所需的评估需求,发现医生更信任能与自身评估对比的简单预测图。
Comments Accepted to ICSE SEIP 2026 in Rio de Janeiro, 12-18 April
在知识与关怀之间:通过患者和医师视角评估生成式AI在2型糖尿病管理中的IUI
专题命中 安全评测 :safety(abstract)
AI总结 本文通过患者和医师视角评估生成式AI在2型糖尿病管理中的应用,揭示其在安全性、情境判断和责任边界方面的不足,提出需智能界面调解AI输出以支持长期护理中的信任与责任。
Comments In Submission
针对心脏超声的深度分割架构的统一回顾与基准测试:CAMUS
机构 * Department of Computer Science ; Artificial Intelligence, Dongguk University, Seoul 04620, Republic of Korea ; Department of Semiconductor System Engineering, Sejong University, Seoul, 05006, Republic of Korea ; Department of Operations Research ; Statistics, Faculty of Organizational Sciences, University of Belgrade, Belgrade, Serbia ; Department of Industrial Engineering \& Management, Yuan Ze University, Taoyuan City 320315, Taiwan ; Department of Applied Mathematical Science, College of Science ; Technology, Korea University, Sejong 30019, Republic of Korea
专题命中 安全评测 :alignment(abstract)
AI总结 本文通过统一基准测试评估了三种心脏超声分割架构的性能,提出标准化预处理方法,并展望了自监督和多模态标注技术的应用。