Luna-2: Scalable Single-Token Evaluation with Small Language Models
Luna-2:基于小语言模型的可扩展单令牌评估
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 Luna-2利用小语言模型实现高效、准确的单令牌评估,大幅降低计算成本和延迟,提升内容安全与幻觉检测性能。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
Luna-2:基于小语言模型的可扩展单令牌评估
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 Luna-2利用小语言模型实现高效、准确的单令牌评估,大幅降低计算成本和延迟,提升内容安全与幻觉检测性能。
在数据不平衡情况下工作区碰撞严重性风险建模策略
专题命中 安全评测 :safety(abstract);分类 cs.CY、cs.LG
AI总结 本研究探讨了在数据不平衡情况下,利用DMI特征选择和不同模型提升HS碰撞预测性能的方法。
Comments This second revised version has been resubmitted to the Transportation Research Record: Journal of the Transportation Research Board after addressing the reviewers' comments and is currently awaiting the final decision
Journal ref Transportation Research Record (2025)
基于插值驱动的机器学习方法用于烟云闪烁剂量估计:XGBoost、随机森林和TabNet的比较
机构 * Health Physics Division, Health Safety \& Environment Group, Bhabha Atomic Research Center, Mumbai – 400085, India ; Birla Institute of Technology And Science, Pilani, Rajasthan – 333031, India ; Environment Group, Bhabha Atomic Research Center, Mumbai – 400085, India
专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG
AI总结 本文提出基于插值驱动的机器学习方法,比较了XGBoost、随机森林和TabNet在烟云闪烁剂量估计中的性能,发现XGBoost在预测准确性上表现最佳。
Comments 28 pages, 11 figures, 3 tables
BETA-标注用于低资源信息检索中多语言数据集构建
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 本文提出BETA-标注框架构建低资源语言信息检索数据集,探讨跨语言数据集重用的可行性和风险,揭示语言依赖性偏差对数据集可靠性的影响。
Comments This work was submitted without the consent of my current adviser. Additionally, it overlaps with my unpublished research work. In order to avoid potential academic and authorship conflicts, I am requesting withdrawal of the paper
协调大型语言模型代理进行科学研究:多选题生成与评估的试点研究
机构 * College of Computing and Informatics(计算与信息学院)
专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.CY
AI总结 本文研究了通过协调多个LLM代理生成和评估多选题,发现生成的题目在质量上存在与专家审核题目不完全可比的问题,同时揭示了科学研究中劳动力向AI研究操作技能转变的趋势。
评估基于人设的大型语言模型作为合成调查受访者可靠性
机构 * IIT-CNR, University of Pisa(IIT-CNR与比萨大学) ; University of Florence(佛罗伦萨大学) ; University of Pisa(比萨大学)
专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.CY
AI总结 本文评估了基于人设的LLM作为合成调查受访者可靠性,发现多属性提示可能引入偏差,影响子群体的忠实性。
医生还会见你:论代理AI在医疗领域的结构性限制
机构 * Stanford University(斯坦福大学) ; University of Florida(佛罗里达大学) ; Montclair State University(蒙特克莱尔州立大学)
专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.CY
AI总结 本文探讨了代理AI在医疗领域应用中的结构性限制,指出技术期望、商业激励和临床约束的交汇对患者安全和责任归属产生实质性影响。
Comments 17 pages, 3 pages of appendix, 4 tables
超越单一通道代理基准测试
机构 * Florida State University(佛罗里达州立大学)
专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.CY
AI总结 本文提出通过人类-人工智能双元组的可靠性评估代理安全性,强调不相关错误模式对风险降低的重要性,以改进AI安全性评估方法。
Comments 8 pages; 1 figure; 1 table
层次优化中的渐近语义崩溃
机构 * Department of Computer Engineering, Bahçeşehir University(计算机工程系,巴切希尔大学)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG
AI总结 研究揭示了层次优化中语义逐渐趋同的现象,通过数学模型和实验验证了语义状态收敛及信息熵消失的特性。
Comments 23 pages, 2 figures. Includes a dataset-free benchmark with full metric reporting
算法之后的合作:超越协作幻觉的人机共存设计
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI
AI总结 本文提出人机共存的制度框架,通过六个设计原则和三个政策工具,构建可持续的可问责合作机制。
Comments 11 pages, 2 tables
守护历史真实:检测大语言模型中的历史修正主义
专题命中 安全评测 :alignment(abstract);分类 cs.CY
AI总结 该研究提出HistoricalMisinfo数据集,用于评估大语言模型在面对历史修正主义请求时的鲁棒性及事实准确性。
Comments Accepted at IASEAI 2026, non-archival
符合信号时间逻辑用于鲁棒强化学习控制:一个案例研究
机构 * ICASSP 2026
专题命中 安全评测 :safety(abstract);分类 cs.LG
AI总结 本文提出一种符合STL的屏蔽,用于增强强化学习在航空航天中的鲁棒性和安全性,通过实验验证其在复杂环境下的有效性。
Comments 6 pages, 2 figures
DREAM: 基于代理度量的深度研究评估
机构 * AWS Agentic AI(AWS敏捷人工智能) ; Georgia Institute of Technology(佐治亚理工学院)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 DREAM提出一种基于代理度量的深度研究评估框架,通过能力平衡原则解决现有基准在事实和时间衰减检测上的不足,实现可扩展的无参考评估。
NutriOrion:一种基于临床指南的个性化营养干预分层多智能体框架
机构 * Emory University(埃默里大学) ; Texas Woman's University(德克萨斯女子大学)
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 NutriOrion通过分层多智能体框架实现个性化营养干预,结合多目标优先级算法和安全约束机制,有效解决多病共存患者的饮食需求冲突与临床有效性问题。
在噪声中寻找信号:对评估AI和可及性论坛对盲人用户支持需求有效性探索性研究
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI
AI总结 本文通过研究盲人用户与论坛和生成式AI工具的互动,发现其在信息过载和可靠性方面的问题,并提出改进辅助资源可靠性的设计方法。
Comments 20 pages incl. references, 5 figures. Full paper submission to CHI 2026. IRB-approved semi-structured interview study with 14 blind participants
FineRef: 长形式生成中基于细粒度的错误反射与纠正方法
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI
AI总结 FineRef通过细粒度错误反射与纠正框架,提升长形式生成中引用准确性与回答质量,实验显示其在多个指标上优于现有模型。
Comments 9 pages, 4figures, AAAI2026
Ambig-SWE: 交互式代理以克服软件工程中的不充分性
机构 * Language Technologies Institute, Carnegie Mellon University(语言技术研究所,卡内基梅隆大学)
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 Ambig-SWE研究LLM代理在交互式代码生成中处理不充分指令的能力,通过检测不充分性、提问澄清和利用交互提升性能,发现交互能显著提高74%的性能。
Comments 22 pages, 7 figures, Accepted at ICLR 2026
大语言模型理解数据可视化规则吗?
机构 * Universidad Torcuato Di Tella(托科托迪特拉大学) ; Consejo Nacional de Investigaciones Científicas y Técnicas(国家科学与技术研究院) ; Universidad de Buenos Aires(布宜诺斯艾利斯大学)
专题命中 安全评测 :trustworthy(abstract)
AI总结 本文评估了大语言模型在数据可视化规则检测中的性能,发现其在基本规则上表现良好,但在复杂规则上存在局限。
FineVAU: 一种新的细粒度视频异常理解对齐基准
专题命中 安全评测 :alignment(abstract)
AI总结 FineVAU提出了一种新的视频异常理解基准,通过引入FVScore和FineW3数据集,提升对异常事件的细粒度和领域特定理解,解决现有评估方法与人类感知不一致的问题。
Comments Accepted at AAAI 2026
SusBench: 一个用于评估计算机使用代理对暗模式易感性的在线基准
专题命中 安全评测 :trustworthy(abstract)
AI总结 SusBench通过构建真实暗模式评估CUAs对操纵性界面的易感性,发现人类和代理对预选、误导性措辞和隐藏信息等暗模式特别敏感。
Comments Accepted as a full paper to IUI 2026
Project Hermes: 一种面向可穿戴健康预测系统的模型无关验证层
专题命中 安全评测 :trustworthy(abstract)
AI总结 Project Hermes通过模型无关的验证层,有效降低健康预测系统的假阳性率,提升临床信号的验证准确性。
通过移动增强现实实现超声体积重建的扩展
机构 * National University Health System, Singapore(新加坡国家大学医疗系统) ; College of Design and Engineering, National University of Singapore, Singapore(新加坡国立大学设计与工程学院)
专题命中 安全评测 :safety(abstract)
AI总结 MARVUS通过移动增强现实技术提升超声体积重建的准确性和可重复性,减少用户间差异,提高临床应用的可行性和成本效益。
Comments Submitted to MICCAI 2026
感知特性距离:在特定决策规则下动态条件下感知系统稳定性与鲁棒性测量
机构 * Department of Statistics, Virginia Tech(弗吉尼亚理工学院统计学系) ; Virginia Tech Transportation Institute(弗吉尼亚理工学院交通研究所)
专题命中 安全评测 :safety(abstract)
AI总结 提出感知特性距离(PCD)作为衡量动态条件下感知系统稳定性与鲁棒性的新指标,并通过SensorRainFall数据集验证其有效性。
Comments This paper has been accepted to the CVPR 2026 Main Conference
基于语言的层次奖励设计:通过人类规范增强智能体行为对齐
机构 * Rice University(里士大学)
专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出基于语言的层次奖励设计(HRDL)和语言到层次奖励(L2HR)方法,用于通过人类规范增强智能体行为对齐,提升AI任务完成效果和规范遵守程度。
Comments Extended version of an identically-titled paper accepted at AAMAS 2026
超越行为权衡:在LLM中疼痛-愉悦决策的机制追溯
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究揭示了LLM在疼痛-愉悦决策中的内部机制,通过机制追溯揭示了价值信号的表示和因果作用,为AI意识和福利的讨论提供了证据基础。
Comments 24 pages, 8+1 Tables
买还是建一个大语言模型:政府的决策框架
机构 * National University of Singapore(新加坡国立大学) ; AI Singapore(AI新加坡) ; Salesforce AI Research(Salesforce AI研究) ; EPFL(苏黎世联邦理工学院) ; University of Washington(华盛顿大学) ; Allen Institute for AI(人工智能研究院)
专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 本文提出政府在大语言模型决策中应考虑主权、安全、成本等因素的框架,帮助确定购买或建设更适合其需求的方法。
Comments The short version of this document is published as an ACM TechBrief at https://dl.acm.org/doi/epdf/10.1145/3797946, and this document is published as an ACM Technology Policy Council white paper at https://www.acm.org/binaries/content/assets/public-policy/buildvsbuyai.pdf
PRISM: 通过解耦架构先验来多样化数据集蒸馏
机构 * German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI)) ; RPTU Kaiserslautern-Landau(科隆大学(RPTU))
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 PRISM通过解耦架构先验提升数据集蒸馏的多样性与性能
Journal ref Transactions on Machine Learning Research, 2026
从偏见缓解到偏见协商:在生成式AI中治理身份与社会文化推理
机构 * Institute for Social Science, University of Stuttgart(斯图加特大学社会科学研究所) ; Department of Computer Science, Saarland University(萨尔兰大学计算机科学系) ; Department of Linguistics, University of Texas Austin TX USA(德克萨斯大学语言学系) ; Department of Linguistics, University of Texas(德克萨斯大学语言学系)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY
AI总结 本文提出偏见协商作为生成式AI治理身份与社会文化推理的新框架,通过实证研究探讨其在缓解偏见和提升社会公正中的作用。
超越二元:开放权重高级AI的细致路径
专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY
AI总结 本文提出了一种基于安全评估的分层模型发布方法,旨在解决开放权重高级AI模型在安全性和监管方面的挑战。
Comments This publication was originally designed and optimised for web and published on cfg.eu. Minor formatting differences may appear in this version
让AI评分更人性化:以学生为中心的公平性、信任、一致性与透明性洞察
机构 * North Carolina State University(北卡罗来纳州立大学)
专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI
AI总结 本研究通过比较AI与人工评分反馈,探讨学生对AI评分系统在公平性、信任、一致性与透明性方面的看法,并提出人本化AI的设计原则。
Comments 13 pages, 3 figures