arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9346 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9346 篇

2605.29434 2026-05-29 cs.CR cs.AI cs.CL cs.LG 67%

AliMark: Enhancing Robustness of Sentence-Level Watermarking Against Text Paraphrasing

AliMark: 增强句子级水印对文本释义的鲁棒性

Yuexin Li, Wenjie Qu, Linyu Wu, Yulin Chen, Yufei He, Tri Cao, Bryan Hooi, Jiaheng Zhang

机构 * National University of Singapore(新加坡国立大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出AliMark框架,将句子级水印重构为比特序列编码与对齐问题,通过多候选对齐检测策略提升对句子拆分合并等结构扰动的鲁棒性。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28025 2026-05-28 cs.AI cs.CL cs.CY 67%

MIRA: A Bilingual Benchmark for Medical Information Response Audit

MIRA: 医学信息响应审计的双语基准

Mengyu Xu, Qiaoxin Yang, Qianqian Wang, Xiwei Dai, Weiyi Wu, Chongyang Gao

机构 * The University of Chicago(芝加哥大学) SynAI Technologies Inc.(SynAI技术公司) Jinzhou Medical University(锦州医学院) Zhejiang University(浙江大学) Dartmouth College(达特茅斯学院) Northwestern University(西北大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 提出MIRA双语基准,通过4,320个提示评估大语言模型在不同用户表达下提供医学信息的一致性,发现低健康素养提示导致信息稀释(DID),并提出知识引导缓解方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24331 2026-05-26 cs.CV 67%

Spatial-aware Vision Language Model for Autonomous Driving

面向自动驾驶的空间感知视觉语言模型

Weijie Wei, Zhipeng Luo, Ling Feng, Venice Erin Liong

机构 * Motional University of Amsterdam(阿姆斯特丹大学)

专题命中 安全评测 :safety(abstract);trustworthy(abstract)

AI总结 提出LVLDrive框架,通过融合LiDAR点云与视觉语言模型,利用渐进融合Q-Former和空间感知问答数据集,解决3D度量空间推理瓶颈,提升自动驾驶场景理解与决策可靠性。

Comments Accepted to CVPR AutoPilot Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24541 2026-05-26 cs.LG cs.AI cs.CL cs.IR 67%

SemanticZip: A Pilot Framework for Lossy Text Compression with LLMs as Semantic Decompressors

SemanticZip: 以LLM作为语义解压器的有损文本压缩的试点框架

Natalia Trukhina, Vadim Vashkelis

机构 * Embedded Intelligence Lab (EMILAB)(嵌入式智能实验室)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出SemanticZip框架,通过LLM将文本压缩为紧凑代码并解压为任务相关语义,在结构化散文、JSON等六种表示上评估,发现结构化散文恢复率最高(WAR=0.956,19.1%令牌增益),而CCL-Min平衡性最佳(39.4%令牌增益,WAR=0.874)。

Comments 13 pages, 1 figure, 2 tables. Pilot framework paper; code and supplementary artifacts available in ancillary files

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16545 2026-05-22 cs.LG cs.AI cs.CL 67%

Symphony for Speech-to-Text: Supporting Real-Time Medical Voice Interfaces

Symphony for Speech-to-Text: 支持实时医疗语音接口

Arne Nix, Robert James, Lasse Borgholt, Anna B. Ekner, Lana Krumm, Julius Severin, Dan Engel, Lars Maaløe, Jakob Havtorn

机构 * Corti

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Symphony for Speech-to-Text,一种医疗级实时语音识别系统,通过分解转录过程为识别、格式化和上下文校正等专业化组件,优化医学术语召回,实现实时临床结构文本生成,并在医疗场景中显著优于现有系统,同时在通用领域表现不逊。

Comments Updated with a correction and improvement to Symphony's performance in spoken punctuation evaluation (R_punct, P_punct)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06597 2026-05-22 cs.CL cs.AI cs.LG 67%

UniSD: Towards a Unified Self-Distillation Framework for Large Language Models

UniSD:面向大语言模型的统一自蒸馏框架

Yiqiao Jin, Yiyang Wang, Lucheng Fu, Yijia Xiao, Yinyi Luo, Haoxin Liu, B. Aditya Prakash, Josiah Hester, Jindong Wang, Srijan Kumar

机构 * Georgia Institute of Technology(佐治亚理工学院) University of California, Los Angeles(加州大学洛杉矶分校) Carnegie Mellon University(卡内基梅隆大学) William & Mary(威廉与玛丽大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出UniSD框架,系统研究自蒸馏方法,通过整合多种机制提升监督可靠性、表征对齐和训练稳定性,从而在多个基准和模型上验证自蒸馏的有效性,并构建出性能最优的UniSDfull流水线。

Comments Website: https://unifiedsd.github.io/ Code: https://github.com/Ahren09/UniSD

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03433 2026-05-21 eess.SY cs.SY 67%

When control meets large language models: From words to dynamics

当控制遇见大语言模型:从词语到动态

Komeil Nosrati, Aleksei Tepljakov, Juri Belikov, Eduard Petlenkov

专题命中 安全评测 :alignment(abstract);trustworthy(abstract)

AI总结 本文探讨了大语言模型与控制之间的双向关系,研究了LLM如何通过直接辅助控制器设计和间接增强研究流程来推动控制领域的发展,同时分析了控制理论如何帮助LLM偏离不良含义,提高可达性和对齐性,并通过状态空间框架将LLM视为动态系统,最后指出了关键挑战和未来研究方向。

Journal ref Engineering Applications of Artificial Intelligence 178(2), 115119 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19328 2026-05-20 cs.CR cs.RO 67%

RoboJailBench: Benchmarking Adversarial Attacks and Defenses in Embodied Robotic Agents

RoboJailBench: 对具身体验机器人代理中对抗攻击和防御的基准测试

Doguhuan Yeke, Yanming Zhou, Leo Y. Lin, Hongyu Cai, Antonio Bianchi, Z. Berkay Celik

机构 * Purdue University(普渡大学)

专题命中 安全评测 :safety(abstract);jailbreak(abstract)

AI总结 本文提出RoboJailBench,通过建立安全分类学、引入意图对比数据集管道以及提供一个演进的存储库,为具身体验人工智能中的对抗攻击和防御提供了标准化评估框架,同时构建了一个新的分类平衡数据集并增强了五个现有数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19159 2026-05-20 cs.CR 67%

On the Geometric Limits of Transformer Defenses against Obfuscation Attacks: Latent Embedding Collapse & Performance Robustness Gap

关于变换器对混淆攻击的几何极限:潜在嵌入崩溃与性能鲁棒性差距

Becky Mashaido, Tapadhir Das

专题命中 安全评测 :safety(abstract);prompt injection(abstract)

AI总结 本文研究了变换器在对抗混淆攻击时的几何极限,揭示了高检测性能并不等同于表示鲁棒性,通过实验发现潜在嵌入崩溃现象及性能鲁棒性差距,表明现有评估指标未能捕捉到潜在嵌入崩溃和底层几何脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19130 2026-05-20 cs.LG cs.AI cs.CL cs.CV 67%

EgoBabyVLM: Benchmarking Cross-Modal Learning from Naturalistic Egocentric Video Data

EgoBabyVLM:基于自然主义第一人称视频数据的跨模态学习基准测试

Dongyan Lin, Phillip Rust, Angel Villar Corrales, Alvin W. M. Tan, Mahi Luthra, Charles-Éric Saint-James, Rashel Moritz, Sheila Krogh-Jespersen, Vanessa Stark, Surya Parimi, Jiayi Shen, Youssef Benchekroun, Yosuke Higuchi, Martin Gleize, Tom Fizycki, Nicolas Hamilakis, Manel Khentout, Sho Tsuji, Balázs Kégl, Juan Pino, Michael C. Frank, Emmanuel Dupoux

机构 * Meta Superintelligence Labs(Meta超智能实验室) Stanford University(斯坦福大学) Meta Reality Labs(Meta现实实验室) The University of Tokyo(东京大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究探讨了儿童如何从有限的视觉-语言输入中获得语言 grounding 的鲁棒性,提出了 EgoBabyVLM 挑战,推动模型在自然主义数据中实现 grounded language learning。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18474 2026-05-20 cs.CR cs.AI cs.CL cs.LG 67%

Prompt2Fingerprint: Plug-and-Play LLM Fingerprinting via Text-to-Weight Generation

Prompt2Fingerprint: 通过文本到权重生成实现即插即用的LLM指纹生成

Sixu Chen, Xiang Chen, Hongyao Yu, Jiaxin Hong, Hao Fang, Shuoyang Sun, Bin Chen, Shu-Tao Xia

机构 * Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳国际研究生院,中国深圳) South China University of Technology, Guangzhou, China(华南理工大学,中国广州) Harbin Institute of Technology, Shenzhen, Shenzhen, China(哈尔滨工业大学深圳校区,中国深圳)

专题命中 安全评测 :harmlessness(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Prompt2Fingerprint框架,将LLM指纹生成重新定义为条件参数生成任务,通过专用生成器将文本描述直接映射到低秩参数增量,实现无需进一步模型微调的即插即用LLM指纹注入,显著降低计算开销,提供可扩展且即时的LLM所有权管理解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18956 2026-05-20 cs.CV 67%

MotionMERGE: A Multi-granular Framework for Human Motion Editing, Reasoning, Generation, and Explanation

MotionMERGE: 一种用于人体动作编辑、推理、生成和解释的多粒度框架

Bizhu Wu, Jinheng Xie, Wenting Chen, Zhe Kong, Jianfeng Ren, Linlin Shen, Ruibin Bai, Rong Qu

机构 * Computer Vision Institute, School of Computer Science and Software Engineering, Shenzhen University(计算机视觉研究院,计算机科学与软件工程学院,深圳大学) Guangdong Key Laboratory of Intelligent Information Processing, Shenzhen University(广东省智能信息处理重点实验室,深圳大学) School of Computer Science, University of Nottingham Ningbo China(Nottingham Ningbo 中国计算机科学学院) Department of Electrical and Computer Engineering, National University of Singapore(电子与计算机工程系,新加坡国立大学) Department of Radiation Oncology, Stanford University(放射肿瘤科,斯坦福大学) Sun Yat-sen University(中山大学) School of Computer Science, University of Nottingham(计算机科学学院,Nottingham大学)

专题命中 安全评测 :alignment(abstract,abstract_cn)

AI总结 本文提出MotionMERGE框架,通过细粒度语言引导的动作控制、跨粒度协同预训练和细粒度动作-语言对齐,实现了更精确的动作生成、理解和编辑,并建立了新的细粒度文本驱动动作编辑和动作引导推理基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15641 2026-05-19 cs.RO cs.CR 67%

Propagating Unsafe Actions in LLM Controlled Multi-Robot Collaboration via Single Robot Compromise

通过单个机器人入侵在LLM控制的多机器人协作中传播不安全行为

Zhen Huang, Zhihuang Liu, Mengxuan Luo, Weishang Wu, Zhiping Cai

机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院)

专题命中 安全评测 :alignment(abstract);safety(abstract)

AI总结 本文研究了LLM控制的多机器人协作中的安全问题,提出了一种新型攻击模式,其中攻击者仅通过单个机器人传播恶意意图,导致系统中协调的不安全行为,通过三个指标量化了这一过程,并展示了攻击的高效性和持续性。

Comments Accepted by the 35th International Joint Conference on Artificial Intelligence (IJCAI 2026). 9 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16354 2026-05-19 cs.LG cs.AI cs.CL cs.HC stat.ML 67%

Augmenting Human Evaluation with LLM Judges: How Many Human Reviews Do You Need?

通过LLM裁判增强人类评估:你真的需要多少人类评审?

Jane Paik Kim

机构 * Department of Psychiatry and Behavioral Sciences(精神病学与行为科学系)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出通过LLM作为辅助裁判来增强人类评估,通过两阶段抽样设计确定人类和LLM评审样本量,以实现目标统计功效。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16198 2026-05-18 cs.AI cs.CY cs.LG cs.LO 67%

Formal Methods Meet LLMs: Auditing, Monitoring, and Intervention for Compliance of Advanced AI Systems

形式方法与大语言模型交汇:面向高级AI系统合规性的审计、监控与干预

Parand A. Alamdari, Toryn Q. Klassen, Sheila A. McIlraith

机构 * University of Toronto, Vector Institute(多伦多大学,向量研究所)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 本文提出结合形式方法与机器学习的审计和监控技术,用于检测AI系统中时间扩展行为约束的违规,实验表明其在检测违规方面优于LLM基方法,且能有效降低LLM代理的违规率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24366 2026-05-18 cs.IR 67%

On the Factual Consistency of Text-based Explainable Recommendation Models

基于文本的可解释推荐模型的事实一致性研究

Ben Kabongo, Vincent Guigue

专题命中 安全评测 :alignment(abstract);trustworthy(abstract)

AI总结 本文研究基于文本的可解释推荐模型的事实一致性,提出评估框架和指标,发现尽管模型在语义相似度上表现良好,但事实一致性指标表现不佳,凸显了事实意识评估的重要性。

Comments 13 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13369 2026-05-15 cs.CL cs.AI cs.LG 67%

Query-Conditioned Test-Time Self-Training for Large Language Models

基于查询的测试时自我训练用于大语言模型

Chaehee Song, Minseok Seo, Yeeun Seong, Doyi Kim, Changick Kim

机构 * School of Electrical Engineering, KAIST(韩国科学技术院电子工程学院) Graduate School of Green Growth and Sustainability, KAIST(韩国科学技术院可持续增长与绿色发展研究生院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出QueST框架,通过直接从输入查询生成查询条件对,实现测试时参数自适应,无需外部数据,在多个基准测试中优于现有方法。

Comments 17 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13542 2026-05-14 cs.AI cs.CL cs.LG cs.MA 67%

RealICU: Do LLM Agents Understand Long-Context ICU Data? A Benchmark Beyond Behavior Imitation

RealICU: 大语言模型能否理解长期上下文ICU数据?一个超越行为模仿的基准测试

Chengzhi Shen, Weixiang Shen, Tobias Susetzky, Chen, Chen, Jun Li, Yuyuan Liu, Xuepeng Zhang, Zhenyu Gong, Daniel Rueckert, Jiazhen Pan

机构 * Technical University of Munich(慕尼黑技术大学) TUM University Hospital(TUM大学医院) LMU Munich(慕尼黑大学) University of Sheffield(谢菲尔德大学) University of Oxford(牛津大学) Zhongshan Hospital Fudan University(复旦大学中山医院) Sun Yat-sen University Cancer Center(中山大学肿瘤中心) Imperial College London(伦敦帝国学院) Munich Center for Machine Learning(慕尼黑机器学习中心) relAI – Konrad Zuse School of Excellence in Reliable AI(relAI – 卡诺夫茨卓越可靠人工智能学校)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 RealICU通过真实ICU场景评估大语言模型的长期上下文理解能力,提出四个医生驱动任务,揭示现有模型在临床推荐中的召回与安全性的权衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13770 2026-05-13 cs.AI cs.CL cs.LG stat.ME stat.ML 67%

Ice Cream Doesn't Cause Drowning: Benchmarking LLMs Against Statistical Pitfalls in Causal Inference

冰淇淋不导致溺水:对LLM在因果推断统计陷阱中的基准测试

Jin Du, Li Chen, Xun Xian, An Luo, Fangqiao Tian, Ganghua Wang, Charles Doss, Xiaotong Shen, Jie Ding

机构 * School of Statistics, University of Minnesota(明尼苏达大学统计学系) Data Science Institute, University of Chicago(芝加哥大学数据科学研究所)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出CausalPitfalls基准测试,评估LLM在因果推断中的能力,揭示当前LLM在统计因果推断中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09647 2026-05-12 cs.SI 67%

Modeling Implicit Conflict Monitoring Mechanisms against Stereotypes in LLMs

对LLMs中隐含冲突监控机制对抗刻板印象的建模

Jingshen Zhang, Bo Wang, Yanlin Fu, Dongming Zhao, Ruifang He, Yuexian Hou, Zifei Yu

专题命中 安全评测 :safety(abstract);jailbreak(abstract)

AI总结 本文提出COCO方法,通过对比因果机制识别高内在一致性且强跨对比差异的神经元,提升模型公平性并对抗对抗性劫持攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12248 2026-05-12 eess.AS cs.AI cs.CL cs.LG cs.SD 67%

AQUA-Bench: Beyond Finding Answers to Knowing When There Are None in Audio Question Answering

AQUA-Bench:在音频问答中超越寻找答案到知晓何时没有答案

Chun-Yi Kuan, Hung-yi Lee

机构 * Graduate Institute of Communication Engineering, National Taiwan University, Taiwan(台湾国立台湾大学通信工程研究所) Artificial Intelligence Center of Research Excellence (AI-CoRE), National Taiwan University, Taiwan(台湾国立台湾大学人工智能研究中心)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 AQUA-Bench针对音频问答中不可回答的问题提出评估基准,评估三种场景:缺失答案检测、不兼容答案集检测和不兼容音频问题检测,推动更稳健可靠的音频-语言系统发展。

Comments Accepted to ICASSP 2026 (Oral). Project Website: https://github.com/kuan2jiu99/aqua-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08468 2026-05-12 cs.CL cs.AI cs.LG 67%

PYTHALAB-MERA: Validation-Grounded Memory, Retrieval, and Acceptance Control for Frozen-LLM Coding Agents

PYTHALAB-MERA:基于验证的内存、检索与接受控制用于冻结LLM编码代理

Mehmet Iscan

机构 * PythaLab, Yildiz Technical University(PythaLab,伊兹密尔技术大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 PYTHALAB-MERA通过轻量级外部控制器实现验证基础的内存管理、适应性检索与延迟信用分配,提升冻结本地模型在编码任务中的验证成功率。

Comments 28 pages, 4 figures, 7 tables; local CLI artifact evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07806 2026-05-11 cs.CL cs.AI cs.LG 67%

Beyond Confidence: Rethinking Self-Assessments for Performance Prediction in LLMs

超越置信度:重新思考用于大语言模型性能预测的自我评估

Sree Bhattacharyya, Samarth Khanna, Leona Chen, Lucas Craig, Tharun Dilliraj, James Z. Wang

机构 * Department of Computer Science and Engineering, College of Engineering, The Pennsylvania State University(计算机科学与工程系,工程学院,宾夕法尼亚州立大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于认知评估理论的多维自我评估框架,通过六个评估维度和置信度预测模型失败,发现能力相关维度在多数场景中表现更优,且努力维度在推理任务中更具预测性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00877 2026-05-05 cs.MM cs.AI cs.CL cs.CV cs.LG 67%

OceanPile: A Large-Scale Multimodal Ocean Corpus for Foundation Models

OceanPile:一个大规模多模态海洋语料库用于基础模型

Yida Xue, Ningyu Zhang, Tingwei Wu, Zhe Ma, Daxiong Ji, Zhao Wang, Guozhou Zheng, Huajun Chen

机构 * College of Computer Science and Technology, Zhejiang University, Hangzhou 310027, China(浙江大学计算机科学与技术学院) ZJU-Hangzhou Global Scientific and Technological Innovation Center, Hangzhou 311200, China(浙江大学杭州全球科技创新中心) School of Software Technology, Zhejiang University, Ningbo 315048, China(浙江大学软件学院) Ocean College, Zhejiang University, Zhoushan 316021, China(浙江大学海洋学院) State Key Laboratory of Ocean Sensing, Hangzhou 311200, China(杭州海洋传感国家重点实验室) Ocean Research Center of Zhoushan, Zhejiang University, Zhoushan 316021, China(舟山海洋研究中心)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出OceanPile,一个用于海洋基础模型的多模态语料库,整合了声呐数据、水下图像、海洋科学图像和科学文本,通过高质量指令数据集和评估基准提升海洋领域模型性能。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20605 2026-05-05 cs.CL cs.AI cs.DL cs.LG 67%

TF1-EN-3M: Three Million Synthetic Moral Fables for Training Small, Open Language Models

TF1-EN-3M:三百万合成道德寓言用于训练小型开放语言模型

Mihai Nadas, Laura Diosan, Andrei Piscoran, Andreea Tomescu

机构 * Babeș-Bolyai University(巴纳德-波耶亚大学) KlusAI Labs(KlusAI实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出TF1-EN-3M数据集,包含三百万英文寓言,用于训练小型开放语言模型,展示通过指令微调模型生成高质量寓言的方法,验证了无需大模型即可实现大规模道德叙事的可能性。

Comments 18 pages, 6 tables, 1 figure. v2: revised evaluation with open-weight LLM judge panel, expanded citations

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19098 2026-05-04 cs.CL cs.AI cs.LG 67%

SAHM: A Benchmark for Arabic Financial and Shari'ah-Compliant Reasoning

SAHM:阿拉伯语金融与伊斯兰合规推理的基准

Rania Elbadry, Sarfraz Ahmad, Ahmed Heakl, Dani Bouch, Momina Ahsan, Muhra AlMahri, Marwa Elsaid khalil, Yuxia Wang, Salem Lahlou, Sophia Ananiadou, Veselin Stoyanov, Jimin Huang, Xueqing Peng, Preslav Nakov, Zhuohan Xie

机构 * MBZUAI INSAIT, Sofia University "St. Kliment Ohridski"(INSAIT,索菲亚大学"圣克莱门特·欧赫里迪斯") The University of Manchester(曼彻斯特大学) The Fin AI(Fin AI)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出SAHM基准,涵盖七个任务,包含14380个专家验证实例,评估20个LLM发现阿拉伯语流畅性不等于金融推理能力,特别是在事件因果推理上存在显著差距。

Comments 29 page

Journal ref ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27283 2026-05-01 cs.CL cs.AI cs.LG 67%

Learning When to Remember: Risk-Sensitive Contextual Bandits for Abstention-Aware Memory Retrieval in LLM-Based Coding Agents

学习何时记忆:风险敏感的上下文老虎机用于具有回避意识的记忆检索的LLM编码代理

Mehmet Iscan

机构 * PythaLab Yildiz Technical University(Yildiz技术大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出RSCB-MC方法,通过风险敏感的上下文老虎机机制,解决编码代理在记忆检索中的安全性和有效性问题,实现非注入和回避作为首要安全动作。

Comments 26 pages, 7 figures, 10 tables. Code and deterministic local artifacts are available at the repository listed in the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26671 2026-04-30 cs.CL cs.AI cs.CY 67%

From Black-Box Confidence to Measurable Trust in Clinical AI: A Framework for Evidence, Supervision, and Staged Autonomy

从黑盒信心到可测量的信任:临床AI可信框架的构建

Serhii Zabolotnii, Viktoriia Holinko, Olha Antonenko

机构 * Cherkasy State Business College(切尔卡西州商业学院) healthPrecision

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出一个基于证据、监督和分阶段自主的临床AI可信框架,通过模块化提示和层级升级机制提升信任度,强调信任是系统属性而非单一模型属性。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04325 2026-04-30 cs.CL cs.AI cs.CV cs.LG cs.MM 67%

Beyond the Leaderboard: Rethinking Medical Benchmarks for Large Language Models

超越排行榜:重新思考大型语言模型的医疗基准

Wenting Chen, Guo Yu, Yiu-Fai Cheung, Meidan Ding, Jie Liu, Zizhan Ma, Wenxuan Wang, Linlin Shen

机构 * Stanford University(斯坦福大学) Shenzhen University(深圳大学) The Chinese University of Hong Kong(香港中文大学) City University of Hong Kong(香港城市大学) Renmin University of China(中国人民大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出MedCheck框架,用于评估医疗领域大型语言模型的基准,揭示现有基准在临床相关性、数据完整性及安全性方面的系统性问题。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25200 2026-04-29 cs.CR cs.AI cs.CY cs.LG 67%

Making AI-Assisted Grant Evaluation Auditable without Exposing the Model

在不暴露模型的情况下使AI辅助的资助评估可审计

Kemal Bicakci

机构 * Informatics Institute, Istanbul Technical University, Istanbul, Türkiye(伊斯坦布尔技术大学信息学院,伊斯坦布尔,土耳其) Securify Information Technology and Security Training Consulting Inc., Ankara, Türkiye(Securify信息科技与安全培训咨询公司,安卡拉,土耳其)

专题命中 安全评测 :prompt injection(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 本文提出一种基于TEE的架构,通过远程证明技术实现资助评估过程的可审计性,同时防止申请人优化对抗模型和评分标准。

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏