arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-10 至 2026-02-10 共收录 109 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 8 篇

2507.02424 2026-02-10 cs.CR cs.AI cs.SE 57%

CyberRAG: An Agentic RAG cyber attack classification and reporting tool

CyberRAG: 一种基于代理的RAG网络攻击分类与报告工具

Francesco Blefari, Cristian Cosentino, Francesco Aurelio Pironti, Angelo Furfaro, Fabrizio Marozzo

机构 * University of Calabria(卡利博里大学) IMT School for Advanced Studies(IMT高级研究学院)

专题命中 越狱攻击 :trustworthy(abstract);分类 cs.AI

AI总结 CyberRAG是一种基于代理的RAG框架,通过模块化设计实现网络攻击的实时分类、解释和结构化报告,提高检测准确性和可解释性。

Journal ref Future Generation Computer Systems, 176, 2026, 108186

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 提示注入 4 篇

2602.07918 2026-02-10 cs.CR cs.LG stat.ME 79%

CausalArmor: Efficient Indirect Prompt Injection Guardrails via Causal Attribution

CausalArmor: 通过因果归因实现高效的间接提示注入防护

Minbeom Kim, Mihir Parmar, Phillip Wallis, Lesly Miculicich, Kyomin Jung, Krishnamurthy Dj Dvijotham, Long T. Le, Tomas Pfister

机构 * Google Cloud AI Research(谷歌云人工智能研究) Google(谷歌) Google Deepmind(谷歌DeepMind) Seoul National University(首尔国立大学)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.LG

AI总结 CausalArmor通过因果归因实现高效间接提示注入防护,提升AI代理的安全性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00181 2026-02-10 cs.CR cs.AI cs.LG 66%

CHAI: Command Hijacking against embodied AI

CHAI:针对具身AI的命令劫持

Luis Burbano, Diego Ortiz, Qi Sun, Siwei Yang, Haoqin Tu, Cihang Xie, Yinzhi Cao, Alvaro A Cardenas

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI、cs.LG;trustworthy(comments)

AI总结 CHAI是一种针对具身AI的物理环境间接提示注入攻击,通过嵌入误导性自然语言指令,利用多模态语言解释能力,有效提升了攻击性能,凸显了对传统对抗鲁棒性之外的防御需求。

Comments This work has been accepted for publication at the IEEE Conference on Secure and Trustworthy Machine Learning (SaTML). The final version will be available on IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06914 2026-02-10 cs.CR cs.AI 57%

SoK: Trust-Authorization Mismatch in LLM Agent Interactions

SoK:LLM代理交互中的信任-授权不匹配

Guanquan Shi, Haohua Du, Zhiqiang Wang, Xiaoyu Liang, Weiwenpei Liu, Song Bian, Zhenyu Guan

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文通过B-I-P框架系统分析LLM代理交互中的信任-授权不匹配问题,揭示了动态信任与静态授权之间的脱节,并提出动态风险适应性授权的研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07398 2026-02-10 cs.CR cs.AI 57%

AgentSys: Secure and Dynamic LLM Agents Through Explicit Hierarchical Memory Management

AgentSys: 通过显式分层内存管理实现安全且动态的LLM代理

Ruoyao Wen, Hao Li, Chaowei Xiao, Ning Zhang

机构 * Washington University in St. Louis(圣路易斯华盛顿大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 AgentSys通过显式分层内存管理有效防御间接提示注入攻击,显著降低攻击成功率并提升LLM代理的安全性和动态性。

Comments 21 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 幻觉与事实性 7 篇

2602.07179 2026-02-10 cs.HC cs.AI cs.CL cs.CY cs.IT math.IT 67%

An Information-Theoretic Framework for Comparing Voice and Text Explainability

一种信息论框架用于比较语音和文本的可解释性

Mona Rajhans, Vishal Khawarey

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出了一种信息论框架,用于比较语音和文本在AI系统可解释性中的效果,发现类比基于的交付在理解效率与信任校准之间取得最佳平衡。

Comments Accepted for publication at the 10th ACM International Conference on Intelligent Systems, Metaheuristics & Swarm Intelligence (ISMSI 2026), April 24-26, Cebu City, Phillipines

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08272 2026-02-10 cs.LG cs.AI 62%

When Do Multi-Agent Systems Outperform? Analysing the Learning Efficiency of Agentic Systems

多智能体系统何时表现更优?分析智能体系统的学习效率

Junwei Su, Chuan Wu

机构 * Department of Computer Science, University of Hong Kong(计算机科学系,香港大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文研究多智能体强化学习在大语言模型中的学习效率,通过理论分析揭示任务分解与对齐对样本复杂性的影响,明确MARL在特定任务下的优势条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10602 2026-02-10 cs.CV cs.AI cs.CL 62%

TruthPrInt: Mitigating Large Vision-Language Models Object Hallucination Via Latent Truthful-Guided Pre-Intervention

TruthPrInt: 通过潜在真实引导预干预缓解大视觉-语言模型对象幻觉

Jinhao Duan, Fei Kong, Hao Cheng, James Diffenderfer, Bhavya Kailkhura, Lichao Sun, Xiaofeng Zhu, Xiaoshuang Shi, Kaidi Xu

机构 * Drexel University(德雷塞尔大学) University of Electronic Science and Technology of China(电子科技大学) Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) LLNL(劳伦斯利弗莫尔国家实验室) Lehigh University(莱斯大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 TruthPrInt通过学习真相方向并引导解码过程,有效缓解大视觉-语言模型中的对象幻觉问题。

Comments 15 pages, 9 figures, the first two authors contributed equally, Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07164 2026-02-10 cs.CL cs.AI 62%

Your Language Model Secretly Contains Personality Subnetworks

你的语言模型秘密包含个性子网络

Ruimeng Ye, Zihan Wang, Zinan Ling, Yang Xiao, Manling Li, Xiaolong Ma, Bo Hui

机构 * University of Tulsa(图兰大学) Northwestern University(西北大学) University of Arizona(亚利桑那大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本研究发现大型语言模型内部已嵌入身份子网络,无需外部知识即可实现身份切换和行为调整。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08693 2026-02-10 cs.LG 57%

Reasoning aligns language models to human cognition

推理使语言模型对齐人类认知

Gonçalo Guiomar, Elia Torre, Pehuen Moure, Victoria Shavina, Mario Giulianelli, Shih-Chii Liu, Valerio Mante

机构 * ETH AI Center, Zürich, Switzerland ETH Zürich, Switzerland Institute for Neuroinformatics, University of Zürich \& ETH Zürich, Switzerland University College London, London, United Kingdom

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

AI总结 本研究通过主动概率推理任务揭示语言模型与人类在不确定性决策中的差异,发现延长推理能显著提升推理性能,但对信息获取影响有限。

Comments 38 pages, 4 main figures, multiple appendix figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07674 2026-02-10 cs.LG 57%

ElliCE: Efficient and Provably Robust Algorithmic Recourse via the Rashomon Sets

ElliCE: 通过Rashomon集实现高效且可证明稳健的算法补救

Bohdan Turbal, Iryna Voitsitska, Lesia Semenova

机构 * Princeton University(普林斯顿大学) Ukrainian Catholic University(乌克兰天主教大学) Rutgers University(罗格斯大学) Taras Shevchenko National University of Kyiv(塔拉斯·谢甫琴科基斯林国立大学) Microsoft Research NYC(微软研究院纽约)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

AI总结 ElliCE通过椭球近似Rashomon集,提供高效且可证明稳健的算法补救方法,提升反事实解释的鲁棒性和灵活性。

Journal ref The Thirty-ninth Annual Conference on Neural Information Processing Systems 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21083 2026-02-10 cs.AI 57%

OpenSec: Measuring Incident Response Agent Calibration Under Adversarial Evidence

OpenSec: 在对抗性证据下评估事件响应代理的校准

Jarrod Barnes

机构 * Jarrod Barnes

专题命中 幻觉与事实性 :prompt injection(abstract);分类 cs.AI

AI总结 OpenSec通过双控制强化学习环境评估事件响应代理在对抗性证据下的校准能力,发现前沿模型存在过度触发问题,校准差距体现在克制而非检测。

Comments 7 pages, 3 figures, 3 tables. Code: https://github.com/jbarnes850/opensec-env. Dataset: https://huggingface.co/datasets/Jarrodbarnes/opensec-seeds

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 隐私与版权 1 篇

2511.17118 2026-02-10 cs.CR 50%

Constant-Size Cryptographic Evidence Structures for Regulated AI Workflows

固定大小的加密证据结构用于受监管的AI工作流

Leo Kao

专题命中 隐私与版权 :alignment(abstract)

AI总结 本文提出固定大小的加密证据结构,用于受监管AI工作流,以实现强绑定、固定存储和统一验证,适用于临床试验、医疗决策支持等场景。

Comments 16 pages, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 安全评测 42 篇

2602.07259 2026-02-10 cs.AI 89%

Incentive-Aware AI Safety via Strategic Resource Allocation: A Stackelberg Security Games Perspective

通过战略资源分配实现激励感知的AI安全:从Stackelberg安全游戏视角出发

Cheol Woo Kim, Davin Choo, Tzeh Yuan Neoh, Milind Tambe

机构 * Harvard University(哈佛大学)

专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);alignment(abstract);分类 cs.AI

AI总结 本文提出基于Stackelberg安全游戏的AI安全框架,通过战略资源分配设计激励机制,提升AI监管的主动性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11090 2026-02-10 cs.CL cs.AI 88%

SafeDialBench: A Fine-Grained Safety Evaluation Benchmark for Large Language Models in Multi-Turn Dialogues with Diverse Jailbreak Attacks

SafeDialBench: 一种用于多轮对话中大型语言模型安全评估的细粒度基准,针对多样化对抗攻击

Hongye Cao, Sijia Jing, Yanming Wang, Ziyue Peng, Zhixin Bai, Zhe Cao, Meng Fang, Fan Feng, Boyan Wang, Jiaheng Liu, Tianpei Yang, Jing Huo, Yang Gao, Fanyu Meng, Xi Yang, Chao Deng, Junlan Feng

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) University of Liverpool(利物浦大学) City University of Hong Kong(香港城市大学) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) China Mobile Research Institute(中国移动研究院) China Mobile (Suzhou) Software Technology Co., Ltd(中国移动苏州软件技术有限公司)

专题命中 安全评测 :safety(title,abstract);jailbreak(title,abstract);分类 cs.CL、cs.AI

AI总结 SafeDialBench提出了一种细粒度基准,用于评估大型语言模型在多轮对话中面对多样化对抗攻击时的安全性,通过多维度分类和对抗攻击策略提升评估精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07376 2026-02-10 cs.CL 83%

Do Large Language Models Reflect Demographic Pluralism in Safety?

大语言模型在安全领域是否反映了人口多样性?

Usman Naseem, Gautam Siddharth Kashyap, Sushant Kumar Ray, Rafiq Ali, Ebad Shabbir, Abdullah Mohammad

机构 * Macquarie University(麦考瑞大学) University of Delhi(德里大学) DSEU-Okhla

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.CL

AI总结 Demo-SafetyBench通过在提示级别建模人口多样性,实现了在安全评估中兼顾可扩展性和人口鲁棒性。

Comments Accepted at EACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08369 2026-02-10 cs.AI cs.CL cs.LG 82%

MemAdapter: Fast Alignment across Agent Memory Paradigms via Generative Subgraph Retrieval

MemAdapter:通过生成子图检索实现跨代理记忆范式的快速对齐

Xin Zhang, Kailai Yang, Chenyue Li, Hao Li, Qiyu Wei, Jun'ichi Tsujii, Sophia Ananiadou

机构 * The University of Manchester(曼彻斯特大学) Stanford University(斯坦福大学) Imperial College London(伦敦帝国理工学院) National Institute of Advanced Industrial Science(国家先进工业科学与技术研究院)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MemAdapter通过生成子图检索实现跨代理记忆范式的快速对齐,提升记忆检索灵活性并降低对齐成本,实验显示其性能优于现有系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05656 2026-02-10 cs.LG cs.AI 82%

Alignment Verifiability in Large Language Models: Normative Indistinguishability under Behavioral Evaluation

大语言模型对齐的可验证性:行为评估下的规范不可区分性

Igor Santos-Grueiro

机构 * Igor Santos-Grueiro(独立研究者)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 本文研究了大语言模型对齐的可验证性,指出行为评估无法唯一确定潜在对齐,提出了规范不可区分性概念,并通过实验验证了在评估意识下行为基准的局限性。

Comments 10 pages. Theoretical analysis of behavioral alignment evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08136 2026-02-10 cs.CV cs.AI 81%

Robustness of Vision Language Models Against Split-Image Harmful Input Attacks

视觉语言模型对分裂图像有害输入攻击的鲁棒性

Md Rafi Ur Rashid, MD Sadik Hossain Shanto, Vishnu Asutosh Dasu, Shagufta Mehnaz

机构 * Pennsylvania State University(宾夕法尼亚州立大学) Bangladesh University of Engineering and Technology(孟加拉工程与技术大学)

专题命中 安全评测 :alignment(abstract);RLHF(abstract);safety(abstract);jailbreak(abstract)

AI总结 本研究提出分裂图像视觉陷阱攻击(SIVA),揭示视觉语言模型在面对分裂图像攻击时的安全漏洞,并通过对抗性知识蒸馏算法提升跨模型攻击效果。

Comments 22 Pages, long conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11699 2026-02-10 cs.CY 79%

Frontier AI Auditing: Toward Rigorous Third-Party Assessment of Safety and Security Practices at Leading AI Companies

前沿AI审计:迈向对领先AI公司安全与安全实践的严格第三方评估

Miles Brundage, Noemi Dreksler, Aidan Homewood, Sean McGregor, Patricia Paskov, Conrad Stosz, Girish Sastry, A. Feder Cooper, George Balston, Steven Adler, Stephen Casper, Markus Anderljung, Grace Werner, Soren Mindermann, Vasilios Mavroudis, Ben Bucknall, Charlotte Stix, Jonas Freund, Lorenzo Pacchiardi, Jose Hernandez-Orallo, Matteo Pistillo, Michael Chen, Chris Painter, Dean W. Ball, Cullen O'Keefe, Gabriel Weil, Ben Harack, Graeme Finley, Ryan Hassan, Scott Emmons, Charles Foster, Anka Reuel, Bri Treece, Yoshua Bengio, Daniel Reti, Rishi Bommasani, Cristian Trout, Ali Shahin Shamsabadi, Rajiv Dattani, Adrian Weller, Robert Trager, Jaime Sevilla, Lauren Wagner, Lisa Soder, Ketan Ramakrishnan, Henry Papadatos, Malcolm Murray, Ryan Tovcimak

专题命中 安全评测 :safety(title,abstract);分类 cs.CY

AI总结 本文提出前沿AI审计的愿景,通过四个AI保证级别提升安全与安全实践的评估标准,推动行业高质量审计生态建设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07414 2026-02-10 cs.AI cs.CL 76%

Can LLMs Truly Embody Human Personality? Analyzing AI and Human Behavior Alignment in Dispute Resolution

LLMs真的能体现人类个性吗?分析AI与人类行为在纠纷解决中的对齐

Deuksin Kwon, Kaleen Shrestha, Bin Han, Spencer Lin, James Hale, Jonathan Gratch, Maja Matarić, Gale M. Lucas

专题命中 安全评测 :alignment(title);分类 cs.CL、cs.AI

AI总结 本文研究LLMs在模拟人类人格驱动的冲突行为方面的有效性,通过评估框架和数据集方法,揭示LLMs在纠纷解决中与人类行为的显著差异。

Comments AAAI 2026 (Special Track: AISI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03152 2026-02-10 cs.CL cs.AI cs.LG 75%

MedVAL: Toward Expert-Level Medical Text Validation with Language Models

MedVAL: 向语言模型的专家级医学文本验证迈进

Asad Aali, Vasiliki Bikia, Maya Varma, Nicole Chiou, Sophie Ostmeier, Arnav Singhvi, Magdalini Paschali, Ashwin Kumar, Andrew Johnston, Karimar Amador-Martinez, Eduardo Juan Perez Guerrero, Paola Naovi Cruz Rivera, Sergios Gatidis, Christian Bluethgen, Eduardo Pontes Reis, Eddy D. Zandee van Rilland, Poonam Laxmappa Hosamani, Kevin R Keet, Minjoung Go, Evelyn Ling, David B. Larson, Curtis Langlotz, Roxana Daneshjou, Jason Hom, Sanmi Koyejo, Emily Alsentzer, Akshay S. Chaudhari

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MedVAL通过自监督蒸馏方法,利用合成数据提升语言模型在医学文本验证中的性能,达到专家级别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08086 2026-02-10 cs.LG 74%

Probability Hacking and the Design of Trustworthy ML for Signal Processing in C-UAS: A Scenario Based Method

概率黑客与用于无人机系统(C-UAS)信号处理的可信机器学习设计:基于场景的方法

Liisa Janssens, Laura Middeldorp

专题命中 安全评测 :trustworthy(title);分类 cs.LG

AI总结 本文提出了一种基于场景的方法,用于增强C-UAS的信号处理能力,通过识别法律机制中的要求来防止概率黑客,从而提升系统的可信度。

Comments 6 pages, Pre-publication. Copyright 2026 IEEE. Peer Reviewed. Accepted at ICASSP 2026 - 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), scheduled for 3-8 May 2026 in Barcelona, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07963 2026-02-10 cs.CL cs.AI 73%

Lost in Translation? A Comparative Study on the Cross-Lingual Transfer of Composite Harms

迷失在翻译中?复合危害的跨语言迁移比较研究

Vaibhav Shukla, Hardik Sharma, Adith N Reganti, Soham Wasmatkar, Bagesh Kumar, Vrijendra Singh

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过复合危害基准测试,探讨了跨语言迁移中安全对齐的稳定性,发现攻击成功率在印度语言中显著上升,但上下文性危害迁移较温和,强调翻译基准在多语言安全测试中的必要性。

Comments Accepted at the AICS Workshop, AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22636 2026-02-10 cs.AI 70%

Statistical Estimation of Adversarial Risk in Large Language Models under Best-of-N Sampling

在最佳-N采样下对大语言模型中的对抗风险进行统计估计

Mingqian Feng, Xiaodong Liu, Weiwei Yang, Chenliang Xu, Christopher White, Jianfeng Gao

机构 * University of Rochester(罗切斯特大学) Microsoft Research(微软研究院)

专题命中 安全评测 :safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 本研究提出SABER方法,通过Beta分布建模样本成功概率,利用解析缩放定律预测大规模对抗风险,显著降低估计误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08672 2026-02-10 cs.CL cs.LG 62%

Learning to Judge: LLMs Designing and Applying Evaluation Rubrics

学习评判:LLMs设计与应用评价量规

Clemencia Siro, Pourya Aliannejadi, Mohammad Aliannejadi

机构 * Centrum Wiskunde & Informatica (CWI)(荷兰阿姆斯特丹数学与信息学中心)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本文研究LLMs能否自主设计和应用评价量规,发现其在一致性与跨模型泛化上存在差异,需联合建模人类与LLM的评估语言以提升可靠性。

Comments Accepted at EACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.16773 2026-02-10 cs.CY cs.LG stat.AP stat.ML 62%

Advance Real-time Detection of Traffic Incidents in Highways using Vehicle Trajectory Data

利用车辆轨迹数据实现高速公路交通事故的先进实时检测

Sudipta Roy, Samiul Hasan

专题命中 安全评测 :safety(abstract);分类 cs.CY、cs.LG

AI总结 本研究利用车辆轨迹数据和机器学习算法,通过随机森林模型实现高速公路交通事故的先进实时检测,提升事故预警能力。

Comments 19 Pages, 4 Tables, 10 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07562 2026-02-10 cs.LG cs.AI stat.ML 62%

Gaussian Match-and-Copy: A Minimalist Benchmark for Studying Transformer Induction

高斯匹配与复制:一种研究Transformer归纳的极简基准

Antoine Gonon, Alexandre Cordonnier, Nicolas Boumal

机构 * Institute of Mathematics, EPFL, Switzerland(数学研究所,瑞士联邦理工学院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出高斯匹配与复制基准,用于研究Transformer的匹配与复制机制,通过隔离长距离检索信号,分析模型在检索能力上的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08889 2026-02-10 cs.AI 57%

Scalable Delphi: Large Language Models for Structured Risk Estimation

可扩展的德尔菲:用于结构化风险估计的大型语言模型

Tobias Lorenz, Mario Fritz

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出可扩展的德尔菲方法,利用大型语言模型进行结构化风险评估,通过多样化的专家人设和迭代优化,实现了高效且准确的风险估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08716 2026-02-10 cs.CL 57%

PERSPECTRA: A Scalable and Configurable Pluralist Benchmark of Perspectives from Arguments

PERSPECTRA: 一种可扩展且可配置的多元视角论证基准

Shangrui Nie, Kian Omoomi, Lucie Flek, Zhixue Zhao, Charles Welch

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 PERSPECTRA提出了一种结合结构清晰与语义多样性的多元视角论证基准,用于评估模型在处理多个视角时的表示、区分与推理能力。

Comments 15 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏