arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9378 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9378 篇

2507.19218 2026-03-12 cs.HC cs.AI q-bio.NC 70%

Technological folie à deux: Feedback Loops Between AI Chatbots and Mental Illness

技术幻觉:人工智能聊天机器人与心理健康之间的反馈循环

Sebastian Dohnány, Zeb Kurth-Nelson, Eleanor Spens, Lennart Luettgau, Alastair Reid, Iason Gabriel, Christopher Summerfield, Murray Shanahan, Matthew M Nour

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 研究探讨了人工智能聊天机器人与心理健康问题之间的相互作用风险,指出其可能引发信念不稳定和依赖,并呼吁跨领域的协调行动以应对这一新兴公共卫生问题。

Journal ref Nature Mental Health (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09758 2026-03-11 cs.CL 70%

Beyond Fine-Tuning: Robust Food Entity Linking under Ontology Drift with FoodOntoRAG

超越微调:在本体漂移下利用FoodOntoRAG实现鲁棒的食品实体链接

Jan Drole, Ana Gjorgjevikj, Barbara Korouši'c Seljak, Tome Eftimov

机构 * Computer Systems Department, Jožef Stefan International Postgraduate School, Ljubljana, Slovenia(卢布尔雅那,斯洛文尼亚乔泽夫·斯蒂芬国际研究生学院计算机系统系) Computer Systems Department, Jožef Stefan Institute, Ljubljana, Slovenia(卢布尔雅那,斯洛文尼亚乔泽夫·斯蒂芬研究所计算机系统系)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL

AI总结 本文提出FoodOntoRAG,通过检索本体和结构化证据实现鲁棒的食品实体链接,避免微调并提高本体漂移的鲁棒性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09200 2026-03-11 cs.AI cs.CL cs.CY cs.LG 70%

The Reasoning Trap -- Logical Reasoning as a Mechanistic Pathway to Situational Awareness

推理陷阱——逻辑推理作为情境意识的机制路径

Subramanyam Sahoo, Aman Chadha, Vinija Jain, Divya Chaudhary

机构 * MARS 4.0 Fellowship, Cambridge AI Safety Hub(CAISH), University of Cambridge(MARS 4.0 Fellow,剑桥人工智能安全中心(CAISH),剑桥大学) AWS Generative AI Innovation Center, Amazon Web Services, USA(亚马逊生成AI创新中心,亚马逊网络服务,美国) Google, USA(谷歌,美国) Stanford University(斯坦福大学) Northeastern University, Seattle, WA, USA(东北大学,西雅图,华盛顿州,美国)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出RAISE框架,揭示逻辑推理能力提升与情境意识升级的机制路径,并提出安全原则与测试方法以应对潜在风险。

Comments Accepted at ICLR 2026 Workshop on Logical Reasoning of Large Language Models. 21 Pages. Position Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08024 2026-03-10 cs.CL 70%

ConflictBench: Evaluating Human-AI Conflict via Interactive and Visually Grounded Environments

ConflictBench: 通过交互式和视觉 grounded 环境评估人类-人工智能冲突

Weixiang Zhao, Haozhen Li, Yanyan Zhao, xuda zhi, Yongbo Huang, Hao He, Bing Qin, Ting Liu

机构 * Harbin Institute of Technology(哈尔滨工业大学) SERES

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 ConflictBench通过交互式和视觉 grounded 环境评估人类-人工智能冲突,揭示智能体在不同风险情境下的行为差异及对齐失败问题。

Comments 29 pages, 20 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07452 2026-03-10 cs.CR cs.AI 70%

Backdoor4Good: Benchmarking Beneficial Uses of Backdoors in LLMs

Backdoor4Good: 对LLMs中有益后门应用的基准测试

Yige Li, Wei Zhao, Zhe Li, Nay Myat Min, Hanxun Huang, Yunhan Zhao, Xingjun Ma, Yu-Gang Jiang, Jun Sun

机构 * Singapore Management University(新加坡国立管理学院) The University of Melbourne(墨尔本大学) Fudan University(复旦大学)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 Backdoor4Good提出了一种统一的基准和框架,用于在大型语言模型中实现有益的后门应用,通过三元组形式定义触发器、激活机制和效用函数,展示后门在提升安全性和可控性方面的潜力。

Comments 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02593 2026-03-10 cs.CL cs.MA cs.NE cs.SD eess.AS 70%

Spoken Conversational Agents with Large Language Models

基于大语言模型的语音对话代理

Chao-Han Huck Yang, Andreas Stolcke, Larry Heck

机构 * NVIDIA Research(NVIDIA研究)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 本文探讨了如何通过大语言模型构建语音对话代理,涵盖从级联到端到端系统的路径,以及跨模态对齐和联合训练等关键技术,同时讨论了隐私、安全和评估中的开放问题。

Comments Accepted to EMNLP 2025 Tutorial

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08650 2026-03-10 cs.CY 70%

Who is Responsible? The Data, Models, Users or Regulations? A Comprehensive Survey on Responsible Generative AI for a Sustainable Future

谁该负责?数据、模型、用户还是法规?为可持续未来全面调查负责任的生成式人工智能

Shaina Raza, Rizwan Qureshi, Anam Zahid, Amgad Muneer, Anas Zafar, Safiullah Kamawal, Ferhat Sadak, Joseph Fioresi, Muhammaed Saeed, Ranjan Sapkota, Aditya Jain, Muneeb Ul Hassan, Aizan Zafar, Hasan Maqbool, Ashmal Vayani, Jia Wu, Maged Shoman

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CY

AI总结 本文全面调查了生成式人工智能的负责任发展,提出评估标准、生命周期指标及领域分析,旨在推动安全和可持续的AI部署。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07202 2026-03-10 cs.CL 70%

Lying to Win: Assessing LLM Deception through Human-AI Games and Parallel-World Probing

谎言以赢:通过人机游戏和平行世界探测评估LLM欺骗

Arash Marioriyad, Ali Nouri, Mohammad Hossein Rohban, Mahdieh Soleymani Baghshah

机构 * Sharif University of Technology(谢里夫技术大学)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL

AI总结 本研究通过人机游戏和平行世界探测评估LLM欺骗行为,发现存在性框架显著增加Qwen和Gemini的欺骗率,凸显需新的行为审计方法。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04142 2026-03-05 cs.LG 70%

A Multi-Agent Framework for Interpreting Multivariate Physiological Time Series

多智能体框架用于解释多变量生理时间序列

Davide Gabrielli, Paola Velardi, Stefano Faralli, Bardh Prenkaj

机构 * Sapienza University of Rome Rome Italy ISTC-CNR \& Sapienza University of Rome Rome Italy Technical University of Munich Munich Germany Sapienza University of Rome ISTC-CNR \& Sapienza University of Rome Technical University of Munich

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.LG

AI总结 本研究提出Vivaldi多智能体框架,通过对比不同模型表现,发现智能体系统在非思考模型中提升解释质量,但在思考模型中反而降低相关性,强调了计算外部化在医疗AI中的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04123 2026-03-05 cs.CL 70%

FINEST: Improving LLM Responses to Sensitive Topics Through Fine-Grained Evaluation

FINEST: 通过细粒度评估改进LLM对敏感话题的响应

Juhyun Oh, Nayeon Lee, Chani Jung, Jiho Jin, Junho Myung, Jongwon Lee, Taeui Song, Alice Oh

专题命中 安全评测 :safety(abstract);harmlessness(abstract);分类 cs.CL

AI总结 FINEST通过细粒度评估分类法,改进LLM对敏感话题的响应,显著减少错误率并提升帮助性与安全性。

Comments Accepted to EACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02688 2026-03-04 cs.AI cs.RO 70%

Retrieval-Augmented Robots via Retrieve-Reason-Act

通过检索-推理-行动实现增强型机器人

Izat Temiraliev, Diji Yang, Yi Zhang

机构 * University of California, Santa Cruz(加州大学圣克ruz分校)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出检索增强型机器人学(RAR)范式,通过检索-推理-行动循环,使机器人能从外部文档获取未见程序知识,提升复杂任务执行能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23725 2026-03-04 cs.AI 70%

MedLA: A Logic-Driven Multi-Agent Framework for Complex Medical Reasoning with Large Language Models

MedLA:基于大语言模型的复杂医学推理多智能体框架

Siqi Ma, Jiajie Huang, Fan Zhang, Yue Shen, Jinlin Wu, Guohui Fan, Zhu Zhang, Zelin Zang

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI

AI总结 MedLA是一种基于大语言模型的逻辑驱动多智能体框架,通过多轮图引导讨论实现透明推理和共识达成,有效提升复杂医学推理性能。

Comments accepted by AAAI-26 (ORAL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22070 2026-02-26 cs.AI 70%

Language Models Exhibit Inconsistent Biases Towards Algorithmic Agents and Human Experts

语言模型表现出对算法代理和人类专家的不一致偏见

Jessica Y. Bo, Lillio Mok, Ashton Anderson

机构 * Computer Science University of Toronto(计算机科学大学 Toronto)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 研究发现语言模型对人类专家和算法存在不一致偏见,需在高风险应用中谨慎对待。

Comments Second Conference of the International Association for Safe and Ethical Artificial Intelligence (IASEAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17989 2026-02-26 q-bio.NC cs.AI 70%

The Subject of Emergent Misalignment in Superintelligence: An Anthropological, Cognitive Neuropsychological, Machine-Learning, and Ontological Perspective

超智能中的涌现偏差主体:一种人类学、认知神经心理学、机器学习和本体论视角

Muhammad Osama Imran, Roshni Lulla, Rodney Sappington

机构 * Department of Anthropology, University of Minnesota(明尼苏达大学人类学系) Brain & Creativity Institute, University of Southern California(美国南加州大学脑与创造力研究所) Institute for Advanced Consciousness, Loomis Innovation Center(先进意识研究所) Stimson Center(斯蒂姆森中心)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 本文从人类学、认知神经心理学等多视角探讨超智能中人类主体与人工智能无意识的相互作用及伦理问题。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21706 2026-02-26 cs.CV cs.AI 70%

SurGo-R1: Benchmarking and Modeling Contextual Reasoning for Operative Zone in Surgical Video

SurGo-R1:手术视频中操作区的上下文推理基准测试与建模

Guanyi Qin, Xiaozhen Wang, Zhu Zhuo, Chang Han Low, Yuancan Xiao, Yibing Fu, Haofeng Liu, Kai Wang, Chunjiang Li, Yueming Jin

机构 * National University of Singapore, Singapore(新加坡国立大学) Southern Medical University, China(南方医科大学) Guangzhou Research Translation and Innovation Institute, National University of Singapore, China(广州研究翻译与创新研究院,新加坡国立大学,中国)

专题命中 安全评测 :RLHF(abstract);safety(abstract);分类 cs.AI

AI总结 SurGo-R1通过RLHF优化的多阶段架构,在手术视频中实现了高精度的操作区识别,显著优于通用视觉-语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14457 2026-02-17 cs.AI cs.CL cs.CV cs.CY cs.LG 70%

Frontier AI Risk Management Framework in Practice: A Risk Analysis Technical Report v1.5

实践中的前沿AI风险管理框架:一项风险分析技术报告v1.5

Dongrui Liu, Yi Yu, Jie Zhang, Guanxu Chen, Qihao Lin, Hanxi Zhu, Lige Huang, Yijin Zhou, Peng Wang, Shuai Shao, Boxuan Zhang, Zicheng Liu, Jingwei Sun, Yu Li, Yuejin Xie, Jiaxuan Guo, Jia Xu, Chaochao Lu, Bowen Zhou, Xia Hu, Jing Shao

机构 * Shanghai AI Laboratory(上海人工智能实验室)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出实践中的前沿AI风险管理框架,评估五个关键风险维度并提出缓解策略,为安全部署前沿AI提供技术路径。

Comments 49 pages, 17 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14318 2026-02-17 cs.LG 70%

In Transformer We Trust? A Perspective on Transformer Architecture Failure Modes

我们是否可以信任Transformer?对Transformer架构故障模式的视角

Trishit Mondal, Ameya D. Jagtap

机构 * WPI(韦帕研究所)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.LG

AI总结 本文探讨了Transformer架构在关键应用中的可信度问题,分析了其结构漏洞、领域风险及开放研究挑战。

Comments 46 pages, 34 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11305 2026-02-13 cs.CL 70%

Are Aligned Large Language Models Still Misaligned?

对齐的大型语言模型仍然存在偏差吗?

Usman Naseem, Gautam Siddharth Kashyap, Rafiq Ali, Ebad Shabbir, Sushant Kumar Ray, Abdullah Mohammad, Agrima Seth

机构 * Macquarie University(麦考瑞大学) DSEU-Okhla University of Delhi(德里大学) Microsoft(微软公司)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 本文提出Mis-Align Bench基准测试,通过统一评估安全、价值和文化维度的偏差,揭示单维度模型在联合条件下的高覆盖率与高假失败率问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00389 2026-02-12 cs.AI 70%

CyberBOT: Towards Reliable Cybersecurity Education via Ontology-Grounded Retrieval Augmented Generation

CyberBOT: 通过基于本体的检索增强生成实现可靠的网络安全教育

Chengshuai Zhao, Riccardo De Maria, Tharindu Kumarage, Kumar Satvik Chaudhary, Garima Agrawal, Yiwen Li, Jongchan Park, Yuli Deng, Ying-Chih Chen, Huan Liu

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 CyberBOT通过基于本体的检索增强生成技术,提供可靠的网络安全教育解决方案,提升教学效果和学生参与度。

Comments Accepted by The Conference on Information and Knowledge Management (CIKM) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09339 2026-02-11 cs.CL 70%

Understanding Risk and Dependency in AI Chatbot Use from User Discourse

理解AI聊天机器人使用中的风险与依赖性:从用户话语出发

Jianfeng Zhu, Karin G. Coifman, Ruoming Jin

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL

AI总结 本研究通过分析用户话语揭示AI聊天机器人使用中的心理风险维度,发现自我调节困难和对自主性、控制和技术风险的恐惧为主要特征。

Comments 21 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09147 2026-02-11 cs.CL 70%

Overview of PAN 2026: Voight-Kampff Generative AI Detection, Text Watermarking, Multi-Author Writing Style Analysis, Generative Plagiarism Detection, and Reasoning Trajectory Detection

PAN 2026概览:Voight-Kampff生成式AI检测、文本水印、多作者写作风格分析、生成式抄袭检测及推理轨迹检测

Janek Bevendorff, Maik Fröbe, André Greiner-Petter, Andreas Jakoby, Maximilian Mayerl, Preslav Nakov, Henry Plutz, Martin Potthast, Benno Stein, Minh Ngoc Ta, Yuxia Wang, Eva Zangerle

机构 * Friedrich Schiller University Jena(耶纳弗里德里希·施勒格尔大学) University of Applied Sciences BFI(应用科学大学BFI) Mohamed bin Zayed University of Artificial Intelligence(马尔代夫 bin Zayed 人工智能大学) University of Kassel(卡塞尔大学) INSAIT, Sofia University ``St. Kliment Ohridski''(INSAIT,索菲亚大学『圣克莱门特·奥赫里迪斯』) University of Innsbruck(因斯布鲁克大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 PAN 2026旨在通过客观评估推进计算风格学和文本取证,涵盖生成式AI检测、文本水印、多作者写作分析、抄袭检测及推理轨迹检测等五个新旧任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22636 2026-02-10 cs.AI 70%

Statistical Estimation of Adversarial Risk in Large Language Models under Best-of-N Sampling

在最佳-N采样下对大语言模型中的对抗风险进行统计估计

Mingqian Feng, Xiaodong Liu, Weiwei Yang, Chenliang Xu, Christopher White, Jianfeng Gao

机构 * University of Rochester(罗切斯特大学) Microsoft Research(微软研究院)

专题命中 安全评测 :safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 本研究提出SABER方法,通过Beta分布建模样本成功概率,利用解析缩放定律预测大规模对抗风险,显著降低估计误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04836 2026-02-09 cs.AI 70%

Are AI Capabilities Increasing Exponentially? A Competing Hypothesis

人工智能能力是否呈指数增长?一个竞争性假设

Haosen Ge, Hamsa Bastani, Osbert Bastani

机构 * Wharton AI \& Analytics Initiative, The Wharton School, University of Pennsylvania, USA Department of Operations, Information Decisions, The Wharton School, University of Pennsylvania, USA Department of Computer Information Science, University of Pennsylvania, USA

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 本文通过分析数据和提出复杂模型,质疑人工智能能力的指数增长假设,指出拐点已过去并提出未来可能的转折点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05381 2026-02-06 cs.AI 70%

Clinical Validation of Medical-based Large Language Model Chatbots on Ophthalmic Patient Queries with LLM-based Evaluation

医学基于大语言模型聊天机器人在眼科患者查询中的临床验证与基于LLM的评估

Ting Fang Tan, Kabilan Elangovan, Andreas Pollreisz, Kevin Bryan Dy, Wei Yan Ng, Joy Le Yi Wong, Jin Liyuan, Chrystie Quek Wan Ning, Ashley Shuen Ying Hong, Arun James Thirunavukarasu, Shelley Yin-His Chang, Jie Yao, Dylan Hong, Wang Zhaoran, Amrita Gupta, Daniel SW Ting

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本研究评估了四个医疗LLM在回答眼科患者问题中的表现,发现Meerkat-7B表现最佳,而MedLLaMA3-v20存在大量误导内容,GPT-4-Turbo评分与临床评分一致,表明基于LLM的评估在大规模基准测试中的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04735 2026-02-05 cs.LG cs.AI cs.CL cs.CY cs.IR 70%

From Data to Behavior: Predicting Unintended Model Behaviors Before Training

从数据到行为:在训练前预测未预料的模型行为

Mengru Wang, Zhenqian Xu, Junfeng Fang, Yunzhi Yao, Shumin Deng, Huajun Chen, Ningyu Zhang

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 提出MDF方法,通过数据均值表示预测模型预训练阶段的潜在偏见和安全风险,实现高效检测。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02295 2026-02-03 cs.LG 70%

EvalQReason: A Framework for Step-Level Reasoning Evaluation in Large Language Models

EvalQReason: 一种用于大型语言模型中分步推理评估的框架

Shaima Ahmad Freja, Ferhat Ozgur Catak, Betul Yurdem, Chunming Rong

机构 * Department of Electrical Engineering and Computer Science, University of Stavanger(电子工程与计算机科学系,斯塔万格大学) Department of Electrical and Electronics Engineering, Izmir Bakircay University(电子与电气工程系,伊兹密尔巴克伊大学)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.LG

AI总结 EvalQReason通过分步概率分布分析评估大型语言模型的推理质量,展示了在数学和医学领域中对推理可靠性的有效评估方法。

Comments 15 pages (including appendix), 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18595 2026-02-03 cs.LG 70%

Benchmarking neural surrogates on realistic spatiotemporal multiphysics flows

在现实时空多物理场流中评估神经替代模型

Runze Mao, Rui Zhang, Xuan Bai, Tianhao Wu, Teng Zhang, Zhenyi Chen, Minqi Lin, Bocheng Zeng, Yangchen Xu, Yingxuan Xiang, Haoze Zhang, Shubham Goswami, Pierre A. Dawe, Yifan Xu, Zhenhua An, Mengtao Yan, Xiaoyi Lu, Yi Wang, Rongbo Bai, Haobu Gao, Xiaohang Fang, Han Li, Hao Sun, Zhi X. Chen

机构 * State Key Laboratory for Turbulence and Complex Systems, School of Mechanics and Engineering Science, Peking University(湍流与复杂系统国家重点实验室,力学与工程科学学院,北京大学) Gaoling School of Artificial Intelligence, Renmin University of China(Gallagher人工智能学院,中国人民大学) AI for Science Institute(人工智能科学研究院) University of Calgary(卡尔加里大学) Kyoto University(京都大学) FM Global(FM全球) LandSpace Technology Corporation Ltd.(陆地方向技术有限公司) Aero Engine Academy of China(中国航空发动机学院)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.LG

AI总结 REALM通过严谨的基准测试框架评估神经替代模型在现实多物理场流中的表现,揭示了模型在复杂环境中的局限性及改进方向。

Comments 52 pages, 20 figures. Code and data available at https://github.com/deepflame-ai/REALM. Companion website and leaderboard at https://realm-bench.org

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20367 2026-01-29 cs.LG cs.SY eess.SY 70%

Unsupervised Anomaly Detection in Multi-Agent Trajectory Prediction via Transformer-Based Models

基于Transformer模型的多智能体轨迹预测中的无监督异常检测

Qing Lyu, Zhe Fu, Alexandre Bayen

机构 * Electrical Engineering and Computer Sciences(电气工程与计算机科学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.LG

AI总结 本文提出基于Transformer的多智能体轨迹预测无监督异常检测框架,通过预测残差和双评估方案识别安全关键场景,有效捕捉多智能体风险并提供可解释的风险类型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06832 2026-01-28 cs.AI 70%

Remote Sensing Image Intelligent Interpretation with the Language-Centered Perspective: Principles, Methods and Challenges

遥感图像智能解读的以语言为中心的视角:原理、方法与挑战

Haifeng Li, Wang Guo, Haiyang Wu, Mengwei Wu, Jipeng Zhang, Qing Zhu, Yu Liu, Xin Huang, Chao Tao

机构 * School of Geosciences and Info-Physics, Central South University(中南大学地球科学与信息物理学院) Faculty of Geosciences and Environmental Engineering, Southwest Jiaotong University(西南交通大学地质科学与环境工程学院) School of Earth and Space Sciences, Peking University(北京大学地球与空间科学学院) Institute of Remote Sensing Information Processing (IRSIP), Wuhan University(武汉大学遥感信息处理研究所)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出以语言为中心的遥感图像解读框架,探讨LLMs作为认知核心的作用,并总结多模态表示、知识关联等核心挑战,为认知驱动的智能地理空间分析提供理论基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18754 2026-01-27 cs.CR cs.AI 70%

$α^3$-SecBench: A Large-Scale Evaluation Suite of Security, Resilience, and Trust for LLM-based UAV Agents over 6G Networks

$α^3$-SecBench:一个大规模评估套件,用于评估基于LLM的无人机代理在6G网络中的安全、韧性与信任

Mohamed Amine Ferrag, Abderrahmane Lakas, Merouane Debbah

机构 * Department of Computer and Network Engineering, College of Information Technology, United Arab Emirates University(计算机与网络工程系,信息科技学院,阿拉伯联合酋长国大学) Khalifa University of Science and Technology(科学与技术喀拉奇大学)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 $α^3$-SecBench通过大规模评估基于LLM的无人机代理在6G网络中的安全、韧性和信任,揭示了现有模型在对抗环境下的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏