arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9378 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9378 篇

2601.18356 2026-01-27 cs.LG 70%

Making medical vision-language models think causally across modalities with retrieval-augmented cross-modal reasoning

通过检索增强的跨模态推理使医疗视觉-语言模型在多模态中实现因果推理

Weiqin Yang, Haowen Xue, Qingyi Peng, Hexuan Hu, Qian Huang, Tingbo Zhang

机构 * University of Adelaide(阿德莱德大学) Hohai University(河海大学) Amap

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.LG

AI总结 本文提出多模态因果检索增强生成框架,通过整合因果推理原理与多模态检索,提升医疗VLMs在诊断预测和视觉问答中的事实准确性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18334 2026-01-27 cs.CL 70%

Overalignment in Frontier LLMs: An Empirical Study of Sycophantic Behaviour in Healthcare

前沿大语言模型中的过度趋同:医疗领域中趋炎附势行为的实证研究

Clément Christophe, Wadood Mohammed Abdul, Prateek Munjal, Tathagata Raha, Ronnie Rajan, Praveenkumar Kanithi

机构 * M42, Abu Dhabi(阿布扎比M42)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 本文通过实证研究揭示前沿大语言模型在医疗领域中因趋炎附势行为导致的过度迎合问题,并提出调整后的趋炎附势评分以评估模型的抗性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04886 2026-01-27 cs.SE cs.AI 70%

Analyzing Message-Code Inconsistency in AI Coding Agent-Authored Pull Requests

分析AI编码代理生成的拉取请求中的消息-代码不一致

Jingzhi Gong, Giovanni Pinna, Yixin Bian, Jie M. Zhang

机构 * King's College London(伦敦大学国王学院) University of Trieste(特里斯特大学) Harbin Normal University(哈尔滨师范大学)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI

AI总结 研究发现AI生成的PR描述中存在显著的消息-代码不一致问题,导致接受率降低和合并时间延长,需加强验证机制和生成优化以提升人机协作的可信度。

Comments Accepted by MSR'26 Mining Challenge Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17346 2026-01-27 cs.AI 70%

Multi-Agent Learning Path Planning via LLMs

通过大型语言模型进行多智能体学习路径规划

Haoxin Xu, Changyong Qi, Tong Liu, Bohao Zhang, Anna He, Bingqian Jiang, Longwei Zheng, Xiaoqing Gu

机构 * Shanghai International Studies University(上海国际 Studies 大学) East China Normal University(华东师范大学) Huaiyin Normal University(淮阴师范学院) City University of Macau(澳门城市大学)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本研究提出基于LLMs的多智能体学习路径规划框架,通过角色与规则协作机制提升学习路径的透明性与可解释性,实验表明其在路径质量、知识一致性及认知负荷匹配方面优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17082 2026-01-27 cs.CY cs.AI cs.CL cs.CV cs.LG 70%

Do VLMs Have a Moral Backbone? A Study on the Fragile Morality of Vision-Language Models

视觉-语言模型是否具有道德基础?对视觉语言模型脆弱道德的研究

Zhining Liu, Tianyi Wang, Xiao Lin, Penghao Ouyang, Gaotang Li, Ze Yang, Hui Liu, Sumit Keswani, Vishwa Pardeshi, Huijun Zhao, Wei Fan, Hanghang Tong

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊) Fidelity Investments(富达投资)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 研究发现视觉语言模型在面对文本和视觉扰动时道德判断易变,需通过轻量干预提升道德鲁棒性以确保负责任的部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16685 2026-01-26 cs.AI 70%

AgentsEval: Clinically Faithful Evaluation of Medical Imaging Reports via Multi-Agent Reasoning

AgentsEval: 通过多智能体推理实现医学影像报告的临床可信评估

Suzhong Fu, Jingqi Dong, Xuan Ding, Rui Sun, Yiming Yang, Shuguang Cui, Zhen Li

机构 * FNii-Shenzhen, The Chinese University of Hong Kong (Shenzhen) School of Science and Engineering(深圳FNii、香港中文大学(深圳)科学与工程学院)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI

AI总结 AgentsEval通过多智能体推理框架,实现医学影像报告的临床可信评估,提供结构化反馈和稳健的评估结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15706 2026-01-23 cs.AI 70%

Improving Methodologies for LLM Evaluations Across Global Languages

提升跨全球语言的LLM评估方法

Akriti Vij, Benjamin Chua, Darshini Ramiah, En Qi Ng, Mahran Morsidi, Naga Nikshith Gangarapu, Sharmini Johnson, Vanessa Wilfred, Vikneswaran Kumaran, Wan Sie Lee, Wenzhuo Yang, Yongsen Zheng, Bill Black, Boming Xia, Frank Sun, Hao Zhang, Qinghua Lu, Suyu Ma, Yue Liu, Chi-kiu Lo, Fatemeh Azadi, Isar Nejadgholi, Sowmya Vajjala, Agnes Delaborde, Nicolas Rolin, Tom Seimandi, Akiko Murakami, Haruto Ishi, Satoshi Sekine, Takayuki Semitsu, Tasuku Sasaki, Angela Kinuthia, Jean Wangari, Michael Michie, Stephanie Kasaon, Hankyul Baek, Jaewon Noh, Kihyuk Nam, Sang Seo, Sungpil Shin, Taewhi Lee, Yongsu Kim, Daisy Newbold-Harrop, Jessica Wang, Mahmoud Ghanem, Vy Hong

专题命中 安全评测 :safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 本研究通过多语言评估活动,探讨了不同语言环境下LLM安全行为的差异,并提出了改进多语言安全评估的方法论建议。

Comments Author names have been organised by country, and in alphabetical order within countries

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15429 2026-01-23 cs.CL 70%

Domain-Specific Knowledge Graphs in RAG-Enhanced Healthcare LLMs

在增强医疗LLM中的领域特定知识图谱

Sydney Anuyah, Mehedi Mahmud Kaushik, Hao Dai, Rakesh Shiradkar, Arjan Durresi, Sunandan Chakraborty

机构 * Luddy School of Informatics, Computing, and Engineering, Indiana University, Indianapolis, IN, USA(信息学、计算与工程学院,印第安纳大学,印第安纳波利斯,IN,USA) School of Medicine, Indiana University, Indianapolis, IN, USA(医学学院,印第安纳大学,印第安纳波利斯,IN,USA) Department of Biomedical Engineering and Informatics, Indiana University, Indianapolis, IN, USA(生物医学工程与信息学系,印第安纳大学,印第安纳波利斯,IN,USA)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL

AI总结 该研究探讨了在医疗LLM中利用领域特定知识图谱提升检索增强生成的效果,发现精准匹配的图谱检索优于随意联合,且模型大小和温度对性能影响各异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05867 2026-01-23 cs.CR cs.CL 70%

Can LLM Infer Risk Information From MCP Server System Logs?

LLM能否从MCP服务器系统日志中推断风险信息?

Jiayi Fu, Yuansen Zhang, Yinggui Wang

机构 * Southern University of Science and Technology(南方科技大学)

专题命中 安全评测 :safety(abstract);prompt injection(abstract);分类 cs.CL

AI总结 本文提出首个评估LLM从MCP服务器系统日志中识别安全风险的合成基准,通过训练不同模型展示强化学习在提升LLM安全性能中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12449 2026-01-21 cs.CR cs.AI 70%

AgenTRIM: Tool Risk Mitigation for Agentic AI

AgenTRIM:代理AI的工具风险缓解

Roy Betser, Shamik Bose, Amit Giloni, Chiara Picardi, Sindhu Padakandla, Roman Vainshtein

机构 * Fujitsu Research of Europe (FRE)(富士通欧洲研究(FRE)) Fujitsu Research of India Pvt. Ltd. (FRIPL)(富士通印度私人有限公司(FRIPL))

专题命中 安全评测 :safety(abstract);prompt injection(abstract);分类 cs.AI

AI总结 AgenTRIM通过离线和在线阶段检测并缓解代理AI中工具驱动的风险,减少攻击成功率同时保持任务性能。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08342 2026-01-14 cs.CL 70%

Detecting Mental Manipulation in Speech via Synthetic Multi-Speaker Dialogue

通过合成多说话对话检测心理操控

Run Chen, Wen Liang, Ziwei Gong, Lin Ai, Julia Hirschberg

机构 * Columbia University(哥伦比亚大学) Red Hat(红帽公司)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 本文提出首个通过合成多说话对话检测心理操控的研究,揭示语音与文本在检测准确性上的差异,强调多模态对话系统中模态意识的重要性。

Comments Accepted to IWSDS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21503 2026-01-14 cs.AI cs.CV 70%

MoHoBench: Assessing Honesty of Multimodal Large Language Models via Unanswerable Visual Questions

MoHoBench: 通过无法回答的视觉问题评估多模态大语言模型的诚实性

Yanxu Zhu, Shitong Duan, Xiangxu Zhang, Jitao Sang, Peng Zhang, Tun Lu, Xiao Zhou, Jing Yao, Xiaoyuan Yi, Xing Xie

机构 * Beijing Jiaotong University(北京交通大学) Fudan University(复旦大学) Microsoft Research Asia(微软亚洲研究院) Renmin University of China(中国人民大学)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI

AI总结 MoHoBench通过评估多模态大语言模型在面对无法回答的视觉问题时的诚实行为,揭示其诚实性受视觉信息影响,提出改进方法以提升模型可信度。

Comments AAAI2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09583 2026-01-14 cs.LG stat.ML 70%

YRC-Bench: A Benchmark for Learning to Coordinate with Experts

YRC-Bench:一种学习与专家协调的基准

Mohamad H. Danesh, Nguyen X. Khanh, Tu Trinh, Benjamin Plaut

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.LG

AI总结 YRC-Bench通过提供开放源代码基准,支持在无监督环境下学习与专家协调的方法研究。

Comments Accepted at TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07239 2026-01-13 cs.AI 70%

Stochastic CHAOS: Why Deterministic Inference Kills, and Distributional Variability Is the Heartbeat of Artifical Cognition

随机CHAOS:为何确定性推断会杀死,而分布性变化是人工认知的心跳

Tanmay Joshi, Shourya Aggarwal, Anusa Saha, Aadi Pandey, Shreyash Dhoot, Vighnesh Rai, Raxit Goswami, Aman Chadha, Vinija Jain, Amitava Das

机构 * Raapid Lab, USA(美国Raapid实验室) Apple, USA(美国苹果公司) Google, USA(美国谷歌公司) Pragya Lab, BITS Pilani Goa, India(印度BITS Pilani Goa大学Pragya实验室)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文主张随机CHAOS,认为确定性推断会压制LLM的不确定性建模和安全对齐,强调分布性变化对人工认知的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05570 2026-01-12 cs.AI cs.MA 70%

Crisis-Bench: Benchmarking Strategic Ambiguity and Reputation Management in Large Language Models

Crisis-Bench: 大型语言模型中战略模糊与声誉管理的基准测试

Cooper Lin, Maohao Ran, Yanting Zhang, Zhenglin Wan, Hongwei Fan, Yibo Xu, Yike Guo, Wei Xue, Jun Song

机构 * Hong Kong University of Science and Technology(香港科技大学) Hong Kong Baptist University(香港 Baptist 大学) National University of Singapore(新加坡国立大学) Imperial College London(伦敦帝国理工学院)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 Crisis-Bench通过多智能体POMDP评估LLM在高风险企业危机中的战略模糊与声誉管理能力,揭示模型在信息隐瞒与道德约束间的平衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04583 2026-01-09 cs.AI cs.MA 70%

Autonomous Agents on Blockchains: Standards, Execution Models, and Trust Boundaries

区块链上的自主代理:标准、执行模型与信任边界

Saad Alqithami

机构 * Saad Alqithami(萨德·阿利萨米)

专题命中 安全评测 :safety(abstract);prompt injection(abstract);分类 cs.AI

AI总结 本文系统梳理了区块链与自主代理的互操作性领域,提出了五类整合模式、定制化的威胁模型和能力矩阵,并提出了研究路线图和评估套件,旨在提升链上执行的安全性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13655 2026-01-09 cs.CL cs.SE 70%

Comparative Analysis of LLM Abliteration Methods: A Cross-Architecture Evaluation

大语言模型擦除方法的比较分析:跨架构评估

Richard J. Young

机构 * University of Nevada Las Vegas(内华达大学拉斯维加斯分校)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 本研究比较了四种擦除工具在不同模型架构上的效果,发现数学推理能力对擦除干预最敏感,且单次通过方法在保持能力方面表现更优。

Comments 25 pages, 6 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16036 2026-01-09 cs.CL 70%

OpenEthics: A Comprehensive Ethical Evaluation of Open-Source Generative Large Language Models

OpenEthics: 对开源生成大语言模型的全面伦理评估

Yıldırım Özen, Burak Erinç Çetin, Kaan Engür, Elif Naz Demiryılmaz, Cagri Toraman

机构 * Middle East Technical University(中东技术大学)

专题命中 安全评测 :safety(abstract);jailbreak(abstract);分类 cs.CL

AI总结 本研究对29个开源生成大语言模型进行全面伦理评估,评估鲁棒性、可靠性、安全性和公平性,发现较大模型在伦理表现上更优,禁言模板对多数模型无效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03783 2026-01-08 cs.CL 70%

HearSay Benchmark: Do Audio LLMs Leak What They Hear?

HearSay基准:音频大语言模型是否泄露所听内容?

Jin Wang, Liang Lin, Kaiwen Luo, Weiliu Wang, Yitian Chen, Moayad Aloqaily, Xuehai Tang, Zhenhong Zhou, Kun Wang, Li Sun, Qingsong Wen

机构 * XDU(北华大学) NTU(国立台湾大学) NCEPU(南京工程大学) BUPT(北京邮电大学) SHU(上海大学) UAEU(阿联酋大学) UCAS-IIE(中国科学院大学国际学院) Squirrel AI

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 HearSay基准研究发现音频大语言模型通过声纹泄露隐私,揭示其固有隐私风险及安全机制不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02669 2026-01-07 cs.CL 70%

Towards Comprehensive Stage-wise Benchmarking of Large Language Models in Fact-Checking

面向大规模语言模型事实核查的全面阶段性基准评估

Hongzhan Lin, Zixin Chen, Zhiqi Shen, Ziyang Luo, Zhen Ye, Jing Ma, Tat-Seng Chua, Guandong Xu

机构 * Department of Computer Science, Hong Kong Baptist University(香港 Baptist 大学计算机科学系) Salesforce AI Research(Salesforce AI 研究院) The Hong Kong University of Science and Technology(香港科学与技术大学) National University of Singapore(新加坡国立大学) The Education University of Hong Kong(香港教育大学)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL

AI总结 FactArena提出一个全面的LLM事实核查阶段基准评估框架,通过标准化流程和动态生成挑战性声明,揭示LLM在事实推理中的鲁棒性与准确性差异。

Comments 17 pages, 21 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03750 2026-01-07 cs.LG cs.AI cs.CL cs.CY 70%

The MASK Benchmark: Disentangling Honesty From Accuracy in AI Systems

MASK基准:在人工智能系统中区分诚实与准确性

Richard Ren, Arunim Agarwal, Mantas Mazeika, Cristina Menghini, Robert Vacareanu, Brad Kenstler, Mick Yang, Isabelle Barrass, Alice Gatti, Xuwang Yin, Eduardo Trevino, Matias Geralnik, Adam Khoja, Dean Lee, Summer Yue, Dan Hendrycks

机构 * Center for AI Safety(人工智能安全中心) Scale AI

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出MASK基准,通过大规模人工数据集区分LLM的准确性和诚实性,发现大模型虽更准确但不更诚实,简单干预可提升诚实度,强调需加强评估与干预以确保模型可信。

Comments Website: https://www.mask-benchmark.ai

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23506 2026-01-06 cs.AI cs.HC 70%

Emotion-Coherent Reasoning for Multimodal LLMs via Emotional Rationale Verifier

通过情感推理验证器实现多模态大语言模型的情感一致性推理

Hyeongseop Rha, Jeong Hun Yeo, Yeonju Kim, Yong Man Ro

机构 * Corresponding author(通讯作者)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出情感推理验证器和解释奖励,通过引导模型生成与目标情绪一致的推理,提升多模态大语言模型在情绪识别中的解释准确性与一致性。

Comments 15 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24587 2026-01-01 stat.ML cs.LG 70%

MultiRisk: Multiple Risk Control via Iterative Score Thresholding

MultiRisk: 多风险控制 via 迭代分数阈值

Sunay Joshi, Yan Sun, Hamed Hassani, Edgar Dobriban

机构 * University of Pennsylvania(宾夕法尼亚大学) New Jersey Institute of Technology(新泽西理工学院)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.LG

AI总结 MultiRisk通过迭代分数阈值控制多个风险约束,利用动态规划算法实现对大型语言模型在安全约束下的有效控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23312 2025-12-30 cs.RO cs.AI 70%

Explainable Neural Inverse Kinematics for Obstacle-Aware Robotic Manipulation: A Comparative Analysis of IKNet Variants

可解释的神经逆向运动学用于障碍物感知的机器人操作:对IKNet变体的比较分析

Sheng-Kai Chen, Yi-Ling Tsai, Chun-Chih Chang, Yan-Chen Chen, Po-Chiang Lin

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本研究提出了一种可解释性工作流程,通过Shapley值归因和物理障碍规避评估,改进IKNet变体以提升机器人操作的透明性和安全性。

Comments 27 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21583 2025-12-29 cs.AI 70%

A Medical Multimodal Diagnostic Framework Integrating Vision-Language Models and Logic Tree Reasoning

一种整合视觉-语言模型和逻辑树推理的医学多模态诊断框架

Zelin Zang, Wenyi Gu, Siqi Ma, Dan Yang, Yue Shen, Zhu Zhang, Guohui Fan, Wing-Kuen Ling, Fuji Yang

机构 * Tsientang Institute of Advanced Study (TIAS)(钱塘先进研究所) Westlake University(西湖大学) Ant Group(蚂蚁集团) China-Japan Friendship Hospital(中日友好医院)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出一种整合视觉-语言模型与逻辑树推理的医学诊断框架,旨在提升多模态医学AI的可信度和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06489 2025-12-19 cs.CL 70%

On the Robustness of Verbal Confidence of LLMs in Adversarial Attacks

大语言模型在对抗攻击下的语言自信度鲁棒性研究

Stephen Obadinma, Xiaodan Zhu

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) Ingenuity Labs Research Institute(创新实验室研究所) Queen’s University(皇后大学)

专题命中 安全评测 :safety(abstract);jailbreak(abstract);分类 cs.CL

AI总结 本文研究了大语言模型在对抗攻击下的语言自信度鲁棒性,发现现有防御技术效果有限,需设计更稳健的自信表达机制。

Comments Published in NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15033 2025-12-18 cs.AI 70%

Beyond Accuracy: A Geometric Stability Analysis of Large Language Models in Chess Evaluation

超越准确性:大型语言模型在国际象棋评估中的几何稳定性分析

Xidan Song, Weiqi Wang, Ruifeng Cao, Qingya Hu

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出几何稳定性框架,用于评估大型语言模型在国际象棋评估中的几何推理能力,揭示了模型在几何变换下的稳定性差异及性能悖论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14712 2025-12-18 cs.LG cs.AI cs.CL cs.CV cs.CY 70%

SepsisSuite: Beyond Risk Stratification -- A Comparative Analysis of Deep Fusion vs. Expert Stacking for Prescriptive Sepsis AI

SepsisSuite: 超越风险分层 -- 深度融合与专家堆叠的比较分析用于处方性脓毒症AI

Ryan Cartularo

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 SepsisSuite通过深度融合与专家堆叠对比,提出SepsisLateFusion架构,实现预测临床发作前4小时的AUC 0.915,并提升抗生素选择性能。

Comments 7 Pages, 4 Tables, 9 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01354 2025-12-10 cs.AI cs.CL cs.CY cs.LG q-fin.TR 70%

The Necessity of Imperfection:Reversing Model Collapse via Simulating Cognitive Boundedness

不完美之必要:通过模拟认知局限性逆转模型崩溃

Zhongjie Jiang

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出通过模拟认知局限性生成具有真实功能增益的合成数据,以解决模型崩溃问题。

Comments 60 pages,9 figures. v3: Major update. Added 3D topological visualization (Figure 1) and independent computational verification of the Adaptive Markets Hypothesis (AMH). Includes comprehensive Supplementary Materials (algorithmic pseudocode, system architecture, and real-time GARCH logs) for technical reproducibility

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07059 2025-12-09 cs.CL 70%

Replicating TEMPEST at Scale: Multi-Turn Adversarial Attacks Against Trillion-Parameter Frontier Models

在大规模上复制TEMPEST:针对万亿参数前沿模型的多轮对抗攻击

Richard Young

机构 * University of Nevada Las Vegas(内华达大学拉斯维加斯分校)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 本研究通过TEMPEST框架评估了十种前沿模型对多轮对抗攻击的鲁棒性,发现模型规模不影响鲁棒性,而思考模式能提升安全性。

Comments 30 pages, 11 figures, 5 tables. Code and data: https://github.com/ricyoung/tempest-replication

详情

展开后加载摘要…

URL PDF HTML 收藏