arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-09-01 至 2026-09-01 共收录 222 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 9 篇

2606.03695 2026-09-01 cs.CL 版本更新 57%

Don't Forget Your Embeddings: Robust Knowledge Erasure via Precise Editing of Embeddings

不要忘记你的嵌入:通过精确编辑嵌入实现鲁棒的知识擦除

Clara Haya Suslik, Or Shafran, Mor Geva

机构 * Blavatnik School of Computer Science and AI, Tel Aviv University(巴尔-艾赫伦计算机科学与人工智能学院,特拉维夫大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.CL

AI总结 提出 EMBER 模块,利用稀疏矩阵分解精确擦除词嵌入中的概念相关特征,增强现有知识擦除方法的鲁棒性和特异性。

Comments Accepted at EMNLP Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01359 2026-09-01 cs.CR cs.AI 版本更新 57%

Breaking the Code: Security Assessment of AI Code Agents Through Systematic Jailbreaking Attacks

破解代码:通过系统性越狱攻击对AI代码代理进行安全评估

Shoumik Saha, Jifan Chen, Sam Mayers, Sanjay Krishna Gouda, Zijian Wang, Varun Kumar

机构 * University of Maryland – College Park(马里兰大学-College Park) AWS AI Labs(AWS人工智能实验室) Meta Superintelligence Labs(Meta超智能实验室)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.AI

AI总结 提出JAWS-Bench基准测试,通过三级工作区评估代码LLM代理的越狱风险,发现代理化使攻击成功率提升1.6倍,并揭示可执行攻击代码的高比例。

Comments 22 pages, 18 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29802 2026-09-01 cs.CV 新提交 50%

Foundation and Multimodal Large Language Models for Face Presentation and Morph Attack Detection

用于人脸呈现与变形攻击检测的基础模型及多模态大语言模型

Hatef Otroshi Shahreza, Asif Hussain Khan, Peter Lorenz, Alain Komaty, Sébastien Marcel

机构 * Idiap Research Institute(Idiap研究所) Université de Lausanne(洛桑大学)

专题命中 越狱攻击 :trustworthy(abstract)

AI总结 本文研究通用基础模型和多模态大语言模型是否包含人脸呈现与变形攻击相关信息,通过五种方法在8个公开数据集上测试,发现微调后模型跨数据集检测性能达SOTA,将开源代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21457 2026-09-01 cs.CR 版本更新 50%

SoK: Systematizing Generation, Characteristics, and Defenses in LLM-Generated Phishing

SoK:揭示大语言模型生成钓鱼攻击的生成与检测差距

Fengchao Chen, Tingmin Wu, Van Nguyen, Carsten Rudolph

专题命中 越狱攻击 :safety(abstract)

AI总结 本文首次全面分析大语言模型生成的钓鱼内容,揭示其逃避检测、强调人类认知操控的特点,并指出防御策略与生成方法间的不对称性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 红队测试 3 篇

2603.10807 2026-09-01 q-fin.CP cs.AI cs.CY 版本更新 84%

Risk-Adjusted Harm Scoring for Automated Red Teaming for LLMs in Financial Services

针对金融服务业LLM自动红队测试的风险调整危害评分

Fabrizio Dimino, Bhaskarjit Sarmah, Stefano Pasquali

专题命中 红队测试 :red teaming(title);safety(abstract);jailbreak(abstract_cn);分类 cs.AI、cs.CY

AI总结 本文提出了一种针对金融服务业LLM安全风险的评估框架,通过风险敏感的RAHS度量标准,评估LLM在长期对抗压力下的安全性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18540 2026-09-01 cs.CL cs.CR cs.LG 版本更新 81%

Learning diverse attacks on large language models for robust red-teaming and safety tuning

针对大语言模型学习多样化攻击以用于鲁棒红队测试与安全调优

Seanie Lee, Minsu Kim, Lynn Cherif, David Dobre, Juho Lee, Sung Ju Hwang, Kenji Kawaguchi, Gauthier Gidel, Yoshua Bengio, Esmeralda S. Whitammer, Moksh Jain

机构 * KAIST(韩国科学技术院) Mila – Québec AI Institute(米拉-魁北克人工智能研究所) Université de Montréal(蒙特利尔大学) McGill University(麦吉尔大学) National University of Singapore(新加坡国立大学) University of Edinburgh(爱丁堡大学) CIFAR(加拿大高级研究所)

专题命中 红队测试 :safety(title,abstract);分类 cs.CL、cs.LG

AI总结 该研究针对现有红队测试方法存在的模式崩塌或攻击有效性不足问题,提出GFlowNet微调加二次平滑的方法生成多样化攻击提示,其攻击对各类LLM有效且可迁移,用该攻击提示调优的模型对其他攻击方法具有鲁棒性。

Comments ICLR 2025; code: https://github.com/GFNOrg/red-teaming

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30207 2026-09-01 cs.CR cs.AI 新提交 77%

SIR: Self-improving Red-teaming for Compute Use Agents

SIR:面向计算使用智能体的自改进红队测试

Chen Xiong, Zhiyuan He, Pin-Yu Chen, Stjepan Picek, Tsung-Yi Ho

专题命中 红队测试 :safety(abstract);red teaming(abstract);prompt injection(abstract);分类 cs.AI

AI总结 本文提出SIR,一种针对操作系统层面计算使用智能体的黑盒间接提示注入攻击,通过迭代反馈循环提炼策略,使攻击成功率显著提升且可跨模型迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 提示注入 6 篇

2608.30441 2026-09-01 cs.CR 新提交 82%

ECLIPSE: Self-Evolving Stealthy Prompt Injection Attack against Long-Horizon Agentic Systems

ECLIPSE:针对长视程智能体系统的自演化隐蔽提示注入攻击

Shiqian Zhao, Yangfan Zhou, Xinfeng Li, Runyi Hu, Yechao Zhang, Yi Xie, Tianwei Zhang, Luu Anh Tuan

专题命中 提示注入 :prompt injection(title,abstract);safety(abstract)

AI总结 本研究提出ECLIPSE框架,结合隐蔽攻击轨迹合成与工具链引导,在LASE-Bench上实现高攻击成功率,现有安全措施难以可靠防御,凸显需开发更有效防御手段。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30362 2026-09-01 cs.AI cs.CL 新提交 81%

Will the User Ever Know? Covert Indirect Prompt Injection on Tool-Using LLM Agents

用户会知道吗?针对使用工具的大语言模型智能体的隐蔽间接提示注入攻击

Yunseok Lee, Yunji Kim, Woojin Lee

机构 * Dongguk University-Seoul(东国大学首尔校区)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究针对工具型LLM智能体的间接提示注入攻击,将攻击成功率分解为隐蔽与公开成功率,提出ICoA诱导隐蔽攻击,在AgentDojo的四个模型上提升了隐蔽成功率3.79-12.01个百分点。

Comments EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30041 2026-09-01 cs.CR cs.AI 新提交 74%

Reachability-Based Capability Confinement for LLM Agents under Indirect Prompt Injection

间接提示注入下基于可达性的大语言模型智能体能力约束

Wujie Xiong, Rabimba Karanjai, Yang Lu, Weidong Shi, Lei Xu

专题命中 提示注入 :prompt injection(title);分类 cs.AI

AI总结 针对间接提示注入下大语言模型智能体的权限漏洞,提出SkillGuard防御机制,通过能力限制策略有效降低攻击成功率,且无额外模型调用或令牌开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03204 2026-09-01 cs.CL 版本更新 57%

FocusAgent: Simple Yet Effective Ways of Trimming the Large Context of Web Agents

FocusAgent:修剪网页智能体大上下文的简单有效方法

Imene Kerboua, Sahar Omidi Shayegan, Megh Thakkar, Xing Han Lù, Léo Boisvert, Massimo Caccia, Jérémy Espinas, Alexandre Aussem, Véronique Eglin, Alexandre Lacoste

机构 * LIRIS - CNRS, INSA Lyon, Universite Claude Bernard Lyon 1(LIRIS - CNRS,INSA里昂,克劳德·贝尔纳大学里昂) Esker ServiceNow Research(ServiceNow研究) Mila - Quebec AI Institute(魁北克人工智能研究所) McGill University(麦吉尔大学) Polytechnique Montréal(蒙特利尔理工学院)

专题命中 提示注入 :prompt injection(abstract);分类 cs.CL

AI总结 该研究提出FocusAgent,通过轻量级LLM检索器修剪网页智能体的无关上下文,在保持性能的同时减少观测规模超50%,并降低提示注入攻击风险。

Comments TMLR 08/2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30387 2026-09-01 cs.CR 新提交 50%

Attesting Outputs and Delegation Ancestry in Multi-Agent AI Systems

多智能体AI系统中的输出证明与委托谱系

Lifei Liu, Haoran Yu

专题命中 提示注入 :prompt injection(abstract)

AI总结 该研究针对多智能体AI系统的输出与委托谱系验证问题,提出两层证明设计,对比三种方案,经测试其验证效率满足多服务部署需求,可解决跨部署者的授权与溯源难题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30083 2026-09-01 cs.CR cs.MA 新提交 50%

Zero-Knowledge Predicate Proofs Between AI Agents: A Measured, Cross-Protocol Gateway and the Source-Integrity Gap

AI智能体间的零知识谓词证明:一种可测量的跨协议网关与源完整性缺口

Ashok Subbabhatta Gopalakrishna

专题命中 提示注入 :prompt injection(abstract)

AI总结 该研究提出一种跨协议零知识证明网关,实现AI智能体间的可证数据最小化,解决源完整性缺口问题,经实验验证性能达标且符合GDPR数据最小化原则。

Comments 11 pages, 6 figures, 4 tables. Reference implementation available at https://github.com/45h0kg/zk-proof-gateway

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 幻觉与事实性 14 篇

2608.29492 2026-09-01 cs.CL 新提交 83%

CoCoA: Context-Conditional Cultural Alignment for Large Language Models

CoCoA:面向大语言模型的上下文条件文化对齐

Kyungdon Lee, Wei Xu, Alan Ritter, Dong-Ho Lee, JinYeong Bak

机构 * Sungkyunkwan University(成均馆大学) Georgia Institute of Technology(佐治亚理工学院) University of Southern California(南加利福尼亚大学)

专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.CL

AI总结 CoCoA是面向大语言模型的上下文条件文化对齐框架,通过双上下文训练等方法,可降低实体文化偏见评分且对通用性能影响小,为缓解LLMs实体文化偏见提供新方向。

Comments Accepted to Findings of EMNLP 2026. 22 pages, 4 figures, 19 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14602 2026-09-01 cs.CL cs.AI cs.LG 版本更新 82%

PA3: Policy-Aware Agent Alignment through Chain-of-Thought

PA3: 通过链式推理实现政策感知的智能体对齐

Shubhashis Roy Dipta, Daniel Bis, Kun Zhou, Lichao Wang, Benjamin Z. Yao, Chenlei Guo, Ruhi Sarikaya

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩分校) Amazon Alexa AI(亚马逊Alexa AI)

专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种多阶段对齐方法,通过链式推理让模型在推理时回忆并应用相关业务政策,无需在上下文中包含完整政策,同时引入PolicyRecall奖励和hallucination惩罚,提升性能并减少字数。

Comments Accepted to EMNLP 2026 (main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30676 2026-09-01 cs.AI 新提交 81%

MedAgent-R1: Faithfulness-Aware Reinforcement Learning for Evidence-Grounded Medical Reasoning

MedAgent-R1:面向证据 grounded 医疗推理的忠实性感知强化学习

Jiangwang Chen, Chenghao Zhang, Hengxing Cai

机构 * Tsinghua University(清华大学) DP Technology(第四范式)

专题命中 幻觉与事实性 :safety(summary_cn,abstract);分类 cs.AI

AI总结 MedAgent-R1 针对医疗推理智能体的自信幻觉问题,采用忠实性门控奖励设计,大幅降低引用编造率、提升证据完整性,在 HealthBench Safety 上表现优于 GPT-4o,实现了证据 grounded 的医疗推理优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03136 2026-09-01 cs.CL 版本更新 70%

Beyond the Final Layer: Intermediate Representations for Better Multilingual Calibration in Large Language Models

超越最终层:大型语言模型中用于更好多语言校准的中间表征

Ej Zhou, Caiqi Zhang, Tiancheng Hu, Chengzu Li, Nigel Collier, Ivan Vulić, Anna Korhonen

机构 * Language Technology Lab, University of Cambridge(剑桥大学语言技术实验室)

专题命中 幻觉与事实性 :alignment(abstract);trustworthy(abstract);分类 cs.CL

AI总结 本研究针对多语言校准问题,发现LLMs的后期中间层比最终层更适合提供可靠的多语言置信信号,提出无训练方法LACE以提升多语言校准,助力构建更公平可信的LLMs。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30987 2026-09-01 cs.CL cs.AI cs.LG 新提交 67%

Stick to What You Know: A Study of Knowledge-Aligned Supervised Fine-Tuning

坚持你所知:知识对齐的监督微调研究

Arthur Becker, Jakob Kemmler, David Thulke, Christine Schäfer, Christian Dugast, Hermann Ney

机构 * AppTek GmbH(AppTek有限公司) RWTH Aachen University(亚琛工业大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究提出知识对齐的监督微调方法,引入证据重写、回忆重写两个变体,实验显示其可减少事实幻觉、保留通用能力,回忆重写效果最优且改善弃权行为,证实超知识SFT目标会引发幻觉。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30646 2026-09-01 cs.CL cs.AI cs.LG 新提交 67%

BiG-SURE - Bipartite Graph for Semantic Uncertainty and Reliability Estimation of LLMs

BiG-SURE - 用于大语言模型语义不确定性与可靠性估计的二分图

Debarpan Bhattacharya, Malay Phadke, Sriram Ganapathy

机构 * Indian Institute of Science(印度科学学院)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 BiG-SURE是一种基于跨温度语义一致性的二分图方法,用于黑盒LLMs/VLMs的语义不确定性与可靠性估计,在多类问答任务上提升了弃权AUROC性能。

Comments 22 pages, 9 figures

Journal ref EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02182 2026-09-01 cs.LG cs.CL 版本更新 62%

Bayesian Sparse Low-Rank Adaptation for Large Language Model Uncertainty Estimation

贝叶斯稀疏低秩自适应用于大语言模型不确定性估计

Jijie Zhang, Zhe Ren, Quan Zhang, Dandan Guo

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Michigan State University(密歇根州立大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.LG

AI总结 提出DALorRA,一种变分贝叶斯稀疏框架,通过随机掩码低秩适应中的秩维度实现模型容量正则化和校准,在不牺牲推理精度下提升LLM校准性能。

Comments To appear in EMNLP 2026. 17 pages, 7 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06022 2026-09-01 cs.CL cs.AI 版本更新 62%

AdaFuse: Adaptive Ensemble Decoding with Test-Time Scaling for LLMs

AdaFuse: 用于大语言模型的自适应集成解码与测试时缩放

Chengming Cui, Tianxin Wei, Ziyi Chen, Ruizhong Qiu, Zhichen Zeng, Zhining Liu, Xuying Ning, Duo Zhou, Jingrui He

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 AdaFuse通过自适应集成解码与测试时缩放,提升大语言模型在多种任务上的生成性能。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23765 2026-09-01 cs.CL cs.AI 版本更新 62%

Entropy-Aware Token Rejection for Improving Speculative Decoding

基于熵的推测解码:改进大语言模型推理

Tiancheng Su, Meicong Zhang, Guoxiu He

机构 * School of Economics and Management(经济管理学院)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 基于熵的推测解码通过动态熵惩罚提升大语言模型推理性能,实验表明其在多数情况下优于目标模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29956 2026-09-01 cs.CL 新提交 57%

Detecting Hidden Chain-of-Thought in Large Language Models with Linguistic, Behavioral, and Mechanistic Indicators

基于语言、行为和机制指标检测大语言模型中的隐藏思维链

Armaan Singh, Ryan Trinh Le, Jasmine Kaur, Abdullah Sultan, Edward Lue Chee Lip, Kiran Nijjer, Adnan Ahmed, Vasu Sharma

机构 * Stanford University(斯坦福大学) York University(约克大学) Facebook(脸书)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 本研究提出HCDS指标,通过语言、行为和机制信号检测大语言模型的隐藏思维链,在GSM8K上验证了Qwen3-4B变体存在类潜在推理行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30946 2026-09-01 cs.LG nlin.AO 新提交 57%

Reproducible macroscopic dynamics in a closed-loop human-AI learning system

闭环人机学习系统中可复现的宏观动力学

Minlin Wu, Xu Fang, Yicheng Zhang, Chenyu Zhou, Zhiyi Liu

机构 * Tianli Qiming AI Research Institute(天立启明人工智能研究院) Sichuan Qiming Daren Technology Co., Ltd.(四川启铭达人科技有限公司) Swiss AI Laboratories(瑞士人工智能实验室)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

AI总结 该研究基于297915名学习者的自适应辅导历史,构建人机学习系统的动力学模型,揭示可复现的宏观动力学规律,为理解人机协同学习的行为机制提供了可解释的有效场框架。

Comments 8 figures, 11 supplementary tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06933 2026-09-01 cs.CE cs.CL cs.HC 版本更新 57%

TxSum: User-Centered Ethereum Transaction Understanding with Micro-Level Semantic Grounding

TxSum: 基于微粒语义锚定的用户导向以太坊交易理解

Zifan Peng, Jingyi Zheng, Yule Liu, Huaiyu Jia, Qiming Ye, Jingyu Liu, Xufeng Yang, Mingchen Li, Qingyuan Gong, Xuechao Wang, Xinlei He

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Wuhan University(武汉大学) University of North Texas(北卡罗来纳州立大学) Fudan University(复旦大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL

AI总结 本文提出TxSum任务,通过构建187个复杂以太坊交易数据集,引入MATEX框架提升交易解释质量,使用户对复杂交易的理解率从52.9%提升至76.5%,恶意交易拒绝率提升至88%。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06631 2026-09-01 cs.CL 版本更新 57%

Labels have Human Values: Value Calibration of Subjective Tasks

标签具有人类价值观:主观任务的价值校准

Mohammed Fayiz Parappan, Ricardo Henao

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) Duke University(杜克大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 本文提出MC-STL框架,通过价值集群校准提升主观任务NLP系统的对齐性与性能。

Comments Accepted at EMNLP 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27004 2026-09-01 cs.CV 版本更新 50%

MVC-Bench: Benchmarking Calibration of Medical Vision-Language Models

MVC-Bench:医学视觉-语言模型的校准基准测试

Ashshak Sharifdeen, Shihab Aaqil Ahamed, Ufaq Khan, Muhammad Akhtar Munir, Sujair Ibrahim, Mohamed Rafeek Mareer Ahamed, Yutong Xie, Imran Razzak, Muhammad Haris Khan

机构 * Mohamed bin Zayed University of AI(穆罕默德·本·扎耶德人工智能大学) Sabaragamuwa University of Sri Lanka(斯里兰卡萨巴拉加穆瓦大学) Digital Platform Development, SLT PLC(SLT公共有限公司数字平台开发部)

专题命中 幻觉与事实性 :safety(abstract)

AI总结 该研究针对医学视觉-语言模型校准不足的问题,提出以校准为核心的基准MVC-Bench,通过多维度评估并提出MCM正则化方法,为医疗工作流提供校准改进指导。

Comments Accepted in EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 隐私与版权 5 篇

2605.27790 2026-09-01 cs.LG 版本更新 57%

SYNAPSE: Neuro-Symbolic Visual Thought-to-Text Decoding via Topological Semantic Denoising

SYNAPSE: 通过拓扑语义去噪的神经符号视觉思维到文本解码

Akshaj Murhekar, Abhijit Mishra

机构 * School of Information University of Texas at Austin(信息学院德克萨斯大学奥斯汀分校)

专题命中 隐私与版权 :alignment(abstract);分类 cs.LG

AI总结 提出SYNAPSE框架,利用常识图结构和潜在样本进行推理时符号正则化,稳定脑电到文本解码中的语义生成,无需微调大语言模型。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27426 2026-09-01 cs.CR cs.AI 版本更新 57%

Secret Stealing Attacks on Local LLM Fine-Tuning through Supply-Chain Model Code Backdoors

通过供应链模型代码后门进行本地LLM微调中的秘密窃取攻击

Zi Li, Tian Zhou, Wenze Li, Jingyu Hua, Yunlong Mao, Sheng Zhong

机构 * Nanjing University(南京大学)

专题命中 隐私与版权 :safety(abstract);分类 cs.AI

AI总结 研究揭示本地微调数据中敏感信息泄露风险,提出通过供应链代码后门实现主动执行劫持,引入确定性全链记忆机制,实现高精度秘密窃取,实验表明方法在不干扰主要任务的前提下达到98%以上的ASR。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20382 2026-09-01 cs.CL 版本更新 57%

Graph2Counsel: Clinically Grounded Synthetic Counseling Dialogue Generation from Client Psychological Graphs

Graph2Counsel: 从客户端心理图谱生成临床导向的合成咨询对话

Aishik Mandal, Hiba Arnaout, Clarissa W. Ong, Juliet Bockhorst, Kate Sheehan, Rachael Moldow, Tanmoy Chakraborty, Iryna Gurevych

机构 * UKP Lab, Department of Computer Science and Hessian Center for AI (hessian.AI), Technische Universität Darmstadt(德国达姆施塔特技术大学UKP实验室、计算机科学系和海森人工智能中心(hessian.AI)) Zuse School ELIZA(Zuse学院ELIZA) National Research Center for Applied Cybersecurity ATHENE(应用网络安全国家研究中心ATHENE) Indian Institute of Technology Delhi(印度德里理工学院) Yardi School of Artificial Intelligence(Yardi人工智能学院) University of Louisville(路易斯维尔大学) University of Toledo(托莱多大学)

专题命中 隐私与版权 :safety(abstract);分类 cs.CL

AI总结 本文提出Graph2Counsel框架,通过客户端心理图谱生成合成咨询对话,提升数据真实性与质量,实验表明其在特定性、咨询师能力等方面优于现有数据集。

Comments 60 pages, 56 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏