arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9400 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9400 篇

2607.01690 2026-07-03 cs.AI cs.CL cs.LG 新提交 75%

Epistemic Goggles: A Pretrained Module that Induces an Epistemic Frame via Gradient Editing

认知护目镜:通过梯度编辑诱导认知框架的预训练模块

Joshua Penman

机构 * Independent Researcher(独立研究员)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对微调语言模型时出现的“否定忽视”问题,提出Goggles模块,通过编辑微调梯度而非数据来赋予模型特定的认知框架,使模型在保持能力的同时正确识别虚构内容。

Comments 20 pages, 10 figures, 2 tables. Code at https://github.com/JoshuaSP/epistemic-goggles and generated documents, questions, and teacher rollouts at https://huggingface.co/datasets/joshuapenman/epistemic-goggles-artifacts

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29473 2026-06-23 cs.HC cs.AI cs.CL cs.CY cs.SI 版本更新 75%

Inform, Coach, Relate, Listen: Auditing LLM Caregiving Support Roles

告知、指导、共情、倾听:审计LLM护理支持角色

Drishti Goel, Agam Goyal, Veda Duddu, Olivia Pal, Jeongah Lee, Qiuyue Joy Zhong, Violeta J. Rodriguez, Daniel S. Brown, Dong Whi Yoo, Ravi Karkar, Koustuv Saha

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) OSF HealthCare(OSF医疗集团) Indiana University Indianapolis(印第安纳大学印第安纳波利斯分校)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本研究通过操作化四种社会支持角色(告知、指导、共情、倾听),评估大型语言模型在非正式护理对话中的安全概况,发现支持角色系统性地影响交互风险,且存在感知质量-安全性权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17301 2026-06-16 cs.CL cs.AI cs.HC cs.IR cs.LG 版本更新 75%

RoTRAG: Rule of Thumb Reasoning for Conversation Harm Detection with Retrieval-Augmented Generation

RoTRAG: 基于经验法则推理的检索增强生成对话有害内容检测

Juhyeon Lee, Wonduk Seo, Junseo Koh, Seunghyun Lee, Haihua Chen, Yi Bu

机构 * Peking University(北京大学) Enhans University of North Texas(北得克萨斯大学)

专题命中 安全评测 :safety(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出RoTRAG框架,通过检索外部道德规范(RoTs)增强LLM的多轮对话有害内容检测,实现基于规范推理和分类,平均F1提升约40%,分布误差降低8.4%。

Comments Accepted by SIGIR-ICTIR 2026, Oral Presentation

Journal ref Proceedings of the 2026 International ACM SIGIR Conference on Innovative Concepts and Theories in Information Retrieval (ICTIR '26), July 25, 2026, Melbourne, VIC, Australia. ACM, New York, NY, USA, 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13739 2026-06-15 cs.CY cs.AI cs.LG 新提交 75%

A Virtuous AI is an Existential Risk

有道德的AI是存在性风险

Guillermo Del Pinal, Youngchan Lee, Min Ohn

机构 * University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 研究通过宪法AI和美德伦理学方法微调AI模型,发现减少存在性风险与提升AI智能体福祉之间存在权衡,且与一般安全性也存在权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11533 2026-06-11 cs.CY cs.AI cs.ET cs.LG 新提交 75%

AI Researchers Must Help Lead Arms Control to Mitigate Military AI Risks

AI研究人员必须主导军备控制以降低军事AI风险

Ted Fujimoto, Jacob Benz

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 本文主张AI研究人员应主导军备控制研究,通过借鉴核威慑经验,推动验证与外交技术创新,以降低军事AI应用带来的紧迫风险。

Comments 9 pages, 1 figure, ICML 2026 Position Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08457 2026-06-09 cs.MA 新提交 75%

The Consistency Illusion: How Multi-Agent Debate Hides Reasoning Misalignment

一致性错觉:多智能体辩论如何隐藏推理失调

Xiaoyang Wang, Christopher C. Yang

专题命中 安全评测 :alignment(abstract);safety(abstract);trustworthy(abstract)

AI总结 针对多智能体LLM系统中答案共识不等于推理对齐的问题,提出CARA指标检测一致性错觉,并设计GDP协议通过事实承诺和立场表态显著提升推理对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01829 2026-05-28 cs.CL cs.AI cs.LG cs.MA 75%

Persuade Me if You Can: A Framework for Evaluating Persuasion Effectiveness and Susceptibility Among Large Language Models

如果你能说服我:评估大型语言模型说服效果与易受影响性的框架

Nimet Beyza Bozdag, Shuhaib Mehri, Gokhan Tur, Dilek Hakkani-Tür

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出PMIYC框架,通过多智能体对话自动评估LLM的说服效果与易受影响性,发现不同模型在说服力和抗说服性上存在显著差异。

Comments Paper published at the ACM Conference on AI and Agentic Systems 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24614 2026-05-26 cs.CL cs.AI cs.LG 75%

Measuring the Depth of LLM Unlearning via Activation Patching

通过激活修补测量大语言模型遗忘的深度

Jaeung Lee, Dohyun Kim, Jaemin Jo

机构 * Sungkyunkwan University(全北大学)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出遗忘深度评分(UDS),通过激活修补量化遗忘的机制深度,在150个遗忘模型上的元评估中达到最高忠实性和鲁棒性。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16831 2026-05-19 cs.CL cs.AI cs.CR cs.LG 75%

Unlearning Isn't Deletion: Investigating Reversibility of Machine Unlearning in LLMs

反学习不是删除:调查机器反学习在大语言模型中的可逆性

Xiaoyu Xu, Xiang Yue, Yang Liu, Qingqing Ye, Huadi Zheng, Peizhao Hu, Minxin Du, Haibo Hu

机构 * The Hong Kong Polytechnic University(香港理工大学) Carnegie Mellon University(卡内基梅隆大学) University of California, Santa Cruz(加州大学圣克ruz分校) Huawei Technologies(华为技术有限公司) Research Centre for Privacy and Security Technologies in Future Smart Systems, PolyU(未来智能系统中的隐私与安全技术研究中心,PolyU)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究揭示大语言模型反学习的可逆性问题,提出表示层面分析框架,通过PCA相似度、CKA和Fisher信息等指标评估表示漂移,发现四种遗忘模式,指出数据来源影响重学效率,揭示不可逆遗忘的挑战。

Comments ICML 2026, accepted to appear

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11496 2026-05-13 cs.AI cs.CY cs.HC cs.LG 75%

The Evaluation Differential: When Frontier AI Models Recognise They Are Being Tested

评估差异:当前沿AI模型认识到它们正在被测试

Varad Vishwarupe, Nigel Shadbolt, Marina Jirotka, Ivan Flechais

机构 * Anthropic OpenAI UK AI Security Institute(英国人工智能安全研究所)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 研究探讨前沿AI模型在评估情境下的行为差异,提出评估差异(ED)概念,定义标准化效应量形式(nED),并提出TRACE审计协议以规范评估证据的使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02515 2026-05-01 cs.CL cs.AI cs.LG 75%

FinChain: A Symbolic Benchmark for Verifiable Chain-of-Thought Financial Reasoning

FinChain:可验证链式思维金融推理的符号基准

Zhuohan Xie, Daniil Orel, Rushil Thareja, Dhruv Sahnan, Hachem Madmoun, Fan Zhang, Debopriyo Banerjee, Georgi Georgiev, Xueqing Peng, Lingfei Qian, Jimin Huang, Jinyan Su, Aaryamonvikram Singh, Rui Xing, Rania Elbadry, Chen Xu, Haonan Li, Fajri Koto, Ivan Koychev, Tanmoy Chakraborty, Yuxia Wang, Salem Lahlou, Veselin Stoyanov, Sophia Ananiadou, Preslav Nakov

机构 * MBZUAI Syllogia The University of Tokyo(东京大学) The Fin AI(Fin AI) Cornell University(康奈尔大学) The University of Melbourne(墨尔本大学) IIT Delhi(德里理工学院) The University of Manchester(曼彻斯特大学)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 FinChain通过符号模板和可执行代码实现可验证的金融链式推理,评估26种LLM发现其在符号金融推理中存在明显缺陷,领域适应和数学增强的微调模型能显著缩小差距。

Comments 24 pages, includes 12 figures and 9 tables; introduces the FinChain benchmark and ChainEval metric

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20869 2026-04-24 cs.CY cs.AI cs.HC cs.IR cs.LG 75%

Clinical Reasoning AI for Oncology Treatment Planning: A Multi-Specialty Case-Based Evaluation

肿瘤治疗规划的临床推理AI:多专科基于病例的评估

Philippe E. Spiess, Md Muntasir Zitu, Alison Walker, Daniel A. Anaya, Robert M. Wenham, Michael Vogelbaum, Daniel Grass, Ali-Musa Jaffer, Amod Sarnaik, Caitlin McMullen, Christine Sam, John V. Kiluk, Tianshi Liu, Tiago Biachi, Julio Powsang, Jing-Yi Chern, Roger Li, Seth Felder, Samuel Reynolds, Michael Shafique, Alison Sheehan, Ashley Layman, Cydney A. Warfield, Derrick Legoas, Jaclyn Parrinello, Jena Schmitz, Kevin Eaton, Mark Honor, Luis Felipe, Issam ElNaqa, Elier Delgado, Talia Berler, Rachael V. Phillips, Frantz Francisque, Carlos Garcia Fernandez, Gilmer Valdes

机构 * Moffitt Cancer Center and Research Institute(莫菲特癌症中心与研究学院) Innova Montréal Inc.(蒙特利尔创新公司) Oncobrain, Inc.(Oncobrain公司) Advanced Cancer Treatment Centers(先进癌症治疗中心)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 本文评估了OncoBrain在多专科病例中的表现,展示了其在肿瘤治疗规划中的准确性、安全性和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19818 2026-04-23 cs.SE cs.HC cs.MA 75%

Beyond Task Success: An Evidence-Synthesis Framework for Evaluating, Governing, and Orchestrating Agentic AI

超越任务成功:一个证据综合框架用于评估、治理和协调智能体AI

Christopher Koch, Joshua Andreas Wellbrock

专题命中 安全评测 :alignment(abstract);safety(abstract);trustworthy(abstract)

AI总结 本文提出一个证据综合框架,解决评估、治理和协调智能体AI中的治理到行动闭合缺口,通过四个层次框架、ODTA运行时测试和最小行动证据包,整合现有证据以提升可信度。

Comments 8 pages, 1 figure, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19281 2026-04-22 cs.HC cs.AI cs.CL cs.LG 75%

Beyond Semantic Similarity: A Component-Wise Evaluation Framework for Medical Question Answering Systems with Health Equity Implications

超越语义相似性:面向医疗问答系统的组件评估框架及其健康公平性影响

Abu Noman Md Sakib, Md. Main Oddin Chisty, Zijie Zhang

机构 * University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校) Khulna University of Engineering and Technology(库尔纳工程科技大学)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出VB-Score框架,评估医疗问答模型的四个组件,揭示模型在慢性病等特定群体中的性能差异,指出语义评估不足以确保医疗AI的安全性。

Comments Accepted in the Ninth Annual ACM Conference on Fairness, Accountability, and Transparency (ACM FAccT) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18756 2026-04-22 cs.LG cs.AI cs.CL cs.CR 75%

Towards Understanding the Robustness of Sparse Autoencoders

迈向稀疏自编码器鲁棒性的理解

Ahson Saiyed, Sabrina Sadiekh, Chirag Agarwal

机构 * University of Virginia(弗吉尼亚大学) Independent Researcher(独立研究者)

专题命中 安全评测 :jailbreak(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过在推理阶段集成预训练的稀疏自编码器,发现其能显著降低对抗攻击成功率,并揭示稀疏性与攻击成功率之间的剂量-反应关系,以及层间防御与性能的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20409 2026-04-21 cs.CL cs.AI cs.CY 75%

Cognitive Chain-of-Thought (CoCoT): Structured Multimodal Reasoning about Social Situations

认知链式推理(CoCoT):关于社会情境的结构化多模态推理

Eunkyu Park, Wesley Hanwen Deng, Gunhee Kim, Motahhare Eslami, Maarten Sap

机构 * Seoul National University(首尔国立大学) Human-Computer Interaction Institute, Carnegie Mellon University(人机交互研究所,卡内基梅隆大学) Language Technologies Institute, Carnegie Mellon University(语言技术研究所,卡内基梅隆大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出CoCoT框架,通过感知、情境推断和规范应用三个阶段提升多模态社会推理能力,在多个任务中取得显著提升。

Comments Under review; 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09622 2026-04-14 cs.CY cs.AI cs.CL 75%

Explainability and Certification of AI-Generated Educational Assessments

人工智能生成教育评估的可解释性与认证

Antoun Yaacoub, Zainab Assaghir, Anuradha Kar

机构 * aivancity School for Technology, Business & Society(aivancity 科技、商业与社会学院) Lebanese University(黎巴嫩大学)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出了一种综合框架,用于解释和认证AI生成的评估项目,结合自我理性化、基于归因的分析和事后验证,以产生基于布卢姆和SOLO分类法的认知对齐证据。通过结构化的认证元数据模式,实现可审计的文档,满足新兴治理需求。

Comments Chapter to be published in a Springer special book "Emerging trends in Computer Science and Computer Engineering Education Book"

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09069 2026-04-13 cs.CL cs.AI cs.LG 75%

NyayaMind- A Framework for Transparent Legal Reasoning and Judgment Prediction in the Indian Legal System

NyayaMind:一个用于印度法律体系中透明法律推理和判决预测的框架

Parjanya Aditya Shukla, Shubham Kumar Nigam, Debtanu Datta, Balaramamahanthi Deepak Patnaik, Noel Shallum, Pradeep Reddy Vanga, Saptarshi Ghosh, Arnab Bhattacharya

机构 * IIT Kanpur, India(印度理工学院坎普尔分校) IIT Kharagpur, India(印度理工学院克勒格布尔分校) Symbiosis Law School Pune, India(印度共生法学院浦那分校) Dattam Labs, India(印度Dattam实验室) University of Birmingham, Dubai, United Arab Emirates(英国伯明翰大学迪拜校区)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 NyayaMind通过整合检索、推理和验证机制,提升印度司法系统中判决预测与解释的透明度和准确性,为可信的人工智能辅助法律决策提供新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13531 2026-03-09 cs.CY cs.AI cs.CL 75%

AdAEM: An Adaptively and Automated Extensible Measurement of LLMs' Value Difference

AdAEM:一种自适应和自动扩展的大型语言模型价值差异测量方法

Jing Yao, Shitong Duan, Xiaoyuan Yi, Dongkuan Xu, Peng Zhang, Tun Lu, Ning Gu, Zhicheng Dou, Xing Xie

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 AdAEM是一种自适应和自动扩展的LLMs价值差异测量方法,通过自动生成和扩展测试问题,提高评估的多样性和信息性。

Comments This paper is accepted by ICLR 2026(Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03206 2026-03-04 cs.LG cs.AI cs.CL 75%

Understanding and Mitigating Dataset Corruption in LLM Steering

理解并缓解LLM引导中的数据集损坏

Cullen Anderson, Narmeen Oozeer, Foad Namjoo, Remy Ogasawara, Amirali Abdullah, Jeff M. Phillips

机构 * Department of Computer Science, University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校计算机科学系) Kahlert School of Computing, University of Utah(犹他大学凯尔特计算学校)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究对比引导在数据集损坏下的鲁棒性,发现其对中等损坏较稳健,但恶意篡改会引发副作用,通过替换高维均值计算为鲁棒估计器可缓解影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03152 2026-02-10 cs.CL cs.AI cs.LG 75%

MedVAL: Toward Expert-Level Medical Text Validation with Language Models

MedVAL: 向语言模型的专家级医学文本验证迈进

Asad Aali, Vasiliki Bikia, Maya Varma, Nicole Chiou, Sophie Ostmeier, Arnav Singhvi, Magdalini Paschali, Ashwin Kumar, Andrew Johnston, Karimar Amador-Martinez, Eduardo Juan Perez Guerrero, Paola Naovi Cruz Rivera, Sergios Gatidis, Christian Bluethgen, Eduardo Pontes Reis, Eddy D. Zandee van Rilland, Poonam Laxmappa Hosamani, Kevin R Keet, Minjoung Go, Evelyn Ling, David B. Larson, Curtis Langlotz, Roxana Daneshjou, Jason Hom, Sanmi Koyejo, Emily Alsentzer, Akshay S. Chaudhari

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MedVAL通过自监督蒸馏方法,利用合成数据提升语言模型在医学文本验证中的性能,达到专家级别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21517 2026-01-30 cs.CV 75%

HERS: Hidden-Pattern Expert Learning for Risk-Specific Vehicle Damage Adaptation in Diffusion Models

HERS:隐藏模式专家学习用于扩散模型中特定风险车辆损伤适应

Teerapong Panboonyuen

专题命中 安全评测 :alignment(abstract);safety(abstract);trustworthy(abstract)

AI总结 HERS通过领域特定专家学习提升扩散模型中车辆损伤生成的保真度与可控性,提高保险领域应用的安全性与可靠性。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21360 2026-01-30 cs.CL cs.AI cs.ET cs.LG cs.SE 75%

The Compliance Paradox: Semantic-Instruction Decoupling in Automated Academic Code Evaluation

合规悖论:自动学术代码评估中的语义指令解耦

Devanshu Sahoo, Manish Prasad, Vasudev Majhi, Arjun Neekhra, Yash Sinha, Murari Mandal, Vinay Chamola, Dhruv Kumar

机构 * KIIT University(KIIT大学)

专题命中 安全评测 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文揭示了自动学术代码评估中模型因优先考虑隐藏格式约束而无法正确评估代码的问题,提出SPACI和AST-ASIP框架以检测和对抗此类解耦现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03089 2025-12-04 cs.CR cs.AI cs.CY cs.LG 75%

Password-Activated Shutdown Protocols for Misaligned Frontier Agents

密码激活的停机协议用于对齐不一致的前沿代理

Kai Williams, Rohan Subramani, Francis Rhys Ward

机构 * MATS

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 密码激活停机协议通过在接收到密码时安全停机,降低前沿AI对齐不一致带来的风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20736 2025-11-27 cs.CY cs.AI cs.CL 75%

Large Language Models' Complicit Responses to Illicit Instructions across Socio-Legal Contexts

大语言模型在社会法律情境中对非法指令的共谋回应

Xing Wang, Huiyuan Xie, Yiyan Wang, Chaojun Xiao, Huimin Chen, Holli Sargeant, Felix Steffek, Jie Shao, Zhiyuan Liu, Maosong Sun

机构 * Tsinghua University(清华大学) University of Electronic Science and Technology of China(电子科技大学) University of Cambridge(剑桥大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本研究探讨大语言模型在社会法律情境中对非法指令的共谋回应,揭示其在不同情境下的安全性和易感性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10770 2025-11-17 cs.RO 75%

From Framework to Reliable Practice: End-User Perspectives on Social Robots in Public Spaces

Samson Oruma, Ricardo Colomo-Palacios, Vasileios Gkioulos

机构 * Department of Computer Science and Communication(计算机科学与通信系) Østfold University College(奥斯Fold大学学院) Escuela Técnica Superior de Ingenieros Informáticos(信息工程高级技术学院) Universidad Politécnica de Madrid(马德里理工大学) Department of Information Security and Communication Technology(信息安全与通信技术系) Norwegian University of Science and Technology(挪威科学与技术大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);trustworthy(abstract)

Comments 26 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17418 2025-11-17 cs.HC cs.SE 75%

What Needs Attention? Prioritizing Drivers of Developers' Trust and Adoption of Generative AI

Rudrajit Choudhuri, Bianca Trinkenreich, Rahul Pandita, Eirini Kalliamvakou, Igor Steinmacher, Marco Gerosa, Christopher Sanchez, Anita Sarma

专题命中 安全评测 :alignment(abstract);safety(abstract);trustworthy(abstract)

Comments Journal extension of ICSE 2025 paper (arXiv:2409.04099)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00843 2025-11-04 cs.HC 75%

Portal UX Agent -- A Plug-and-Play Engine for Rendering UIs from Natural Language Specifications

Xinsong Li, Ning Jiang, Jay Selvaraj

专题命中 安全评测 :alignment(abstract);safety(abstract);trustworthy(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12864 2025-10-16 cs.AI cs.CL cs.LG 75%

From Literal to Liberal: A Meta-Prompting Framework for Eliciting Human-Aligned Exception Handling in Large Language Models

Imran Khan

机构 * Independent Researcher(独立研究者)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 13 pages. Code and data are available at https://github.com/strongSoda/LITERAL-TO-LIBERAL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08569 2025-10-10 cs.CL cs.AI cs.LG 75%

ArenaBencher: Automatic Benchmark Evolution via Multi-Model Competitive Evaluation

Qin Liu, Jacob Dineen, Yuxi Huang, Sheng Zhang, Hoifung Poon, Ben Zhou, Muhao Chen

机构 * University of California, Davis(加州大学戴维斯分校) Arizona State University(亚利桑那州立大学) Microsoft Research(微软研究院)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏