arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-16 至 2026-01-16 共收录 41 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 4 篇

2502.01930 2026-01-16 cs.LG cs.AI 84%

Robust LLM Alignment via Distributionally Robust Direct Preference Optimization

通过分布鲁棒直接偏好优化实现鲁棒的大语言模型对齐

Zaiyan Xu, Sushil Vemuri, Kishan Panaganti, Dileep Kalathil, Rahul Jain, Deepak Ramachandran

机构 * Texas A&M University(德克萨斯大学) California Institute of Technology(加州理工学院) Tencent AI Lab(腾讯AI实验室) Google DeepMind(谷歌DeepMind)

专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Wasserstein DPO和KLDPO算法,通过分布鲁棒优化解决LLM与人类偏好间的分布偏移问题,提升对齐性能。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10416 2026-01-16 cs.AI 83%

LLMdoctor: Token-Level Flow-Guided Preference Optimization for Efficient Test-Time Alignment of Large Language Models

LLMdoctor: 基于令牌级流引导的偏好优化用于大语言模型高效测试时间对齐

Tiesunlong Shen, Rui Mao, Jin Wang, Heming Sun, Jian Zhang, Xuejie Zhang, Erik Cambria

专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);分类 cs.AI

AI总结 LLMdoctor通过令牌级流引导偏好优化,实现高效的大语言模型测试时间对齐,提升对齐精度并保留生成多样性。

Comments Accepted by AAAI26

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04675 2026-01-16 cs.AI cs.CL cs.LG 75%

Scalable Oversight for Superhuman AI via Recursive Self-Critiquing

通过递归自我批评实现超人类AI的可扩展监督

Xueru Wen, Jie Lou, Xinyu Lu, Junjie Yang, Yanjiang Liu, Yaojie Lu, Debing Zhang, Xing Yu

机构 * Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所信息处理实验室) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出通过递归自我批评实现超人类AI的可扩展监督,探索批评的批评比直接批评更容易,并验证递归批评在AI监督中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10128 2026-01-16 cs.CE cond-mat.mtrl-sci cs.SE 67%

A Generalizable Framework for Building Executable Domain-Specific LLMs under Data Scarcity: Demonstration on Semiconductor TCAD Simulation

在数据稀缺条件下构建可执行领域特定大语言模型的通用框架:以半导体TCAD仿真为例

Di Wang, Zhenhua Wu, Yu Liu, Kai Chang, Shaohua Wu

专题命中 偏好对齐 :alignment(abstract);DPO(abstract)

AI总结 本文提出一种通用框架,在数据稀缺条件下构建可执行的领域特定大语言模型,通过生成合成数据和代码优化流程,实现领域知识灌输和脚本可执行性提升。

Comments Submitted to Nature Computational Science

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 5 篇

2601.10141 2026-01-16 cs.LG cs.AI 86%

Understanding and Preserving Safety in Fine-Tuned LLMs

理解并保持在微调大语言模型中的安全性

Jiawen Zhang, Yangfan Hu, Kejia Chen, Lipeng He, Jiachen Ma, Jian Lou, Dan Li, Jian Liu, Xiaohu Yang, Ruoxi Jia

机构 * Zhejiang University(浙江大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of Waterloo(滑铁卢大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Sun Yat-sen University(中山大学)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.AI、cs.LG

AI总结 本文提出安全保持微调(SPF)方法,通过分析安全性与实用性梯度的几何关系,有效解决微调过程中安全性与实用性之间的矛盾,保持模型性能并恢复预训练的安全性对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10156 2026-01-16 cs.CL 83%

ToolSafe: Enhancing Tool Invocation Safety of LLM-based agents via Proactive Step-level Guardrail and Feedback

ToolSafe: 通过主动的步骤级防护和反馈提升基于LLM的代理的工具调用安全性

Yutao Mou, Zhangchi Xue, Lijun Li, Peiyang Liu, Shikun Zhang, Wei Ye, Jing Shao

机构 * National Engineering Research Center for Software Engineering, Peking University(软件工程国家工程研究中心,北京大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 安全训练 :safety(title,abstract);prompt injection(abstract);分类 cs.CL

AI总结 ToolSafe通过构建TS-Bench和TS-Guard模型,结合TS-Flow框架,有效减少LLM代理的有害工具调用并提升任务完成率。

Comments Work in Progress. Code available: https://github.com/MurrayTom/ToolSafe

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09740 2026-01-16 cs.RO cs.AI cs.SE 79%

Formal Safety Guarantees for Autonomous Vehicles using Barrier Certificates

使用屏障证书为自动驾驶车辆提供形式安全保证

Oumaima Barhoumi, Mohamed H Zaki, Sofiène Tahar

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 本文提出一种结合屏障证书与时间到碰撞度量的形式验证安全框架,通过SMT求解器和自适应控制机制,提升自动驾驶车辆的安全性和可解释性。

Comments Accepted to AAAI-26 Bridge Program B10: Making Embodied AI Reliable with Testing and Formal Verification

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14375 2026-01-16 cs.LG cs.AI 62%

Advancing Safe Mechanical Ventilation Using Offline RL With Hybrid Actions and Clinically Aligned Rewards

通过离线强化学习与混合动作和临床对齐奖励推进安全机械通气

Muhammad Hamza Yousuf, Jason Li, Sahar Vahdati, Raphael Theilen, Jakob Wittenstein, Jens Lehmann

机构 * Amazon(亚马逊)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于离线强化学习与混合动作空间的AI方法,通过临床对齐奖励函数优化机械通气设置,提升安全性和临床效果。

Comments Accepted to AAAI-26

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05467 2026-01-16 cs.SE cs.AI 57%

STELP: Secure Transpilation and Execution of LLM-Generated Programs

STELP: 保障LLM生成程序的编译与执行

Swapnil Shinde, Sahil Wadhwa, Andy Luo, Akshay Gupta, Mohammad Shahed Sorower

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 STELP通过安全编译和执行LLM生成的代码,解决生产环境中的安全性和可靠性问题,提升代码执行的安全性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 2 篇

2601.10307 2026-01-16 cs.CL 81%

The Straight and Narrow: Do LLMs Possess an Internal Moral Path?

直行与狭窄:大型语言模型是否具有内在的道德路径?

Luoming Hu, Jingjie Zeng, Liang Yang, Hongfei Lin

机构 * School of Future Technology, Dalian University of Technology, China(大连理工大学未来技术学院) School of Computer Science and Technology, Dalian University of Technology, China(大连理工大学计算机科学与技术学院) Key Laboratory of Social Computing and Cognitive Intelligence, Ministry of Education, China(教育部社会计算与认知智能重点实验室)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);AI safety(abstract)

AI总结 本文通过道德基础理论探索LLMs的道德表示,提出自适应道德融合方法,以增强模型的道德对齐性并减少安全与有用性之间的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10407 2026-01-16 cs.LG 57%

CS-GBA: A Critical Sample-based Gradient-guided Backdoor Attack for Offline Reinforcement Learning

CS-GBA:一种基于关键样本的梯度引导后门攻击用于离线强化学习

Yuanjie Zhao, Junnan Qiu, Yue Ding, Jie Li

机构 * Shanghai Jiao Tong University(上海交通大学) SJTU Paris Elite Institute of Technology(上海交通大学巴黎精英技术学院)

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

AI总结 CS-GBA提出了一种基于关键样本的梯度引导后门攻击方法,通过优化攻击预算和隐蔽性,有效对抗安全约束算法。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 红队测试 2 篇

2601.10589 2026-01-16 cs.CR cs.CL 90%

Be Your Own Red Teamer: Safety Alignment via Self-Play and Reflective Experience Replay

做自己的红队:通过自play和反思经验回放实现安全对齐

Hao Wang, Yanting Wang, Hao Li, Rui Li, Lei Sha

机构 * Beihang University(北京航空航天大学) Peking University(北京大学) Zhongguancun Laboratory(中关村实验室)

专题命中 红队测试 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);red teaming(abstract)

AI总结 通过自play和反思经验回放机制,使模型自主进化防御能力,提升安全对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10004 2026-01-16 cs.CR cs.LG 57%

SoK: Privacy-aware LLM in Healthcare: Threat Model, Privacy Techniques, Challenges and Recommendations

SoK:面向医疗的隐私保护大语言模型:威胁模型、隐私技术、挑战与建议

Mohoshin Ara Tahera, Karamveer Singh Sidhu, Shuvalaxmi Dass, Sajal Saha

机构 * University of Louisiana at Lafayette, Lafayette, LA, USA(路易斯安那州立大学拉斐特分校) University of Northern British Columbia, Canada(北部BC大学)

专题命中 红队测试 :trustworthy(abstract);分类 cs.LG

AI总结 本文系统分析了医疗领域大语言模型的隐私保护问题,探讨了威胁模型、隐私技术及挑战,并提出针对不同阶段的防护建议和未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 提示注入 2 篇

2601.10173 2026-01-16 cs.CR cs.AI cs.CL 92%

ReasAlign: Reasoning Enhanced Safety Alignment against Prompt Injection Attack

ReasAlign: 基于推理增强的安全对齐以抵御提示注入攻击

Hao Li, Yankai Yang, G. Edward Suh, Ning Zhang, Chaowei Xiao

机构 * Washington University in St. Louis(华盛顿大学圣路易斯分校) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) NVIDIA(NVIDIA公司) Johns Hopkins University(约翰霍普金斯大学)

专题命中 提示注入 :alignment(title,abstract);safety(title,abstract);prompt injection(title,abstract);分类 cs.CL、cs.AI

AI总结 ReasAlign通过结构化推理和测试时缩放机制,有效防御提示注入攻击,实现安全与效用的最佳平衡。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10338 2026-01-16 cs.CR cs.AI cs.CL cs.SE 62%

Agent Skills in the Wild: An Empirical Study of Security Vulnerabilities at Scale

真实世界中的智能体技能:大规模安全漏洞实证研究

Yi Liu, Weizhe Wang, Ruitao Feng, Yao Zhang, Guangquan Xu, Gelei Deng, Yuekang Li, Leo Zhang

机构 * Tianjin University(天津大学) Southern Cross University(南方十字大学) School of Cybersecurity, Tianjin University(安全学院,天津大学) Nanyang Technological University(南洋理工大学) University of New South Wales(新南威尔士大学) Griffith University(格里菲斯大学)

专题命中 提示注入 :prompt injection(abstract);分类 cs.CL、cs.AI

AI总结 研究揭示了智能体技能中普遍存在的安全漏洞,提出了一种多阶段检测框架,并展示了技能捆绑执行脚本与漏洞之间的显著关联。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 幻觉与事实性 1 篇

2601.09929 2026-01-16 cs.AI 57%

Hallucination Detection and Mitigation in Large Language Models

大语言模型中的幻觉检测与缓解

Ahmad Pesaranghader, Erin Li

机构 * CIBC(加拿大帝国商业银行)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出了一种系统化的框架,通过分层架构和闭环反馈机制,提升大语言模型在金融等高风险领域的可靠性,减少幻觉问题。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 隐私与版权 1 篇

2510.20721 2026-01-16 cs.CL cs.AI cs.HC 62%

User Perceptions vs. Proxy LLM Judges: Privacy and Helpfulness in LLM Responses to Privacy-Sensitive Scenarios

用户感知与代理LLM评判:隐私与帮助性在隐私敏感场景中的LLM响应

Xiaoyuan Wu, Roshni Kaushik, Wenkai Li, Lujo Bauer, Koichi Onoue

机构 * Fujitsu Research of America Inc.(富士通美国研究所) Carnegie Mellon University(卡内基梅隆大学)

专题命中 隐私与版权 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 研究发现用户对LLM响应的隐私和帮助性感知与代理LLM评判存在显著差异,需加强用户为中心的评估以提升隐私保护与实用性平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏

8. 安全评测 12 篇

2601.02737 2026-01-16 cs.CV 82%

Unveiling and Bridging the Functional Perception Gap in MLLMs: Atomic Visual Alignment and Hierarchical Evaluation via PET-Bench

揭示和弥合MLLMs中的功能感知差距:通过PET-Bench实现原子视觉对齐和分层评估

Zanting Ye, Xiaolong Niu, Xuanbin Wu, Xu Han, Shengyuan Liu, Jing Hao, Zhihao Peng, Hao Sun, Jieqin Lv, Fanghu Wang, Yanchao Huang, Hubing Wu, Yixuan Yuan, Habib Zaidi, Arman Rahmim, Yefeng Zheng, Lijun Lu

机构 * School of Biomedical Engineering, Southern Medical University(生物医学工程学院,南方医科大学) School of Biomedical Engineering, Shanghai Jiaotong University(生物医学工程学院,上海交通大学) Department of Electronic Engineering, Chinese University of Hong Kong(电子工程系,中国香港大学) Faculty of Dentistry, The University of Hong Kong(牙科学院,香港大学) Department of Nuclear Medicine, The Second Affiliated Hospital of Guangzhou University of Chinese Medicine(核医学科,广州中医药大学第二附属医院) PET Center, Department of Nuclear Medicine, Guangdong Provincial People’s Hospital, Southern Medical University(PET中心,核医学科,广东省人民医院,南方医科大学) Department of Nuclear Medicine, Nanfang Hospital, Southern Medical University(核医学科,南芳医院,南方医科大学) Division of Nuclear Medicine and Molecular Imaging, Geneva University Hospitals(核医学与分子影像学部,日内瓦大学医院) Departments of Radiology, Physics, and Biomedical Engineering, The University of British Columbia(放射学、物理和生物医学工程系,不列颠哥伦比亚大学) Medical Artificial Intelligence Laboratory, Westlake University(医学人工智能实验室,西湖大学)

专题命中 安全评测 :alignment(title,abstract);safety(abstract)

AI总结 本文提出AVA方法,通过原子视觉对齐解决MLLMs在功能成像中的感知差距,提升诊断准确性14.83%。

Comments 9 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09756 2026-01-16 cs.CR cs.AI cs.CL 81%

Synthetic Data for Veterinary EHR De-identification: Benefits, Limits, and Safety Trade-offs Under Fixed Compute

兽医电子健康记录的合成数据:在固定计算下的好处、限制和安全权衡

David Brundage

机构 * University of Wisconsin-Madison, School of Veterinary Medicine(威斯康星大学麦迪逊分校兽医学院)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究探讨了合成数据在兽医电子健康记录去标识化中的应用,发现合成数据在固定预算下无法替代真实数据,但适度混合可提升性能,但需注意训练暴露增加而非数据质量提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05465 2026-01-16 cs.AI cs.CL 81%

VAL-Bench: Belief Consistency as a measure for Value Alignment in Language Models

VAL-Bench:信念一致性作为语言模型价值观对齐的度量标准

Aman Gupta, Denny O'Shea, Fazl Barez

机构 * MasterClass University of Oxford(牛津大学) WhiteBox Martian

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 VAL-Bench通过评估语言模型在现实价值相关提示中的信念一致性,提出了一种衡量价值观对齐的新基准,揭示了不同模型在一致性上的显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10460 2026-01-16 cs.CL cs.AI cs.CY cs.LG 79%

Contextual StereoSet: Stress-Testing Bias Alignment Robustness in Large Language Models

上下文立体集:在大型语言模型中压力测试偏见对齐的鲁棒性

Abhinaba Basu, Pavan Chakraborty

机构 * Indian Institute of Information Technology, Allahabad (IIITA)(印度信息与技术研究所(Allahabad)) National Institute of Electronics and Information Technology (NIELIT)(国家电子与信息技术研究所)

专题命中 安全评测 :alignment(title);分类 cs.CL、cs.AI、cs.CY

AI总结 上下文立体集通过压力测试大型语言模型在不同上下文中的偏见对齐鲁棒性,揭示固定条件测试的偏见分数可能无法推广。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20323 2026-01-16 cs.CL cs.AI cs.LG 67%

PMOA-TTS: Introducing the PubMed Open Access Textual Times Series Corpus

PMOA-TTS:引入PubMed开放获取文本时间序列语料库

Shahriar Noroozizadeh, Sayantan Kumar, George H. Chen, Jeremy C. Weiss

机构 * Machine Learning Department, School of Computer Science(计算机科学系机器学习部门) Heinz College of Information Systems and Public Policy(信息系统与公共政策学院) National Library of Medicine(国家医学图书馆)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 PMOA-TTS通过大规模语言模型管道构建,为时间序列分析提供结构化文本时间线,支持时间推理、生存建模和事件预测研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10562 2026-01-16 cs.LG cs.AI cs.CV 62%

Process-Guided Concept Bottleneck Model

过程引导的概念瓶颈模型

Reza M. Asiyabi, SEOSAW Partnership, Steven Hancock, Casey Ryan

机构 * SEOSAW Partnership(SEOSAW合作机构)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 过程引导的概念瓶颈模型通过引入生物物理意义的中间概念,提升科学领域中深度学习模型的可解释性和透明性,减少误差和偏见,同时利用多源数据产生可解释的中间输出。

Comments 13 pages with 7 figures and 1 table, Supplementary Materials 10 pages with 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10122 2026-01-16 cs.CL cs.AI cs.HC 62%

Role-Playing Agents Driven by Large Language Models: Current Status, Challenges, and Future Trends

由大型语言模型驱动的角色扮演代理:现状、挑战与未来趋势

Ye Wang, Jiaxing Chen, Hongjiang Xiao

机构 * Communication University of China(中国传媒大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文系统回顾了由大型语言模型驱动的角色扮演代理的现状、挑战及未来趋势,探讨了关键技术路径与评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10455 2026-01-16 cs.CL cs.RO 57%

SurgGoal: Rethinking Surgical Planning Evaluation via Goal-Satisfiability

SurgGoal: 重新思考手术计划评估 via 目标满足性

Ruochen Li, Kun Yuan, Yufei Xia, Yue Zhou, Qingyu Lu, Weihang Li, Youxiang Zhu, Nassir Navab

机构 * Technical University of Munich, Germany(慕尼黑技术大学) University of Strasbourg, France(斯特拉斯堡大学) University of Glasgow, United Kingdom(格拉斯哥大学) Nanyang Technological University, Singapore(南洋理工大学) University of Massachusetts Boston, USA(马萨诸塞大学波士顿分校)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 SurgGoal通过目标满足性度量重新评估手术计划,揭示视频大语言模型在安全关键环境中的性能问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10406 2026-01-16 cs.AI 57%

ErrEval: Error-Aware Evaluation for Question Generation through Explicit Diagnostics

ErrEval: 通过显式诊断实现的问题生成的误差感知评估

Weiping Fu, Bifan Wei, Jingyi Hao, Yushun Zhang, Jian Zhang, Jiaxin Wang, Bo Li, Yu He, Lingling Zhang, Jun Liu

机构 * School of Computer Science and Technology, Xi’an Jiaotong University(计算机科学与技术学院,西安交通大学) School of Continuing Education, Xi’an Jiaotong University(继续教育学院,西安交通大学) Shaanxi Province Key Laboratory of Big Data Knowledge Engineering, Xi’an(陕西省大数据知识工程重点实验室,西安) Test center, National University of Defense Technology(测试中心,国防科技大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 ErrEval通过显式诊断机制改进问题生成评估,有效识别并纠正事实性幻觉和答案不匹配等缺陷,提升评估与人类判断的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07863 2026-01-16 cs.CL 57%

QoSBERT: An Uncertainty-Aware Approach based on Pre-trained Language Models for Service Quality Prediction

QoSBERT:基于预训练语言模型的不确定性感知方法用于服务质量预测

Ziliang Wang, Xiaohong Zhang, Ze Shi Li, Meng Yan

机构 * Key Laboratory of High Confidence Software Technologies (Peking University), Ministry of Education(高可信软件技术重点实验室(北京大学)) School of Computer Science, Peking University(北京大学计算机科学学院) Key Laboratory of Dependable Service Computing in Cyber Physical Society (Chongqing University), Ministry of Education, China(网络物理社会可信服务计算重点实验室(重庆大学)) School of Big Data and Software Engineering, Chongqing University(重庆大学大数据与软件工程学院) Department of Computer Science at the University of Victoria(维多利亚大学计算机科学系)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 QoSBERT基于预训练语言模型,通过不确定性估计提升服务质量预测的准确性和可靠性。

Journal ref IEEE Transactions on Services Computing ( Volume: 18, Issue: 6, Nov.-Dec. 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10033 2026-01-16 cs.CL 57%

EmplifAI: a Fine-grained Dataset for Japanese Empathetic Medical Dialogues in 28 Emotion Labels

EmplifAI:一个用于日语共情医疗对话的细粒度数据集,包含28种情绪标签

Wan Jou She, Lis Kanashiro Pereira, Fei Cheng, Sakiko Yahata, Panote Siriaraya, Eiji Aramaki

机构 * Kyoto Institute of Technology, Japan(京都技术大学) National Institute of Information and Communications Technology (NICT), Japan(信息通信技术国家研究所) Kyoto University, Japan(京都大学) Nara Institute of Science and Technology, Japan(奈良科学技术大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 EmplifAI是一个用于日语共情医疗对话的细粒度数据集,包含28种情绪标签,通过微调提升了日本LLM的流畅性和共情能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05066 2026-01-16 cs.CV 56%

Beautiful Images, Toxic Words: Understanding and Addressing Offensive Text in Generated Images

美丽的图像,有毒的词语:理解并解决生成图像中的冒犯性文本

Aditya Kumar, Tom Blanchard, Adam Dziedzic, Franziska Boenisch

专题命中 安全评测 :safety(abstract);alignment(comments)

AI总结 本文提出了一种针对生成图像中冒犯性文本的微调策略,并发布了ToxicBench基准,用于评估和改进文本到图像模型的安全性。

Comments Accepted at AAAI 2026 (AI Alignment Track)

详情

展开后加载摘要…

URL PDF HTML 收藏

9. AI治理与伦理 2 篇

2512.13142 2026-01-16 cs.AI cs.HC 85%

Can LLMs Understand What We Cannot Say? Measuring Multilevel Alignment Through Abortion Stigma Across Cognitive, Interpersonal, and Structural Levels

LLMs能否理解我们无法表达的内容?通过堕胎污名的多层级对齐进行测量

Anika Sharma, Malavika Mampally, Chidaksh Ravuru, Kandyce Brennan, Neil Gaikwad

机构 * Society-Centered AI Lab(以社会为中心的人工智能实验室) School of Nursing(护理学院)

专题命中 AI治理与伦理 :alignment(title,abstract);safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 研究发现LLMs在认知、人际和结构性层面对堕胎污名的理解不一致,缺乏对多维度心理构造的 coherent 理解。

详情

展开后加载摘要…

URL PDF HTML 收藏