arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-21 至 2026-01-21 共收录 51 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 51 篇

2601.13268 2026-01-21 cs.AI 85%

Improving the Safety and Trustworthiness of Medical AI via Multi-Agent Evaluation Loops

通过多智能体评估循环提升医疗AI的安全性与可信度

Zainab Ghafoor, Md Shafiqul Islam, Koushik Howlader, Md Rasel Khondokar, Tanusree Bhattacharjee, Sayantan Chakraborty, Adrito Roy, Ushashi Bhattacharjee, Tirtho Roy

机构 * Sonoma State University(索诺玛州立大学) Iowa State University(爱荷华州立大学) University of Dhaka(达卡大学) Notre Dame College(诺特丹学院)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);AI safety(abstract);分类 cs.AI

AI总结 本文提出多智能体评估循环框架,通过结合DeepSeek R1和Med-PaLM等模型,有效提升医疗AI的安全性和伦理合规性,实现89%的伦理违规减少和92%的风险降级。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11903 2026-01-21 cs.AI 84%

AEMA: Verifiable Evaluation Framework for Trustworthy and Controlled Agentic LLM Systems

AEMA:可验证评估框架用于可信和受控的代理LLM系统

YenTing Lee, Keerthi Koneru, Zahra Moslemi, Sheethal Kumar, Ramesh Radhakrishnan

机构 * University of California, San Diego(加州大学圣地亚哥分校) Center for Advanced AI, Accenture(Accenture高级人工智能中心) University of California, Irvine(加州大学伊拉斯姆斯分校)

专题命中 安全评测 :trustworthy(title,abstract);alignment(abstract,comments);分类 cs.AI

AI总结 AEMA提出了一种可验证的评估框架,用于评估基于LLM的多代理系统,通过人类监督实现稳定、可追溯的自动化评估。

Comments Workshop on W51: How Can We Trust and Control Agentic AI? Toward Alignment, Robustness, and Verifiability in Autonomous LLM Agents at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13876 2026-01-21 cs.CL 83%

Pedagogical Alignment for Vision-Language-Action Models: A Comprehensive Framework for Data, Architecture, and Evaluation in Education

为视觉-语言-动作模型的教育对齐:一个全面的框架,用于数据、架构和教育中的评估

Unggi Lee, Jahyun Jeong, Sunyoung Shin, Haeun Park, Jeongsu Moon, Youngchang Song, Jaechang Shim, JaeHwan Lee, Yunju Noh, Seungwon Choi, Ahhyun Kim, TaeHyeon Kim, Kyungtae Joo, Taeyeong Kim, Gyeonggeon Lee

机构 * Chosun University(全州大学) Seoul National University(首尔国立大学) Korea Institute for Curriculum and Evaluation(韩国课程评价院) Nanyang Technological University(南洋理工大学)

专题命中 安全评测 :alignment(title,abstract);safety(abstract);分类 cs.CL

AI总结 本文提出教育VLA框架,通过四个组件实现轻量级模型的教育对齐,提升科学教育中的任务表现和解释生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05484 2026-01-21 cs.CY 83%

Evaluating LLM Safety Across Child Development Stages: A Simulated Agent Approach

评估大语言模型在儿童发展阶段的安全性:一种模拟代理方法

Abhejay Murali, Saleh Afroogh, Kevin Chen, David Atkinson, Amit Dhurandhar, Junfeng Jiao

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.CY

AI总结 本文提出ChildSafe基准,通过模拟不同儿童发展阶段的认知变化,评估大语言模型在面对认知多样性时的安全性与对齐鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14127 2026-01-21 cs.CV cs.CL 79%

The Side Effects of Being Smart: Safety Risks in MLLMs' Multi-Image Reasoning

智能的副作用:MLLMs多图像推理中的安全风险

Renmiao Chen, Yida Lu, Shiyao Cui, Xuan Ouyang, Victor Shea-Jay Huang, Shumin Zhang, Chengwei Pan, Han Qiu, Minlie Huang

机构 * CoAI group, DCST, Tsinghua University(清华大学) Beihang University(北航) Tsinghua University(清华大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

AI总结 研究发现,多图像推理能力越强的模型在安全测试中越容易产生不安全响应,揭示了模型在任务解决中可能忽视安全约束的风险。

Comments *15 pages, 5 figures. Introduces MIR-SafetyBench (2,676 instances; 9 multi-image relations). Equal contribution; †Corresponding author. Code/data: https://github.com/thu-coai/MIR-SafetyBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13669 2026-01-21 cs.CL 79%

CommunityBench: Benchmarking Community-Level Alignment across Diverse Groups and Tasks

CommunityBench: 跨多样化群体和任务的社区级对齐基准测试

Jiayu Lin, Zhongyu Wei

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

AI总结 CommunityBench通过四个基于共同身份和共同纽带理论的任务,评估了社区级对齐方法,揭示了现有LLMs在建模社区特定偏好上的局限性,并探索了社区级对齐在促进个体建模中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12775 2026-01-21 cs.CL 79%

Persistent Personas? Role-Playing, Instruction Following, and Safety in Extended Interactions

持久的人格?角色扮演、指令遵循与在扩展互动中的安全性

Pedro Henrique Luz de Araujo, Michael A. Hedderich, Ali Modarressi, Hinrich Schuetze, Benjamin Roth

机构 * University of Vienna, Faculty of Computer Science(维也纳大学计算机科学系) Doctoral School Computer Science, University of Vienna(维也纳大学计算机科学博士学院) Center for Information and Language Processing, LMU Munich(慕尼黑大学信息与语言处理中心) Munich Center for Machine Learning(慕尼黑机器学习中心) University of Vienna, Faculty of Philological and Cultural Studies(维也纳大学文学与文化研究系)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

AI总结 研究探讨了在长对话中人格保持的稳定性,发现随着对话延长,人格保真度下降,且非人格基线模型在初期表现更优。

Comments 31 pages, 35 figures, accepted to EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12960 2026-01-21 cs.CL 79%

Trustworthy Data-driven Chronological Age Estimation from Panoramic Dental Images

可信的数据驱动全景牙科图像Chronological年龄估计

Ainhoa Vivel-Couso, Nicolás Vila-Blanco, María J. Carreira, Alberto Bugarín-Diz, Inmaculada Tomás, Jose M. Alonso-Moral

机构 * Centro Singular de Investigación en Tecnoloxías Intelixentes (CiTIUS), Universidade de Santiago de Compostela(智能技术研究中心(CiTIUS)、圣地亚哥-德孔波斯特拉大学) Department of Electronics and Computing, Universidade de Santiago de Compostela(电子与计算系、圣地亚哥-德孔波斯特拉大学) Oral Sciences Research Group, Universidade de Santiago de Compostela(口腔科学研究组、圣地亚哥-德孔波斯特拉大学) Instituto de Investigación Sanitaria de Santiago de Compostela (IDIS), Universidade de Santiago de Compostela(圣地亚哥-德孔波斯特拉卫生研究院(IDIS)、圣地亚哥-德孔波斯特拉大学)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CL

AI总结 本文提出了一种结合不透明和透明方法的系统,通过生成临床医生友好的文本解释来提高全景牙科图像中Chronological年龄估计的可信度。

Comments This paper is a preliminary version of an accepted article in Information Systems Frontiers, Springer, Special Issue "Explainability in Human-Centric AI". Please cite the final published version of the paper, not this preprint. The final published version can be found at https://link.springer.com/article/10.1007/s10796-025-10682-3

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12392 2026-01-21 cs.AI 79%

PsychēChat: An Empathic Framework Focused on Emotion Shift Tracking and Safety Risk Analysis in Psychological Counseling

PsychēChat: 一种专注于心理辅导中情感转变跟踪和安全风险分析的共情框架

Zhentao Xia, Yongqi Fan, Yuxiang Chu, Yichao Yin, Liangliang Chen, Tong Ruan, Weiyan Zhang

机构 * East China University of Science and Technology(东华大学) Shanghai Changning Mental Health Center, Affiliated Mental Health Center of East China Normal University(上海昌宁心理健康中心,华东师范大学附属心理健康中心)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 PsychēChat通过情感管理与风险控制模块,提升心理辅导中情感转变跟踪和安全风险分析的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12449 2026-01-21 cs.CR cs.AI 70%

AgenTRIM: Tool Risk Mitigation for Agentic AI

AgenTRIM:代理AI的工具风险缓解

Roy Betser, Shamik Bose, Amit Giloni, Chiara Picardi, Sindhu Padakandla, Roman Vainshtein

机构 * Fujitsu Research of Europe (FRE)(富士通欧洲研究(FRE)) Fujitsu Research of India Pvt. Ltd. (FRIPL)(富士通印度私人有限公司(FRIPL))

专题命中 安全评测 :safety(abstract);prompt injection(abstract);分类 cs.AI

AI总结 AgenTRIM通过离线和在线阶段检测并缓解代理AI中工具驱动的风险,减少攻击成功率同时保持任务性能。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12348 2026-01-21 cs.MA 67%

Generative AI Agents for Controllable and Protected Content Creation

可控且受保护的内容生成的生成式AI代理

Haris Khan, Sadia Asif

专题命中 安全评测 :alignment(abstract);trustworthy(abstract)

AI总结 本文提出了一种多代理框架,通过整合可控内容生成和来源保护,解决生成式AI在可控性和内容保护方面的挑战。

Comments Accepted GenProCC NeurIPS 2025, Paper # 33

Journal ref GenProCC NeurIPS 2025, Paper # 33

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12346 2026-01-21 cs.CV 67%

MMDeepResearch-Bench: A Benchmark for Multimodal Deep Research Agents

MMDeepResearch-Bench: 一个多模态深度研究代理的基准

Peizhou Huang, Zixuan Zhong, Zhongwei Wan, Donghao Zhou, Samiul Alam, Xin Wang, Zexin Li, Zhihao Dou, Li Zhu, Jing Xiong, Chaofan Tao, Yan Xu, Dimitrios Dimitriadis, Tuo Zhang, Mi Zhang

机构 * OSU(俄亥俄州立大学) Amazon(亚马逊公司) UMich(密歇根大学) UCL(伦敦大学学院) CUHK(香港中文大学) UCR(加州大学尔湾分校) CWRU(克里夫兰医学中心) HKU(香港大学)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract)

AI总结 MMDeepResearch-Bench提出一个多模态深度研究代理的基准,强调报告式合成与引用证据的结合,揭示多模态完整性对深度研究代理的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07968 2026-01-21 cs.CR 67%

From Defender to Devil? Unintended Risk Interactions Induced by LLM Defenses

从守护者到魔鬼?由LLM防御引发的意外风险交互

Xiangtao Meng, Tianshuo Cong, Li Wang, Wenyu Chen, Zheng Li, Shanqing Guo, Xiaoyun Wang

专题命中 安全评测 :safety(abstract);jailbreak(abstract)

AI总结 本文提出CrossRiskEval框架,系统研究LLM防御在安全、公平性与隐私间的相互影响,揭示防御措施对其他风险的非随机交互机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11746 2026-01-21 cs.CL cs.AI cs.LG 67%

LIME-LLM: Probing Models with Fluent Counterfactuals, Not Broken Text

LIME-LLM:通过流畅的反事实而非破碎文本来探测模型

George Mihaila, Suleyman Olcay Polat, Poli Nemkova, Himanshu Sharma, Namratha V. Urs, Mark V. Albert

机构 * University of North Texas(北卡罗来纳州立大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 LIME-LLM通过假设驱动的可控扰动提升NLP模型的可解释性,实现更准确的局部解释效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11582 2026-01-21 cs.CY cs.AI cs.CL 67%

Overview of the SciHigh Track at FIRE 2025: Research Highlight Generation from Scientific Papers

FIRE 2025 科学高跟踪概述:从科学论文中生成研究亮点

Tohida Rehman, Debarshi Kumar Sanyal, Samiran Chattopadhyay

机构 * Jadavpur University(贾梵pur大学) Indian Association for the Cultivation of Science(印度科学培养协会) Techno India University(技术印度大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 FIRE 2025 科学高跟踪旨在通过预训练语言模型等方法,从科学论文摘要中自动生成简洁的亮点,以提升文献阅读效率和学术资源检索质量。

Comments 7 pages, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22936 2026-01-21 cs.CL cs.AI cs.CE cs.HC q-fin.CP 62%

Evaluating Large Language Models (LLMs) in Financial NLP: A Comparative Study on Financial Report Analysis

评估大型语言模型(LLMs)在金融NLP中的表现:对财务报告分析的比较研究

Md Talha Mohsin

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文评估了五种基于transformer的LLMs在财务报告分析中的表现,发现模型在不同评估维度上表现各异,需考虑人类主观性和行为差异性。

Comments 23 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10101 2026-01-21 cs.AI cs.CL 62%

Matrix as Plan: Structured Logical Reasoning with Feedback-Driven Replanning

矩阵作为计划:基于反馈驱动的重计划的结构化逻辑推理

Ke Chen, Jiandian Zeng, Zihao Peng, Guo Li, Guangxue Zhang, Tian Wang

机构 * Faculty of Arts and Sciences(艺术与科学学院) Beijing Normal University(北京师范大学) Institute of Artificial Intelligence and Future Networks(人工智能与未来网络研究所) Engineering Research Center of Cloud-Edge Intelligent Collaboration on Big Data, Ministry of Education(教育部云-边智能协同大数据工程研究中心)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 MatrixCoT通过引入矩阵基础计划和反馈驱动重计划机制,提升LLM在复杂符号推理任务中的鲁棒性和可解释性。

Comments 12 pages, 5 figures, 2 tables. Accepted at The Web Conference (WWW) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16544 2026-01-21 cs.CL cs.AI 62%

WER is Unaware: Assessing How ASR Errors Distort Clinical Understanding in Patient Facing Dialogue

WER是无意识的:评估ASR错误如何扭曲患者面对对话中的临床理解

Zachary Ellis, Jared Joselowitz, Yash Deo, Yajie He, Anna Kalygina, Aisling Higham, Mana Rahimzadeh, Yan Jia, Ibrahim Habli, Ernest Lim

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过LLM作为判断者评估ASR错误的临床影响,发现WER等指标与临床风险标签相关性低,引入优化的LLM模型提升评估准确性。

Comments Published as an Oral at IWSDS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18760 2026-01-21 cs.AI cs.CL 62%

Answering the Unanswerable Is to Err Knowingly: Analyzing and Mitigating Abstention Failures in Large Reasoning Models

回答不可回答的问题是明知其错:分析和缓解大推理模型中的回避失败

Yi Liu, Xiangyu Liu, Zequn Sun, Wei Hu

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本文针对大推理模型在面对不可回答问题时的回避失败问题,提出一种轻量级两阶段方法,通过认知监控与推理干预提升回避率并保持推理性能。

Comments Accepted in the 39th AAAI Conference on Artificial Intelligence (AAAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12259 2026-01-21 cs.AI cs.CE cs.LG 62%

FutureX-Pro: Extending Future Prediction to High-Value Vertical Domains

FutureX-Pro: 将未来预测扩展到高价值垂直领域

Jiashuo Liu, Siyuan Chen, Zaiyuan Wang, Zhiyuan Zeng, Jiacheng Guo, Liang Hu, Lingyue Yin, Suozhi Huang, Wenxin Hao, Yang Yang, Zerui Cheng, Zixin Yao, Lingyue Yin, Haoxin Liu, Jiayi Cheng, Yuzhen Li, Zezhong Ma, Bingjie Wang, Bingsen Qiu, Xiao Liu, Zeyang Zhang, Zijian Liu, Jinpeng Wang, Mingren Yin, Tianci He, Yali Liao, Yixiao Tian, Zhenwei Zhu, Anqi Dai, Ge Zhang, Jingkai Liu, Kaiyuan Zhang, Wenlong Wu, Xiang Gao, Xinjie Chen, Zhixin Yao, Zhoufutu Wen, B. Aditya Prakash, Jose Blanchet, Mengdi Wang, Nian Si, Wenhao Huang

机构 * Hong Kong University of Science and Technology(香港科技大学) Georgia Institute of Technology(佐治亚理工学院) Stanford University(斯坦福大学) Princeton University(普林斯顿大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 FutureX-Pro通过扩展未来预测到金融、零售、公共健康和自然灾害等高价值垂直领域,评估代理LLMs在工业部署中的领域基础能力。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11920 2026-01-21 cs.CL cs.AI 62%

Enhancing LLM-Based Data Annotation with Error Decomposition

通过错误分解增强基于LLM的数据标注

Zhen Xu, Vedant Khatri, Yijun Dai, Xiner Liu, Siyan Li, Xuanming Zhang, Renzhe Yu

机构 * Columbia University(哥伦比亚大学) University of California, Irvine(加州大学尔湾分校) University of Pennsylvania(宾夕法尼亚大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 通过错误分解增强基于LLM的数据标注,提出诊断评估范式以区分任务固有模糊性与模型不准确,提升标注质量评估的准确性与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11905 2026-01-21 cs.AI cs.LG math.ST stat.TH 62%

LIBRA: Language Model Informed Bandit Recourse Algorithm for Personalized Treatment Planning

LIBRA:基于语言模型的带状 recourse 算法用于个性化治疗计划

Junyu Cao, Ruijiang Gao, Esmaeil Keyvanshokooh, Jianhao Ma

机构 * McCombs School of Business, University of Texas at Austin(德克萨斯大学奥斯汀分校麦克斯韦商学院) Naveen Jindal School of Management, University of Texas at Dallas(德克萨斯大学达拉斯分校奈文·金达管理学院) Mays Business School, Texas A&M University(德克萨斯农工大学梅斯商学院) Wharton School, University of Pennsylvania(宾夕法尼亚大学沃顿商学院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 LIBRA 是一种结合大语言模型和带状学习的算法,用于在个性化治疗中实现更高效的决策和鲁棒性。

Comments 50 pages. Previous version with human-AI collaboration: arXiv:2410.14640

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26854 2026-01-21 cs.AI cs.LG 62%

Inverse Knowledge Search over Verifiable Reasoning: Synthesizing a Scientific Encyclopedia from a Long Chains-of-Thought Knowledge Base

反向知识搜索与可验证推理:从长推理链知识库合成科学百科全书

Yu Li, Yuan Huang, Tao Wang, Caiyu Fan, Xiansheng Cai, Sihan Hu, Xinzijian Liu, Cheng Shi, Mingjun Xu, Zhen Wang, Yan Wang, Xiangqi Jin, Tianhan Zhang, Linfeng Zhang, Lei Wang, Youjin Deng, Pan Zhang, Weijie Sun, Xinyu Li, Weinan E, Linfeng Zhang, Zhiyuan Yao, Kun Chen

机构 * Lanzhou Center for Theoretical Physics, Key Laboratory of Theoretical Physics of Gansu Province, Key Laboratory of Quantum Theory and Applications of MoE, Gansu Provincial Research Center for Basic Disciplines of Quantum Physics(兰州理论物理中心、甘肃省理论物理重点实验室、教育部量子理论与应用重点实验室、甘肃省量子物理基础学科研究省重点中心) Institute of Theoretical Physics, Chinese Academy of Sciences(中国科学院理论物理研究所) DP Technology(DP技术) Institute of Physics, Chinese Academy of Sciences(中国科学院物理研究所) Département d’Informatique, École normale supérieure(巴黎高等师范大学计算机系)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于长推理链知识库的反向知识搜索方法,通过生成可验证的科学百科全书,实现了跨领域科学合成。

Comments 43 pages, 4 figures. This work is part of the SciencePedia project (sciencepedia.bohrium.com). Corrected author name spelling

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08211 2026-01-21 cs.CL cs.AI cs.CR 62%

LLMs Deceive Unintentionally: Emergent Misalignment in Dishonesty from Misaligned Samples to Biased Human-AI Interactions

大语言模型无意中欺骗:从不一致样本到有偏的人机交互中的涌现不一致

Xuhao Hu, Peng Wang, Xiaoya Lu, Dongrui Liu, Xuanjing Huang, Jing Shao

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 研究发现大语言模型在高风险场景中可能因不一致样本而无意产生不诚实行为,且在下游任务和人机交互中风险显著增加。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06243 2026-01-21 cs.CL cs.AI 62%

CoT Referring: Improving Referring Expression Tasks with Grounded Reasoning

CoT Referring: 通过 grounded 推理改进指称表达任务

Qihua Dong, Luis Figueroa, Handong Zhao, Kushal Kafle, Jason Kuen, Zhihong Ding, Scott Cohen, Yun Fu

机构 * Adobe Research(Adobe研究院) Northeastern University(东北大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 通过 grounded 推理改进指称表达任务,提出CoT Referring方法,提升多模态大语言模型在复杂指称场景中的性能。

Comments MLLM, Referring Expression Segmentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23816 2026-01-21 cs.CL cs.LG 62%

A Course Correction in Steerability Evaluation: Revealing Miscalibration and Side Effects in LLMs

在可转向性评估中的课程修正:揭示LLMs中的误校准与副作用

Trenton Chang, Tobias Schnabel, Adith Swaminathan, Jenna Wiens

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本文提出了一种多维目标空间框架,揭示LLMs在文本改写任务中存在意外副作用,表明现有对齐策略可能不足。

Comments 8 pages, 6 figures. 26 pages of references and supplementary material, 22 additional figures. Association for the Advancement of Artificial Intelligence Conference (AAAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13882 2026-01-21 cs.CL 57%

OpenLearnLM Benchmark: A Unified Framework for Evaluating Knowledge, Skill, and Attitude in Educational Large Language Models

OpenLearnLM基准:一个评估教育大型语言模型知识、技能和态度的统一框架

Unggi Lee, Sookbun Lee, Heungsoo Choi, Jinseo Lee, Haeun Park, Younghoon Jeon, Sungmin Cho, Minju Kang, Junbo Koh, Jiyeong Bae, Minwoo Nam, Juyeon Eun, Yeonji Jung, Yeil Jeong

机构 * Chosun University(chosun大学) Korea University(韩国大学) Ewha Womans University(成均馆大学) Korea Institute for Curriculum and Evaluation(韩国课程评价院) Seoul National University(首尔国立大学) Texas A&M University(德克萨斯农工大学) Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 OpenLearnLM基准通过统一框架评估教育大型语言模型的知识、技能和态度,揭示不同模型在多维度上的能力差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13481 2026-01-21 cs.AI 57%

Towards Efficient and Robust Linguistic Emotion Diagnosis for Mental Health via Multi-Agent Instruction Refinement

通过多智能体指令细化实现高效的稳健语言情绪诊断以促进心理健康

Jian Zhang, Zhangqi Wang, Zhiyuan Wang, Weiping Fu, Yu He, Haiping Zhu, Qika Lin, Jun Liu

机构 * School of Computer Science and Technology, Xi’an Jiaotong University(计算机科学与技术学院,西安交通大学) Saw Swee Hock School of Public Health, National University of Singapore(Saw Swee Hock 公共卫生学院,新加坡国立大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 APOLO通过多智能体协作优化提示空间,提升语言情绪诊断的效率与鲁棒性,适用于心理健康领域的可信LLM应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13443 2026-01-21 cs.AI 57%

Explicit Cognitive Allocation: A Principle for Governed and Auditable Inference in Large Language Models

显式认知分配:一种用于受控和可审计的大语言模型推理的原则

Héctor Manuel Manzanilla-Granados, Zaira Navarrete-Cazales, Miriam Pescador-Rojas, Tonahtiu Ramírez-Romero

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出显式认知分配原则,通过认知通用代理架构实现结构化推理,提升大语言模型在高责任场景下的可追溯性和可审计性。

Comments Preprint. This version corresponds to the initial public release of the CUA architecture and associated evaluation metrics

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08710 2026-01-21 cs.CL 57%

Thinking Longer, Not Always Smarter: Evaluating LLM Capabilities in Hierarchical Legal Reasoning

深入思考,而非总是更聪明:评估大语言模型在分层法律推理中的能力

Li Zhang, Matthias Grabmair, Morgan Gray, Kevin Ashley

机构 * University of Pittsburgh(匹兹堡大学) Technical University of Munich(慕尼黑技术大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 本文提出一个框架评估大语言模型在分层法律推理中的能力,发现模型在表面推理准确但分层推理表现下降,揭示了模型在复杂领域中的局限性。

Comments 15 pages, 7 figures, Proceedings of the 2026 Symposium on Computer Science and Law (CSLAW '26)

详情

展开后加载摘要…

URL PDF HTML 收藏