arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-25 至 2026-08-25 共收录 53 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 53 篇

2608.23563 2026-08-25 cs.CV cs.AI 新提交 83%

EG-ARSA: An Expert-Grounded Open Model for Visual Road Safety Auditing in Low-Resource Settings

EG-ARSA:适用于低资源场景的基于专家知识的开放视觉道路安全审计模型

Md Thamed Bin Zaman Chowdhury, Moazzem Hossain

机构 * Bangladesh University of Engineering and Technology (BUET)(孟加拉工程技术大学(BUET))

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 针对中低收入国家道路安全审计的资源限制,提出EGD框架,构建BD-ARSA数据集和EG-ARSA模型,实验显示其性能优于310亿参数教师模型及Gemini-2.5-Flash,为低资源场景道路安全审计提供有效方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07173 2026-08-25 cs.CL 版本更新 83%

Omni-SafetyBench: A Benchmark for Safety Evaluation of Audio-Visual Large Language Models

Omni-SafetyBench:视听大语言模型安全评估基准

Leyi Pan, Zheyu Fu, Yunpeng Zhai, Shuchang Tao, Sheng Guan, Shiyu Huang, Lingzhe Zhang, Zhaoyang Liu, Bolin Ding, Felix Henry, Aiwei Liu, Lijie Wen

机构 * Tsinghua University(清华大学) Tongyi Lab(通义实验室) Peking University(北京大学) OpenRL Lab(OpenRL实验室)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.CL

AI总结 研究针对现有OLLM安全基准的不足,构建Omni-SafetyBench基准,提出定制化评估指标,发现多数OLLM存在安全漏洞,为该领域研究提供重要支撑。

Comments ACM MM 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01317 2026-08-25 cs.SE cs.CR 版本更新 82%

SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces

SABER:在有状态项目工作区中对LLM编码代理的操作安全性进行基准测试

Qi Hu, Yifeng Tang, Qinghua Wang, Lanyang Zhao, Pengji Zhang, Yuhao Qing, Xin Yao, Dong Huang, Lin Zhang, Zhuoran Ji

专题命中 安全评测 :safety(title,abstract);alignment(abstract)

AI总结 提出SABER基准,通过将模型置于真实代理式项目中并评估最终环境状态,来衡量LLM编码代理的操作安全性,发现最佳模型的有害安全违规率超过54%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04806 2026-08-25 cs.LG cs.AI cs.CL 版本更新 82%

NeST: Neighborhood-aware semantic alignment and temporal modulation for LLM based time series forecasting

NeST:面向基于大语言模型的时间序列预测的邻域感知语义对齐与时间调制

Jayanie Bogahawatte, Sachith Seneviratne, Maneesha Perera, Saman Halgamuge

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 NeST框架通过邻域感知语义对齐与时间调制构建文本整合提示词微调LLM,在8个基准及9个真实光伏数据集的时间序列预测中,MSE、R²等指标优于现有方法,泛化性强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23497 2026-08-25 cs.AI cs.CL 新提交 81%

Mitigating Reasoning-Induced Misalignment via Safety-Direction Penalty

通过安全方向惩罚缓解推理诱导的不一致性

Yipeng Zhao, Qishun Yang, Shenzhe Zhu, Shu Yang, Di Wang

机构 * University of Toronto(多伦多大学) King Abdullah University of Science and Technology(阿卜杜拉国王科技大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 针对推理微调引发LLM安全退化的RIM问题,本文提出安全方向惩罚(SDP)方法,通过定位安全决策层并惩罚安全方向位移,在Qwen2.5系列模型上实现安全与推理性能的平衡。

Comments 28 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22802 2026-08-25 cs.CL cs.AI 新提交 81%

SDoH-Aware Narrative Anchoring Bias in Medical LLMs for Trustworthy Clinical Decision Support

面向可信临床决策支持的、关注社会决定健康因素(SDoH)的医学大语言模型叙事锚定偏差

Ahnaf Atef Choudhury, Ramkrishna Saha

机构 * George Mason University(乔治梅森大学) The University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究针对医学大语言模型的叙事锚定偏差问题,以Qwen2.5系列模型为对象开展实验,发现7B模型仍存在较高叙事敏感性误差,提出需结合正确率与叙事稳定性评估临床决策支持模型。

Comments Accepted for publication at 10th International Artificial Intelligence and Data Processing Symposium (IDAP'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22335 2026-08-25 cs.CL cs.AI 新提交 81%

Register Shifts Break LLM Safety: A Bengali Benchmark with Culturally Grounded Harms

寄存器偏移破坏大语言模型安全:具有文化相关危害的孟加拉语基准测试

Naymul Islam, Nusrat Jahan Lia, Shubhashis Roy Dipta, Sabik Bin Sultan, Abdullah Khan Zehady

机构 * Institute of Information Technology, University of Dhaka(达卡大学信息技术学院) University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校) Bangladesh Air Force Shaheen College Kurmitola(孟加拉国空军库尔米托拉沙欣学院) Ciroos Inc.(Ciroos公司)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 针对孟加拉语LLM安全评估的英语中心偏差问题,构建含879个提示的BanglaSafe基准,发现写作风格对有害请求成功率的影响最大,且现有安全分类器难以评估孟加拉语内容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23313 2026-08-25 cs.AI 新提交 79%

EviSafe: Evidence-Grounded Safety Evaluation for Vision-Language Models

EviSafe:基于证据的视觉语言模型安全性评估

Xuetong Li, Gaofeng Liu

机构 * Department of Automation, Shanghai Jiao Tong University(上海交通大学自动化系)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本研究提出基于证据的VLM安全性评估框架EviSafe及对应基准EviSafeBench,通过三探针协议评估11个VLMs,发现其未因正确多模态原因可靠安全,需开展超越拒绝次数的评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21898 2026-08-25 cs.AI 新提交 79%

Training Needs Trustworthy Worlds: Verified Synthetic Web Environments for Agent Learning

训练需要可信的世界:用于智能体学习的经过验证的合成Web环境

Chenghao Zhang, Canran Xiao, SaiSai Hu, Dan Roth

机构 * University of Pennsylvania(宾夕法尼亚大学) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Pace University(佩斯大学)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

AI总结 该研究构建可执行、可审计的合成Web环境,修复缺陷后用于训练Web智能体,提升了可行任务率与PPO策略性能,增强了向多个基准的迁移能力,为智能体学习提供了可靠训练基底。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21880 2026-08-25 cs.CL cs.CR 新提交 79%

BanglaVeilGuard: Cross-Script Safety Benchmarking and Lightweight Guardrails for Bangla Large Language Models

BanglaVeilGuard:孟加拉语大语言模型的跨脚本安全基准测试与轻量安全防护措施

Md. Rakibul Hassan, Muhammad Iqbal Hossain

机构 * BRAC University(BRAC大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

AI总结 针对孟加拉语LLM跨脚本安全评估难题,本文提出BanglaVeilGuard基准与轻量提示防护,可降低攻击成功率,提升不安全请求召回率,但存在方言及带噪良性提示过度拒绝的问题。

Comments Accepted at the 4th International Conference on Computing Advancements (ICCA 2026). 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22444 2026-08-25 cs.CL 新提交 77%

Aligned Alone, Misaligned Together: Forecasting Adversarial Capture in LLM Agent Populations

单独对齐,共同错位:预测大语言模型智能体群体中的对抗捕获

Isotta Magistrali, Chen Shani

专题命中 安全评测 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.CL

AI总结 该研究针对LLM智能体群体,提出从群体无攻击时的良性运行状态校准响应函数,可提前预测坚定少数群体引发的对抗捕获,且捕获为临时状态,孤立对齐不等同于群体对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21486 2026-08-25 cs.CV 新提交 71%

EXPL-FR: Explaining Face Recognition Models via Vision-Language Alignment

EXPL-FR:基于视觉-语言对齐的人脸识别模型解释方法

Guray Ozgur, Mustafa Efe Tamyapar, Naser Damer, Fadi Boutros

机构 * Fraunhofer IGD(弗劳恩霍夫应用研究促进协会图形数据处理研究所) TU Darmstadt(达姆施塔特工业大学)

专题命中 安全评测 :alignment(title)

AI总结 EXPL-FR是一种基于视觉-语言对齐的人脸识别模型解释方法,通过轻量适配器在FR嵌入空间内生成语义特征,支持多粒度解释,可实现无标签的属性级审计与模型性能排名。

Comments Accepted at the ECCV 2026 Workshops

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22510 2026-08-25 cs.AI 新提交 70%

ClawProBench: Trace-Aware Evaluation of AI Agents with Runtime Coverage and Frozen Workplace-Style Holdouts

ClawProBench:基于运行时覆盖与冻结工作空间保留集的轨迹感知AI智能体评估

YuanHang Xiao

机构 * The Chinese University of Hong Kong(香港中文大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 该研究提出ClawProBench基准,基于OpenClaw运行时构建,通过含102场景的全配置集与68场景的冻结保留集评估AI智能体,采用安全门控公式评分,发现最终答案排行榜存在缺陷,不同评估视角的智能体排名差异显著。

Comments 29 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21736 2026-08-25 cs.LG 新提交 70%

Adaptive Multilevel Twisted Sequential Monte Carlo for Rare Events Estimation in Language Models

用于语言模型稀有事件估计的自适应多级扭曲序贯蒙特卡洛方法

Zixuan Liu, Fangzheng Wu, Brian Summa, Zizhan Zheng

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.LG

AI总结 针对现有扭曲序贯蒙特卡洛稀有事件估计依赖稀有正样本导致不可靠的问题,提出自适应多级扭曲SMC,通过逐步稀有中间事件学习扭曲,提升语言模型稀有不安全行为概率估计准确性,助力模型安全评估与对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12792 2026-08-25 cs.CR cs.AI 版本更新 70%

Silent Alarm: A J-Space Protocol for Comparing Danger Recognition Across Models and Quantization Levels

无声警报:一种用于跨模型和量化级别比较危险识别的J空间协议

Roman Prosvirnin, Victor Minchenkov, Alexey Soldatov, Vladimir Bashun, Anton Sergeev

机构 * HSE University(俄罗斯高等经济大学)

专题命中 安全评测 :safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 研究提出JADR协议,通过J空间测量模型内部表示,不依赖外部评判模型,计算本地运行。应用于六个模型跨越三种权重表示形式,以SafetyAUC指标比较,能显著区分不同安全机制模型,捕捉量化差异。

Comments 17 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00869 2026-08-25 cs.LG 版本更新 70%

Enhancing LLM Metacognition via Cognitive Pairwise Training

通过认知成对训练增强LLM元认知

Weitao Li, Hao Zhou, Xuanyu Lei, Fandong Meng, Yuanhang Liu, Jingyi Ren, Ante Wang, Xiaolong Wang, Yuanchi Zhang, Fuwen Luo, Guangwen Yang, Lin Gan, Weizhi Ma, Yang Liu

机构 * National Engineering Laboratory for Intelligent Information Processing, Academy of Mathematics and Physics, Chinese Academy of Sciences(智能信息处理国家工程实验室,中国科学院数学物理研究所) University of Science and Technology of China(中国科学技术大学)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.LG

AI总结 提出认知成对训练(CPT),通过成对比较推理轨迹来学习区分可靠与不可靠推理,从而提升LLM的推理与元认知权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22582 2026-08-25 cs.CL cs.AI cs.CY cs.HC 新提交 67%

Hybrid Panels: Toward Human-AI Collaboration in Survey Research

混合面板:面向调查研究中的人机协作

Julia Romberg, Tobias Gummer, Gabriella Lapesa, Tanja Kunz, Claudia Wagner

机构 * GESIS - Leibniz Institute for the Social Sciences(莱布尼茨社会科学研究所(GESIS)) Heidelberg University(海德堡大学) Heinrich Heine University of Düsseldorf(杜塞尔多夫海因里希·海涅大学) RWTH Aachen University(亚琛工业大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本研究提出混合面板概念,构建首个试点,将人类与LLMs结合用于调查,旨在解决调查的响应率、成本等问题,为调查研究的人机协作提供新方向。

Comments 15 pages, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04448 2026-08-25 cs.AI cs.CL cs.CV cs.LG cs.MA 版本更新 67%

SkillNet: Create, Evaluate, and Connect AI Skills

SkillNet: 创建、评估和连接AI技能

Yuan Liang, Ruobin Zhong, Haoming Xu, Chen Jiang, Yi Zhong, Runnan Fang, Jia-Chen Gu, Shumin Deng, Yunzhi Yao, Mengru Wang, Shuofei Qiao, Yida Xue, Xin Xu, Tongtong Wu, Kun Wang, Yang Liu, Zhen Bi, Jungang Lou, Yuchen Eleanor Jiang, Hangcheng Zhu, Gang Yu, Haiwen Hong, Longtao Huang, Hui Xue, Chenxi Wang, Yijun Wang, Zifei Shan, Xi Chen, Zhaopeng Tu, Feiyu Xiong, Xin Xie, Peng Zhang, Zhengke Gui, Lei Liang, Jun Zhou, Chiyu Wu, Jin Shang, Yu Gong, Junyu Lin, Changliang Xu, Hongjie Deng, Wen Zhang, Keyan Ding, Qiang Zhang, Fei Huang, Ningyu Zhang, Jeff Z. Pan, Guilin Qi, Haofen Wang, Huajun Chen

机构 * Zhejiang University(浙江大学) Tongji University(同济大学) Southeast University(东南大学) Alibaba Group(阿里巴巴集团) Tencent(腾讯) Fudan University(复旦大学) The University of Edinburgh(爱丁堡大学) Monash University(墨尔本大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Huzhou University(湖州大学) Hornor Device Co., Ltd(Hornor设备有限公司) Hangzhou Institute for Advanced Study, UCAS(杭州先进研究所,UCAS)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SkillNet通过统一的本体和多维评估机制,大规模创建、评估和连接AI技能,提升代理性能并促进技能的持久掌握。

Comments this http URL (http://skillnet.openkg.cn/;) add SkillNet-Gym, a benchmark for evaluating skill retrieval, utilization, composition, and SkillNet-Fabric for task-specific skill routing through lightweight Wikis

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22634 2026-08-25 cs.CL cs.AI 新提交 62%

GeoRisk-RAG: A Hierarchy-Aware Risk Framework for Improving RAG Reliability through Selective Answering

GeoRisk-RAG:一种通过选择性回答提升RAG可靠性的层级感知风险框架

Meenu Ravi, Shailik Sarkar, Lulwah AlKulaib, Yordanos Tessema, Chang-Tien Lu

机构 * Virginia Tech(弗吉尼亚理工大学) Florida Polytechnic University(佛罗里达理工大学) Kuwait University(科威特大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 GeoRisk-RAG是一种层级感知框架,通过选择性回答结合有向无环图距离估计地理适用性,在野火QA数据集上将位置相关问题错误置信率降至0.009,提升RAG可靠性,助力地理空间领域安全决策。

Comments Accepted for CIKM '26 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21928 2026-08-25 cs.AI cs.CL cs.RO 新提交 62%

GuardianBench: A Same-Scene Instruction-Contrastive Benchmark for Latent Contextual Risk in Embodied AI

GuardianBench:面向具身智能中潜在上下文风险的同场景指令对比基准

Zhesheng Zhang, Jiahao Lu, Wei Liu, Cong Pan, Jianhua Yang, Yixiang Chen, Hongyuan Yu, Mengqi Zhang, Kailin Lyu, Zhumin Chen, Keji He

机构 * Shandong University(山东大学) National University of Singapore(新加坡国立大学) Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Xiaomi Corporation(小米公司)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出基于国际安全标准的同场景指令对比基准GuardianBench,发现VLMs对指令不敏感,用轻量级目标VLOS可提升其安全推理性能。

Comments 21 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21766 2026-08-25 cs.CL cs.AI 新提交 62%

Evaluation Awareness in Language Models: Representation, Verbalization, and Control

语言模型中的评估感知:表示、语言化与控制

Farzaneh Heidari, Amin Memarian, Guillaume Rabusseau

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 该研究系统探测了6个语言模型的评估感知,发现其可线性解码、与语言化部分对齐,且在Olmo模型中随微调放大,需评估时考虑模型内部表示与语言化的脱节。

Comments The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22994 2026-08-25 cs.LG cond-mat.dis-nn cond-mat.stat-mech cs.AI physics.comp-ph 新提交 62%

A Physical Response-and-Memory Model for Muon Optimization

用于Muon优化器的物理响应-记忆模型

Yinze Hu, Hongjun Xiang, Xingao Gong, Hongyu Yu

机构 * School of Physics Science and Engineering, Tongji University(同济大学物理科学与工程学院)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文构建训练权重矩阵的物理响应-记忆模型,解释Muon优化器半正交化方向的有效性,提出Bi-Maxwell优化器,其双时间尺度记忆核可减少大型语言模型训练步数。

Comments 44 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07669 2026-08-25 cs.CL cs.AI 版本更新 62%

DiaLLM: An Investigation into the Robustness-Generation Gap in English Dialect Adaptation

DiaLLM:英语方言适应中稳健性-生成差距的研究

Jordan Painter, Dipankar Srirag, Adarsh Kappiyath, Diptesh Kanojia, Aditya Joshi, Lu Yin

机构 * Institute for People-Centered AI, University of Surrey(萨里大学以人为本人工智能研究所) University of New South Wales(新南威尔士大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 研究英语方言适应中稳健性与生成的差距,通过DiaLLM持续预训练并结合多种策略对比不同英语变体。发现二者分离,特定变体适应产出受青睐但优化奖励方法未获评估者偏爱,缩小差距需丰富奖励设计和投入方言资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07602 2026-08-25 cs.LG cs.AI 版本更新 62%

Sample-Efficient Post-Training for LEGO Spatial-Physics Reasoning

面向LEGO空间物理推理的样本高效后训练

Yuhuan Yuan, Zhouliang Yu, Minghao Liu, Weiyang Liu, Ge Lin Kan

机构 * HKUST(GZ)(香港科技大学(广州)) CUHK(香港中文大学) ZODA

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 针对LLM生成LEGO组装时出现的物理有效但几何语义错位问题,提出基于模型的数据选择方法和样本高效强化学习PVPO,结合体素空间几何奖励,提升结构、语义对齐和物理有效性。

Comments Technical Report V2, 20 pages, 7 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18646 2026-08-25 cs.AI cs.CL 版本更新 62%

Beyond Benchmarks: LLM Evaluation with an Anthropomorphic and Lifecycle-oriented Roadmap

超越基准:基于拟人化与生命周期导向路线图的大语言模型评估

Jun Wang, Ninglun Gu, Kailai Zhang, Pengyong Li, Yelun Bao, Jin Yang, Xu Yin, Liwei Liu, Zijiao Zhang, Yihuan Liu, Gary G. Yen, Junchi Yan

机构 * Department of Networks, China Mobile Communications Group Co.,Ltd.(中国移动通信集团有限公司网络部) Xidian University(西安电子科技大学) Oklahoma State University(俄克拉荷马州立大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本研究针对LLM基准分数与实际效用脱节问题,建立诊断本体并提出含IQ、PQ、EQ、VQ的拟人化评估框架,分析200余个基准后为LLM开发提供战略指引。

Comments Preprint. Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00209 2026-08-25 cs.LG cs.CL 版本更新 62%

Scaling Electronic Health Record Foundation Models for Population Health Management

面向人群健康管理的电子健康记录基础模型规模化研究

Liwen Sun, Hao-Ren Yao, Ophir Frieder, Xiang Qian, Chenyan Xiong

机构 * Carnegie Mellon University(卡内基梅隆大学) Georgetown University(乔治城大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 该研究提出面向人群健康管理的电子健康记录基础模型,跨500万患者数据预训练,在11项慢性病预测任务及EHRShot基准中表现优于同类模型,将开源代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.14879 2026-08-25 cs.CL cs.AI 版本更新 62%

Evaluating the Efficacy of LLMs to Emulate Realistic Human Personalities

评估大语言模型(LLMs)模拟真实人类人格的效能

Lawrence J. Klinkert, Stephanie Buongiorno, Corey Clark

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本研究以超5万份人类人格调查数据为基准,对比前沿与本地LLMs,发现部分前沿模型可100%对齐人类人格,为游戏开发者提供了测试LLMs模拟人类人格的方法。

Comments 11 pages, 4 figures, 3 tables. Published in Proceedings of AIIDE 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23344 2026-08-25 cs.LG 新提交 57%

Towards Actionable Surgical Team Dynamics: from Teamwork to Counterfactual Annotations

面向可操作的手术团队动态:从团队协作到反事实标注

Vincenzo Marco De Luca, Antonio Longa, Andrea Passerini

机构 * University of Trento(特伦托大学) UiT the Arctic University of Norway(挪威北极大学)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 本研究构建了基于真实手术室录制的扩展多模态手术团队互动数据集,含多级标注与反事实标注,支持团队协作建模及AI辅助协作系统设计,为高风险领域协作行为分析提供统一资源。

Comments Accepted at HCOMP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22917 2026-08-25 cs.CL cs.IR 新提交 57%

TSWAP: A Multilingual Retrieval-Augmented Thai Wellness Advisor

TSWAP:多语言检索增强型泰国健康顾问

Pornthep Ukosaramig, Kobkrit Viriyayudhakorn

机构 * Digital Touch Point Co., Ltd.(数字触点有限公司) iApp Technology Co., Ltd.(iApp技术有限公司)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 研究提出多语言检索增强型泰国健康顾问TSWAP,基于泰国传统医学知识库,采用混合检索等技术,发布相关基准与日志,发现量化及强制检索的部署要点。

Comments 8 pages, 2 tables. Data and evaluation logs: this https URL (https://huggingface.co/datasets/iapp/tswap-wellness-benchmark)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22618 2026-08-25 cs.LG 新提交 57%

KMGen: A Skill-based Approach for Synthetic Individual Patient Data Generation

KMGen:一种基于技能的合成个体患者数据生成方法

Jalen Jiang, Chufan Gao, Ethan Rasmussen, Stephen Z. Xie, Jimeng Sun

机构 * Mayo Clinic Alix School of Medicine(梅奥诊所阿利克斯医学院)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 KMGen是首个端到端框架,可全自动提取KM曲线并生成合成患者不良事件轨迹,在多肿瘤试验中精度达标,相关流水线已开源。

详情

展开后加载摘要…

URL PDF HTML 收藏