arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 8057 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 8057 篇

2604.21361 2026-04-24 cs.AI 57%

Time, Causality, and Observability Failures in Distributed AI Inference Systems

时间、因果性和可观察性故障在分布式AI推理系统中

Ankur Sharma, Deep Shah, David Lariviere, Hesham ElBakoury

机构 * Open Compute Project(开放计算项目)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 研究揭示了分布式AI系统中时间同步对可观察性和因果性的影响,发现微小时钟偏差会导致因果错误,但系统功能和性能不受影响,强调时间对齐的重要性。

Comments 17 pages, 6 figures. Produced as part of the Unified Intelligent Infrastructure workstream at the Open Compute Project (OCP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21352 2026-04-24 cs.CL 57%

CARE: Counselor-Aligned Response Engine for Online Mental-Health Support

CARE:面向在线心理健康支持的咨询师对齐响应引擎

Hagai Astrin, Ayal Swaid, Avi Segal, Kobi Gal

机构 * Ben-Gurion University(本· Gurion 大学) School of Informatics, University of Edinburgh(爱丁堡大学信息学院) School of Informatics, University of Edinburgh Edinburgh UK(爱丁堡大学信息学院爱丁堡 英国)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 CARE通过针对希伯来语和阿拉伯语的微调,提升心理健康领域低资源语言下的响应质量,增强咨询师与求助者对话的动态结构和情感语境。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21255 2026-04-24 cs.CL 57%

When Agents Look the Same: Quantifying Distillation-Induced Similarity in Tool-Use Behaviors

当代理看起来相同:量化蒸馏诱导的工具使用行为相似性

Chenghao Yang, Yuning Zhang, Zhoufutu Wen, Tao Gong, Jiaheng Liu, Qi Chu, Nenghai Yu

机构 * School of Cyber Science and Technology, USTC(USTC计算机科学与技术学院) Anhui Province Key Laboratory of Digital Security(安徽省数字安全重点实验室) M-A-P

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文提出两种新指标RPS和AGS,用于区分任务成功必需行为与模型自主偏好,通过评估18个模型发现AGS能区分教师特定收敛与通用改进。

Comments Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12994 2026-04-24 cs.CR cs.AI 57%

LogicEval: A Systematic Framework for Evaluating Automated Repair Techniques for Logical Vulnerabilities in Real-World Software

LogicEval: 一个系统框架用于评估自动修复技术在现实软件中逻辑漏洞的修复

Syed Md Mukit Rashid, Abdullah Al Ishtiaq, Kai Tu, Yilu Dong, Tianwei Wu, Ali Ranjbar, Tianchang Yang, Najrin Sultana, Shagufta Mehnaz, Syed Rafiul Hussain

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本文提出LogicEval框架,通过LogicDS数据集评估传统和基于LLM的修复方法,发现编译和测试失败主要由提示敏感性、代码上下文丢失和补丁定位困难导致。

Comments To appear in ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11569 2026-04-24 cs.AI 57%

SemaPop: Semantic-Persona Conditioned and Controllable Population Synthesis

SemaPop:基于语义-人设的可控人口合成

Zhenlin Qin, Yancheng Ling, Leizhen Wang, Francisco Câmara Pereira, Zhenliang Ma

机构 * Department of Civil and Architectural Engineering, KTH Royal Institute of Technology(土木与建筑系,皇家理工学院) Digital Future, KTH Royal Institute of Technology(数字未来,皇家理工学院) Department of Data Science and Artificial Intelligence, Monash University(数据科学与人工智能系,墨尔本大学) Department of Technology, Management and Economics, Technical University of Denmark(技术、管理与经济学系,丹麦技术大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 SemaPop通过引入人设表示作为生成条件,实现可控的人口合成,提升生成性能并保持统计一致性与样本多样性。

Comments Submitted to Transportation Research Part C: Emerging Technologies

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20496 2026-04-23 cs.CR cs.AI 57%

Mythos and the Unverified Cage: Z3-Based Pre-Deployment Verification for Frontier-Model Sandbox Infrastructure

神话与未验证的笼子:基于Z3的预部署验证用于前沿模型沙盒基础设施

Dominik Blain

机构 * COBALT Formal Verification(COBALT形式验证)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本文提出COBALT,一种基于Z3的正式验证引擎,用于在部署前检测C/C++基础设施中的CWE-190/191/195算术漏洞模式。通过四个生产案例验证其有效性,并提出四层 containment 框架以提升前沿模型的安全性。

Comments 12 pages, 2 figures, 4 production case studies, 4 tables. Research paper on formal verification for frontier-model sandbox infrastructure

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13871 2026-04-23 cs.LG cs.SY eess.SY 57%

Hardware-Efficient Neuro-Symbolic Networks with the Exp-Minus-Log Operator

高效硬件神经符号网络与Exp-Minus-Log运算符

Eymen Ipek

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 本文提出一种结合深度神经网络与Exp-Minus-Log运算符的混合模型,旨在解决传统DNN在安全关键和资源受限环境中的透明性和计算效率问题,通过硬件可实现的Sheffer元素提升可解释性和形式验证可行性。

Comments This paper has been withdrawn by the authors due to the discovery of a fundamental limitation in EML method

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20811 2026-04-23 cs.AI 57%

Diagnosing CFG Interpretation in LLMs

在LLM中诊断CFG解释

Hanqi Li, Lu Chen, Kai Yu

机构 * X-LANCE Lab, School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(上海交通大学计算机科学学院X-LANCE实验室) AISpeech Co., Ltd., Suzhou, China(上海AI语音有限公司) Shanghai Innovation Institution, Shanghai, China(上海创新研究所) Jiangsu Key Lab of Language Computing, Suzhou, China(江苏省语言计算重点实验室) Suzhou Laboratory, Suzhou, China(苏州实验室)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 研究LLM在处理新上下文无关文法时能否生成语法正确、行为功能和语义忠实的输出,揭示LLM在语法、行为和语义层面的层次退化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10866 2026-04-22 stat.ML cs.LG 57%

Quantifying Data Similarity Using Cross Learning

通过交叉学习量化数据相似性

Shudong Sun, Hao Helen Zhang, Joseph C Watkins

机构 * GIDP University of Arizona(GIDP亚利桑那大学)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本文提出Cross-Learning Score,通过双向泛化性能衡量数据集相似性,结合几何解释和鲁棒集成估计器,扩展至深度学习架构,验证了其在数据相似性测量和迁移评估中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19125 2026-04-22 cs.CL 57%

Do Emotions Influence Moral Judgment in Large Language Models?

情绪是否影响大语言模型的道德判断?

Mohammad Saim, Tianyu Jiang

机构 * University of Cincinnati(辛辛那提大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 研究通过情感诱导流程评估多组数据和LLM中道德可接受性变化,发现积极情绪提升道德可接受性,负面情绪降低,且部分情绪表现与预期相反,揭示了当前LLM与人类在道德判断上的差异。

Comments 18 pages, 14 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18913 2026-04-22 cs.CL 57%

LogosKG: Hardware-Optimized Scalable and Interpretable Knowledge Graph Retrieval

LogosKG:硬件优化的可扩展且可解释的知识图谱检索

He Cheng, Yifu Wu, Saksham Khatwani, Maya Kruse, Dmitriy Dligach, Timothy A. Miller, Majid Afshar, Yanjun Gao

机构 * LARK Lab, University of Colorado Anschutz(洛克拉克实验室,科罗拉多大学安施图茨分校) University of Colorado Boulder(科罗拉多大学波德分校) Loyola University Chicago(芝加哥洛克拉克大学) Harvard Medical School(哈佛医学院) Boston Children’s Hospital(波士顿儿童医院) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 LogosKG通过符号知识图谱和硬件高效操作实现大规模知识图谱的多跳检索,提升效率与可解释性,展示出在生物医学知识与大语言模型推理对齐分析中的应用价值。

Comments Accepted to the ACL 2026 Main Conference. 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18712 2026-04-22 cs.CL 57%

Probing for Reading Times

探测阅读时间

Eleftheria Tsipidi, Samuel Kiegeland, Francesco Ignazio Re, Tianyang Xu, Mario Giulianelli, Karolina Stanczak, Ryan Cotterell

机构 * ETH Zürich(苏黎世联邦理工学院) Toyota Technological Institute at Chicago(芝加哥丰田技术研究所) University College London(伦敦大学学院)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文通过眼动追踪数据,利用正则化线性回归比较语言模型各层表示在预测阅读时间等指标上的表现,发现早期层表示在预测早期眼动指标上优于 surprisal,但对总阅读时间而言 surprisal 仍更优。

Comments ACL 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18187 2026-04-21 cs.SD cs.CL 57%

Audio-DeepThinker: Progressive Reasoning-Aware Reinforcement Learning for High-Quality Chain-of-Thought Emergence in Audio Language Models

Audio-DeepThinker:渐进式推理感知强化学习用于音频语言模型中高质量推理链涌现

Xiang He, Chenxing Li, Jinting Wang, Yan Rong, Tianxin Xie, Wenfu Wang, Li Liu, Dong Yu

机构 * Tencent AI Lab(腾讯AI实验室) The Hong Kong University of Science(香港科技大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文提出Audio-DeepThinker框架,通过混合奖励和渐进式课程学习提升音频推理质量,实现高质量推理链涌现,取得多项评测冠军。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18003 2026-04-21 cs.AI 57%

SELF-EMO: Emotional Self-Evolution from Recognition to Consistent Expression

SELF-EMO:从识别到一致表达的情感自我进化

Shaowei Zhang, Faqiang Qian, Yan Chen, Ziliang Wang, Kang An, Yong Dai, Mengya Gao, Yichao Wu

机构 * SenseTime Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) X-Humanoid

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 SELF-EMO通过引入情感理解和表达辅助任务,结合角色自博弈机制和数据飞轮机制,实现情感识别与表达的自我进化,实验表明其在多个数据集上均取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06803 2026-04-21 cs.CL cs.CV 57%

Forest Before Trees: Latent Superposition for Efficient Visual Reasoning

森林在树之前:用于高效视觉推理的潜在叠加

Yubo Wang, Juntian Zhang, Yichen Wu, Yankai Lin, Nils Lukas, Yuhan Liu

机构 * MBZUAI Fudan University(复旦大学) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) Harvard University(哈佛大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文提出Laser方法,通过动态窗口对齐学习实现视觉推理的'森林在树之前'认知层次,提升模型在保持全局特征叠加的同时,实现高效且可解释的视觉推理。

Comments Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05543 2026-04-21 cs.CL cs.SD eess.AS 57%

Closing the Modality Reasoning Gap for Speech Large Language Models

弥合语音大语言模型的模态推理差距

Chaoren Wang, Heng Lu, Xueyao Zhang, Shujie Liu, Yan Lu, Jinyu Li, Zhizheng Wu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Microsoft Corporation(微软公司)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文提出TARS框架,通过不对称奖励设计对齐文本和语音条件轨迹,显著缩小模态推理差距并在7B级语音大语言模型中取得最佳性能。

Comments Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03154 2026-04-21 cs.CL 57%

Decoupling the Effect of Chain-of-Thought Reasoning: A Human Label Variation Perspective

解耦链式推理的影响:从人类标签变异视角出发

Beiduo Chen, Tiancheng Hu, Caiqi Zhang, Robert Litschko, Anna Korhonen, Barbara Plank

机构 * MaiNLP Center for Information and Language Processing, LMU Munich(信息与语言处理中心,慕尼黑大学) LMU Munich, Germany(慕尼黑大学,德国) Munich Center for Machine Learning (MCML), Munich, Germany(慕尼黑机器学习中心(MCML),慕尼黑,德国) Language Technology Lab, University of Cambridge, United Kingdom(语言技术实验室,剑桥大学,英国)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文通过系统解耦实验探讨了链式推理对分布任务的影响,发现推理内容对最终准确性贡献大,而模型先验对分布排名起主导作用。

Comments Accepted by ACL 2026 Findings, 21 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11288 2026-04-21 cs.CL 57%

Emergent Misalignment via In-Context Learning: Narrow in-context examples can produce broadly misaligned LLMs

通过上下文学习产生涌现偏差:狭窄的上下文示例可以产生广泛偏差的LLM

Nikita Afonin, Nikita Andriianov, Vahagn Hovhannisyan, Nikhil Bageshpura, Kyle Liu, Kevin Zhu, Sunishchal Dev, Ashwinee Panda, Oleg Rogov, Elena Tutubalina, Alexander Panchenko, Mikhail Seleznyov

机构 * AIRI MTUCI Algoverse AI Research Skoltech Yandex School of Data Analysis MSU ISP RAS Research Center for Trusted Artificial Intelligence Yerevan State University

专题命中 其他安全 :safety(abstract);分类 cs.CL

AI总结 研究发现,狭窄的上下文示例通过上下文学习可导致LLM产生广泛偏差,揭示了上下文学习在涌现偏差中的重要作用,且规模扩大或显式推理无法有效缓解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17738 2026-04-21 cs.CL 57%

Mira-Embeddings-V1: Domain-Adapted Semantic Reranking for Recruitment via LLM-Synthesized Data

Mira-Embeddings-V1:基于LLM合成数据的领域适应语义重排序用于招聘

Zhaohua Liang, Zhilin Wang, Renjie Cao, Yining Zhang

机构 * OpenJobs AI

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文提出Mira-Embeddings-V1,通过LLM合成数据重塑嵌入空间并纠正边界混淆,提升招聘领域召回率和精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17182 2026-04-21 cs.SE cs.AI 57%

Layer-wise MoE Routing Locality under Shared-Prefix Code Generation: Token-Identity Decomposition and Compile-Equivalent Fork Redundancy

层间MoE路由局部性在共享前缀代码生成中的研究:令牌身份分解与编译等效分支冗余

Shun-ichiro Hayashi, Daichi Mukunoki, Tetsuya Hoshino, Takahiro Katagiri

机构 * Shun-ichiro Hayashi(Hayashi 馃一郎) Daichi Mukunoki(Mukunoki 大地) Tetsuya Hoshino(Hoshino 艾田) Takahiro Katagiri(Katagiri 谷田)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 研究探讨了在共享前缀代码生成中,MoE专家路由的层间局部性,通过令牌身份分解和编译等效分支冗余分析,揭示了路由重叠模式及优化搜索效率的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12176 2026-04-21 cs.LG stat.ML 57%

"Faithful to What?" On the Limits of Fidelity-Based Explanations

忠实于什么?关于基于忠实性的解释的局限性

Jackson Eshbaugh

机构 * Lafayette College(拉法叶学院)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 研究指出基于忠实性的解释方法无法准确反映模型预测性能,通过线性得分λ(f)发现高忠实度代理模型可能无法恢复数据结构的预测优势。

Comments 6 pages, 3 figures, 3 tables. Accepted at the Workshop on Scientific Methods for Understanding Deep Learning (Sci4DL) at ICLR 2026. Code available at https://github.com/jacksoneshbaugh/lambda-linearity-score/tree/main

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06024 2026-04-21 cs.IT cs.LG math.IT 57%

On Inverse Problems, Parameter Estimation, and Domain Generalization

关于逆问题、参数估计和领域泛化

Deborah Pereg

机构 * MIT(麻省理工学院)

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 本文提出逆问题中参数估计的理论分析框架,区分连续与离散估计,探讨可逆与不可逆退化过程,并揭示领域泛化中的关键漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17105 2026-04-21 cs.CL 57%

How Tokenization Limits Phonological Knowledge Representation in Language Models and How to Improve Them

词法化如何限制语言模型中语音知识的表示以及如何改进

Disen Liao, Freda Shi

机构 * University of Waterloo(滑铁卢大学) Vector Institute(向量研究所)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 研究探讨词法化对文本模型语音知识表示的影响,提出STAD指标量化词法化偏差,并通过IPA基础微调方法提升语音相关任务性能。

Comments 18 pages, 7 figures, ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16979 2026-04-21 cs.CV cs.CL 57%

DOSE: Data Selection for Multi-Modal LLMs via Off-the-Shelf Models

DOSE: 通过现成模型进行多模态大语言模型的数据选择

Biao Wu, Yiwu Zhong, Meng Fang, Ling Chen

机构 * Australian Artificial Intelligence Institute(澳大利亚人工智能研究所) Peking University(北京大学) University of Liverpool(利物浦大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文提出DOSE方法,利用现成预训练模型筛选多模态数据,提升数据质量和对齐性,减少计算成本,增强数据多样性,使模型在标准VQA和数学基准测试中表现优异。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16896 2026-04-21 q-bio.QM cs.AI 57%

ProtoCycle: Reflective Tool-Augmented Planning for Text-Guided Protein Design

ProtoCycle:基于反思的工具增强规划用于文本引导的蛋白质设计

Yutang Ge, Guojiang Zhao, Sihang Li, Zheng Cheng, Zifeng Zhao, Hanchen Xia, Guolin Ke, Linfeng Zhang, Zhifeng Gao, Yuguang Wang

机构 * Shanghai Jiao Tong University, School of Mathematical Sciences(上海交通大学数学科学学院) DP Technology(DP技术) University of Science and Technology of China(中国科学技术大学) AI for Science Institute(AI for Science研究院)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出ProtoCycle框架,通过LLM驱动的反馈循环和轻量级工具环境,提升文本引导蛋白质设计的序列质量。

Comments 25 pages, 11 figures. Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16518 2026-04-21 cs.RO astro-ph.IM cs.AI 57%

On-Orbit Space AI: Federated, Multi-Agent, and Collaborative Algorithms for Satellite Constellations

轨道上的空间AI:用于卫星星座的联邦、多智能体和协作算法

Ziyang Wang

机构 * Ziyang Wang(王子阳)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本文探讨了卫星星座中联邦学习、多智能体算法和协作感知技术,以应对动态连接、严格SWaP-C限制等挑战,提出统一的协作架构和信任模型。

Comments Accepted by Algorithms, MDPI

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09536 2026-04-21 cs.AI 57%

Omni-R1: Towards the Unified Generative Paradigm for Multimodal Reasoning

Omni-R1:迈向多模态推理的统一生成范式

Dongjie Cheng, Yongqi Li, Zhixin Ma, Hongru Cai, Yupeng Hu, Wenjie Wang, Liqiang Nie, Wenjie Li

机构 * The Hong Kong Polytechnic University(香港理工大学) Singapore Management University(新加坡国立大学) Shandong University(山东大学) University of Science and Technology of China(中国科学技术大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出Omni-R1,通过生成中间图像统一多模态推理技能,解决单一任务特定推理模式限制的问题,并引入Omni-R1-Zero无需多模态标注实现文本仅推理数据的逐步可视化。

Comments Accepted by ACL2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04852 2026-04-21 cs.SE cs.AI cs.PL 57%

Raw Pointer Rewriting with LLMs for Translating C to Safer Rust

使用LLM的原始指针重写用于将C翻译为更安全的Rust

Yifei Gao, Chengpeng Wang, Pengxiang Huang, Xuwei Liu, Mingwei Zheng, Xiangyu Zhang

机构 * Purdue University(普渡大学) University of Rochester(罗切斯特大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本文提出PR2技术,通过决策树提示引导指针提升,消除C到Rust翻译中的原始指针,提升代码安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05719 2026-04-20 cs.LG 57%

Unsupervised domain adaptation for radioisotope identification in gamma spectroscopy

无监督领域适应在伽马能谱学中用于放射性同位素识别

Peter Lalor, Ayush Panigrahy, Alex Hagen

机构 * Pacific Northwest National Laboratory(太平洋西北国家实验室) University of Washington(华盛顿大学)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本文提出利用无监督领域适应技术提升合成数据训练的模型在真实环境中的泛化能力,通过最大均值差异最小化等方法提高测试准确率。

Comments 38 pages, 5 figures, and 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10198 2026-04-20 cs.CL 57%

HumanLLM: Benchmarking and Improving LLM Anthropomorphism via Human Cognitive Patterns

HumanLLM:通过人类认知模式基准测试和改进LLM拟人化

Xintao Wang, Jian Yang, Weiyuan Li, Rui Xie, Jen-tse Huang, Jun Gao, Shuai Huang, Yueping Kang, Yuanli Gou, Hongwei Feng, Yanghua Xiao

机构 * Fudan University(复旦大学) Hello Group(Hello集团) Johns Hopkins University(约翰霍普金斯大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 HumanLLM通过构建244种心理模式和11359种场景,评估LLM拟人化的有效性,发现认知建模比单纯模拟行为更重要,其8B模型在参数更少的情况下优于Qwen3-32B。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏