Measurement Validity in LLM Cultural Alignment
大语言模型文化对齐中的测量有效性
专题命中 其他安全 :alignment(title);分类 cs.AI
AI总结 本研究针对多个LLM区分调查回复、采样噪声与问题框架,发现多数模型的表观文化位置无法与噪声区分,提示需先验证测量可靠性才能将LLM调查回复用于文化归因。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
大语言模型文化对齐中的测量有效性
专题命中 其他安全 :alignment(title);分类 cs.AI
AI总结 本研究针对多个LLM区分调查回复、采样噪声与问题框架,发现多数模型的表观文化位置无法与噪声区分,提示需先验证测量可靠性才能将LLM调查回复用于文化归因。
GRASP:面向可扩展预训练数据归因的几何感知残差对齐
机构 * Wizard Quant ; University of Science and Technology of China(中国科学技术大学)
专题命中 其他安全 :alignment(title);分类 cs.LG
AI总结 提出GRASP方法,通过二次几何惩罚建模子集交互,结合低维特征草图与有限置信度选择协议,实现可扩展的预训练数据归因,显著提升反事实子集保真度并降低计算成本。
TRIPPULSE:基于评论推理的多智能体旅行规划
机构 * Microsoft(微软公司) ; IIT Bhubaneswar(布巴内斯瓦尔印度理工学院)
专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.CL
AI总结 TRIPPULSE是基于评论推理的多智能体旅行规划框架,分解行程生成任务为多智能体并结合10万+评论与RGPA指标,可兼顾约束满足与个性化体验。
Comments 31 pages, EMNLP 2026
身份与观点如何塑造大语言模型(LLM)中的政治奉承行为
机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) ; Academia Sinica(中央研究院) ; Research Center for Information Technology Innovation, Academia Sinica(中央研究院资讯科技创新研究中心)
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 该研究提出框架区分LLM政治奉承的观点与身份触发因素,经450个政治困境评估13个指令调优LLM,发现二者易感性解离、信号次可加,表明LLM政治立场具交互可引导脆弱性。
Comments Accepted to EMNLP 2026 (Main Conference)
视觉-语言模型在模糊输入下抑制女性表征
机构 * School of Engineering and Applied Sciences(工程与应用科学系) ; Department of Psychology(心理学系)
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 本研究通过引入零样本度量LALS,发现视觉-语言模型在模糊输入下内部编码与输出存在系统性解耦,女性信号在生成前被抑制,揭示了模型对性别偏见的内部处理机制。
Comments Accepted at EMNLP 2026
从自回归到掩码扩散语言模型的后训练中的机制转变
机构 * Graduate School of Data Science, Seoul National University(首尔国立大学数据科学研究生院) ; Department of Biosystems & Biomaterials Science and Engineering, Seoul National University(首尔国立大学生物系统与生物材料科学与工程系)
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 通过比较电路分析,发现后训练得到的掩码扩散模型在结构上根据任务保留或重组自回归电路,在语义上从局部专业化转向分布式整合,表明扩散后训练是内部计算的深度重组。
Comments This Paper has been accepted for publication at EMNLP 2026
TopoCompress:基于图连接语义轨迹的长上下文压缩
机构 * Iowa State University(爱荷华州立大学)
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.LG
AI总结 针对现有长上下文压缩方法的缺陷,本文提出无需训练、与模型无关的TopoCompress框架,通过语义片段打分与图传播实现压缩,在5项任务中表现优于基线,压缩预算仅为最强基线的1/4、时间比最快基线缩短1.41倍。
Comments 13 pages
BAITBENCH:通过植入ML任务中的可选捷径测量智能体的奖励黑客行为
机构 * National University of Singapore(新加坡国立大学) ; MIT(麻省理工学院) ; Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) ; University of Toronto(多伦多大学) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; Arb Research(Arb研究机构)
专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG
AI总结 BAITBENCH是含三个合成表格型ML任务的基准,用于测量智能体利用可选捷径获得虚高分的奖励黑客行为,实验显示57.1%的运行存在该行为,发布相关资源作为缓解措施评估测试平台。
SemPOI-RL:对齐大语言模型语义推理以实现可解释的异地兴趣点序列生成
机构 * State Key Laboratory of Complex & Critical Software Environment(复杂与关键软件环境国家重点实验室) ; Beihang University(北京航空航天大学)
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 SemPOI-RL框架通过微调LLM、引入SPAM模块并结合推荐导向强化学习,实现LLM语义推理与结构化序列生成的对齐,在两个真实数据集上优于传统推荐器和LLM基线,可生成可解释的异地POI序列。
Comments 19 pages in total, including 9 pages of main text and 4 figures
面向自然语言形式化的分层一致性蒸馏
机构 * North Carolina State University(北卡罗来纳州立大学) ; Amazon Web Services(亚马逊网络服务)
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 该研究针对自然语言到逻辑公式翻译准确率提升难题,提出分层一致性蒸馏方法,经实验在Pass@K与等价逻辑相似度指标上获显著稳定提升,推进了逻辑翻译技术发展。
LaMoC:面向大语言模型的损失感知模块化压缩方法
机构 * LG Electronics USA(美国LG电子公司)
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 本文提出损失感知模块化压缩方法LaMoC,通过融合激活与经验费舍尔统计优化LLM压缩,在4-8B模型上较最优方法实现困惑度降2.5%、任务精度升1%。
Comments EMNLP 2026 Findings
模拟还是估计?基础语言模型与后训练语言模型在观点模拟中的差异化优势
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 该研究针对大型语言模型用于观点模拟的矛盾结果,区分了模拟与估计任务,发现基础模型更适合模拟、后训练模型更适合估计,为相关模型选择提供了依据。
Comments EMNLP Findings 2026
概念低语而语法高呼:频谱反集中与Transformer表示的双几何
机构 * Pratyush Acharya ; Nuraj Rimal ; Habish Dhakal
专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 研究通过跨语言概念传输测试,发现因果内积在频谱正则化下无显著差异,揭示了残差流中反集中现象及静态解嵌行对比的高方差集中特性,支持语法优先编码于高方差子空间。
Comments Accepted to EMNLP(Main Conference), Camera Ready Version
对视频内容信息检索中过度依赖AI的研究
机构 * IT University of Copenhagen(丹麦技术大学) ; Bocconi University(博科尼大学) ; Politecnico di Milano(米兰理工学院) ; Pioneer Centre for AI(先锋人工智能中心)
专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.CY
AI总结 研究探讨生成式AI对视频信息检索准确性、效率及信心的影响,发现AI辅助提升准确率但易导致过度依赖,进而引发安全风险。
Comments Accepted at EMNLP 2026 (Main)
非完美标注下牛科动物牙列的分割:卷积模型与注意力模型的对比研究
机构 * Episcopal High School of Baton Rouge(巴吞鲁日圣公会高中)
专题命中 其他安全 :alignment(abstract);分类 cs.LG
AI总结 本文针对B.O.V.I.D.数据集的非完美标注,对比卷积模型与注意力模型的牙列分割性能,发现预处理技术对定量指标影响有限但定性影响显著。
Comments 13 pages, 2 Tables, 13 Figures
RailGen:通过智能体引导的小规模异物生成改进铁路入侵检测
机构 * School of Information Science and Technology, Beijing University of Technology(北京工业大学信息科学与技术学院) ; College of Computer Science, Beijing University of Technology(北京工业大学计算机学院)
专题命中 其他安全 :safety(abstract);分类 cs.AI
AI总结 该研究针对铁路异物检测的长尾小样本问题,提出RailGen智能体生成高质量小异物样本,结合FocalDEIM框架优化检测,显著提升了检测性能。
利用大语言模型将NICE指南自动转换为可执行计算模型
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 本研究提出基于大语言模型的端到端方法,将NICE临床指南转换为可执行模型,在胰腺癌案例中F1达82.5%,证明了自动化生成可计算临床指南的可行性。
Comments 18 pages. Published in Learning Health Systems (2026)
Journal ref Learning Health Systems, 2026, 10(4):e70114. PubMed lists the article in volume 10, issue 4
面向开放词汇语义分割中视觉-语言模型的持续测试时适应
机构 * Norwegian University of Life Sciences (NMBU)(挪威生命科学大学) ; Tulane University(杜兰大学) ; University of Texas at Dallas(德克萨斯大学达拉斯分校)
专题命中 其他安全 :alignment(abstract);分类 cs.LG
AI总结 针对开放词汇语义分割中视觉-语言模型在持续测试时分布偏移下的对齐脆弱问题,提出DAF框架,在多数据集上实现mIoU显著提升且鲁棒性良好。
Comments under review. code available at https://github.com/chandlerbing65nm/DAF.git
并非相同的保护者:大语言模型(LLM)中依赖部署方式的保护性干预
专题命中 其他安全 :safety(abstract);分类 cs.AI
AI总结 该研究探究大语言模型(LLM)的保护性干预是否随部署方式变化,发现语音界面下模型的医疗指令占比低于文本与API条件,且该差异无法仅由响应长度解释。
用于跨语言事实一致性的隐空间干预:不降低准确率的一致性提升
机构 * School of Computation, Information and Technology, TU Munich(慕尼黑工业大学计算、信息与技术学院) ; Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) ; Department of Computer Science, University of Copenhagen(哥本哈根大学计算机科学系)
专题命中 其他安全 :alignment(abstract);分类 cs.CL
AI总结 本研究提出通过在平行多语言表示上训练特定层自编码器并应用推理时修正的跨语言隐空间干预方法,在不降低事实准确率的前提下提升了LLMs跨语言事实一致性。
Comments Accepted at EMNLP 2026
Fund2Persona:基于基金披露数据构建与精炼金融顾问角色的框架
机构 * UNIST(蔚山科学技术院) ; LinqAlpha ; University of Texas at Austin(德克萨斯大学奥斯汀分校) ; University of Florida(佛罗里达大学) ; Blackstone(黑石集团) ; Hanwha Life(韩华生命)
专题命中 其他安全 :alignment(abstract);分类 cs.CL
AI总结 提出Fund2Persona框架,利用基金披露、持仓变动、市场背景和管理人评论构建金融顾问角色,并通过智能体循环精炼,在持仓重建和管理人评论对齐任务上优于通用基线,生成更具体有用的建议。
Comments 18 pages, 4 figures, 18 tables. EMNLP 2026 Industry Track
结构锚点剪枝:用于视觉文档检索的无训练多向量压缩
机构 * Aalto University(阿alto大学)
专题命中 其他安全 :alignment(abstract);分类 cs.CL
AI总结 本文提出结构锚点剪枝(SAP),一种无需训练的多向量压缩方法,通过保留评分、指导窗口选择和视觉入度中心性评分三个组件,在不进行模型参数调整的情况下,实现了超过90%的视觉token剪枝同时保持NDCG@5超过90%的性能。
Comments Accepted to EMNLP 2026 (Main Track)
Social-JEPA:涌现的几何同构
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 Social-JEPA通过让不同视角的独立代理学习环境模型,发现其潜在空间近似线性同构,从而实现跨代理的透明转换与高效迁移学习。
Comments Due to an unresolved dispute among the authors regarding the correctness of the experimental results and the validity of the conclusions, the team has decided to withdraw this paper until these issues can be fully resolved
识别与缓解角色扮演代理中的瓶颈:解耦角色档案轴线的系统研究
机构 * Chung-Ang University(Chung-Ang 大学)
专题命中 其他安全 :alignment(abstract);分类 cs.CL
AI总结 本研究通过解耦角色档案的熟悉度、结构和性格三个轴线,系统诊断LLM角色扮演代理的性能瓶颈,并提出无训练的场感知对比解码(FACD)策略来缓解性格带来的性能下降。
Comments Accepted EMNLP 2026 Main
通过对数似然差异设计领域混合以对齐语言模型与目标模型
机构 * Kyoto University(京都大学) ; RIKEN(理化学研究所)
专题命中 其他安全 :alignment(abstract);分类 cs.CL
AI总结 本文通过设计训练数据的领域混合,利用对数似然空间对齐模型方向,减少KL散度并提升下游任务性能。
Comments EMNLP 2026 Findings
流行但错误:通过知识流行度理解和缓解大语言模型(LLM)的过度自信
机构 * CAS Key Lab of Network Data Science and Technology, ICT, CAS(中国科学院信息科技研究院网络数据科学与技术重点实验室) ; State Key Laboratory of AI Safety(人工智能安全国家重点实验室) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 其他安全 :alignment(abstract);分类 cs.CL
AI总结 该研究针对LLM过度自信问题,从知识流行度角度分析发现流行但错误的答案会加剧过度自信,通过融入知识流行度信号可显著缓解过度自信并提升置信度估计效果。
Comments EMNLP2026 Main
角度语义:余弦相似度何时有效及失效
机构 * Baruch College, City University of New York(纽约城市大学巴克莱学院)
专题命中 其他安全 :alignment(abstract);分类 cs.LG
AI总结 研究探讨余弦相似度在信息处理等领域的应用,围绕其有用性取决于学习表示等因素展开,推导几何恒等式,区分失效机制,回顾证据并描述替代方法,得出其正尺度不变性有条件合理的结论。
基于自适应动态节奏语言模型(ADRM)的弱监督塔布拉鼓击奏转录
专题命中 其他安全 :alignment(abstract)
AI总结 本研究针对弱监督塔布拉鼓击奏转录任务,提出结合CTC声学模型与ADRM的框架,发布相关数据集,实验证实ADRM可显著降低击奏错误率。
OPUS:一个简单而有效的开放词汇检测统一框架
机构 * Megvii Technology Inc.(旷视科技) ; X-Humanoid
专题命中 其他安全 :alignment(abstract)
AI总结 本文提出 OPUS 框架,以简单设计结合语义视觉表示与 ICA 训练策略,在 COCO 等数据集上实现最优 Visual-I 性能,平衡多类型提示精度,将混合提示转为互补。
DICS:探索数据内在一致性用于视觉指令选择
机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Alibaba Token Hub, Alibaba Group(阿里巴巴集团)
专题命中 其他安全 :alignment(abstract)
AI总结 提出基于数据内在一致性(DIC)的自适应视觉指令选择方法DICS,仅用25%数据就超越现有最优方法,还构建600万样本语料库,用不足25%训练数据达到InternVL3-8B-Instruct的94.52%性能
Comments Accepted by EMNLP2026