arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-09-01 至 2026-09-01 共收录 222 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 67 篇

2608.31105 2026-09-01 cs.AI cs.CL 新提交 62%

BLOOM-WILT: Logit Tilting for Behaviour Elicitation in Automated LLM Auditing

BLOOM-WILT:用于自动化大语言模型审计中行为 elicitation 的 Logit Tilting

Adrians Skapars, Edoardo Manino

机构 * University of Manchester(曼彻斯特大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 BLOOM-WILT是一种自动化大语言模型审计流程,通过自适应重新加权解码提升采样效率,在4个模型8种行为的评估中多数优于基线,还推翻了此前的模型安全排名。

Comments 10 pages, 5 figures, 3 tables. Code: https://github.com/AdrSkapars/bloom-wilt

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30683 2026-09-01 cs.CL cs.CY 新提交 62%

WildSEEK: Evaluating Language Models for Information-Seeking

WildSEEK:评估语言模型的信息获取能力

Tanise Ceron, Joachim Baumann, Elisa Bassignana, Berat Cabuk, Dirk Hovy, Debora Nozza

机构 * Bocconi University(博科尼大学) Stanford University(斯坦福大学) IT University of Copenhagen(哥本哈根信息技术大学) Pioneer Center for AI(先锋人工智能中心)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.CY

AI总结 针对现有LLM信息获取评估的不足,引入WildSEEK数据集与评估框架,发现超三分之一查询为高风险分析性查询,LLM在多方面存在缺陷,为相关研究提供实证基础。

Comments 9 pages, accepted at EMNLP Main 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29582 2026-09-01 cs.CL cs.AI 新提交 62%

SUP-MIMIC: A Multi-Task Clinical Diagnosis Benchmark for Evaluating LLMs' Robustness to Contradictory Evidence

SUP-MIMIC:用于评估大型语言模型对矛盾证据鲁棒性的多任务临床诊断基准

Yi Yu, Bo Wang, Chong Feng, Ge Shi, Xia Liu, Ziyi Yang, Xuewen Shi

机构 * Beijing University of Technology(北京工业大学) Beijing Institute of Technology(北京理工大学) China-Japan Friendship Hospital(中日友好医院) Dongbei University of Finance and Economics(东北财经大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出多任务临床诊断基准SUP-MIMIC,评估发现当前先进LLMs在诊断分歧与聚合任务上性能大幅下降,存在漏诊风险,为提升医疗场景下LLMs安全性提供了方法与路线图。

Comments 18 pages, 13 figures, 3 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28875 2026-09-01 cs.CL cs.AI cs.SD 新提交 62%

No Detectable Change in Side-Level WER from Prompt-Level Context: A Preregistered Ablation on a Production Oral-History Corpus

提示词层面上下文未检测到侧边级词错误率(WER)变化:对生产级口述历史语料库的预注册消融实验

Theodore O. Cochran, Stephanie Dodson, Keith Nore

机构 * AI for Altruism(利他智能)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 该预注册实验在生产级口述历史转录工具上发现,提示词层面上下文未改变侧边级WER,仅短语有小幅改善,需结合序列对齐指标评估上下文机制。

Comments 31 pages, 1 figure. Preregistered on OSF (https://osf.io/ns49b, DOI 10.17605/OSF.IO/NS49B); release materials and dated provider-documentation snapshots in the study component (https://osf.io/9nsvr)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28642 2026-09-01 cs.AI cs.CE cs.DL cs.ET cs.LG 新提交 62%

From Extraction to Governed Memory: Multi-Agent Knowledge Graph Construction with Domain-Expert Review

从抽取到受管控的记忆:结合领域专家评审的多智能体知识图谱构建

Pranav Bykampadi, Neel Mokaria, Vishesh Narayan, Faizan Wajid, Ashok Agrawala

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文针对智能体知识图谱缺乏管控的问题,提出多智能体框架MAGG构建受管控知识图谱,在SciERC、MuSiQue等数据集上显著提升三元组抽取性能与问答效果。

Comments 23 pages total, 10 pages main text, 12 pages of appendix, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07524 2026-09-01 cs.CL cs.AI 版本更新 62%

ABLE: Representing and Mapping LLMs via Attribution-Based Large-model Embedding

ABLE:基于归因的大模型嵌入表示与映射

Zirui Wang, Yusen Hou, Shaofeng Liang, Bowen Tian, Yanlin Zhang, Wenshuo Chen, Yutao Yue

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Deep Interdisciplinary Intelligence Lab (DI2 Lab)(深度跨学科智能实验室(DI2 Lab))

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出ABLE框架,利用梯度特征归因和分词器无关的词级对齐构建模型嵌入,实现异构LLM的高效比较,在关系预测、模型路由和基准分数预测上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01456 2026-09-01 cs.LG cs.CL cs.GT 版本更新 62%

Truthful AI Advisors: A Pre-Specified Benchmark for Large Language Model Honesty Under Preference Misalignment

诚实的人工智能顾问:偏好错位下大语言模型诚实性的预设基准

Hamidreza Hasani Balyani, Seyed Pouyan Mousavi Davoudi, Alireza Amiri-Margavi, Amin Gholami Davodi, Arshia Gharagozlou

机构 * Amazon Lab126, HW Tech Org.(亚马逊实验室126,硬件技术组织) Computational Modeling and Simulation University of Pittsburgh(计算建模与仿真大学匹兹堡分校) Mathematics & Statistics Department University of Minnesota Duluth(数学与统计学系明尼苏达大学 Duluth 分校)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 通过Crawford-Sobel廉价谈话模型构建基准,评估大语言模型在偏好冲突时是否诚实,发现模型过度揭示信息,偏离策略最优。

Comments 24 pages, 6 figures. Code and data: https://github.com/iHamidHasani/cheap-talk-llm-benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22455 2026-09-01 cs.CV cs.AI cs.LG physics.optics 版本更新 62%

Making the Discrete Continuous: Synthetic RAW Augmentations for Fine-Grained Evaluation of Person Detection Performance in Low Light

使离散的成为连续的:合成RAW增强用于细粒度评估人检测性能在低光环境

Valeria Pais, Malena Mendilaharzu, Daniele Faccio, Luis Oala, Christoph Clausen, Bruno Sanguinetti

机构 * University of Glasgow(格拉斯哥大学) Dotphoton

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种合成RAW增强方法,用于在低光条件下更准确地评估人检测模型的性能,通过生成与相机传感器噪声模型匹配的低光样本,以改善基准测试的数据覆盖。

Comments Accepted non-archival paper at the CVPR 2026 AUTOPILOT Workshop (Autonomous Understanding Through Open-world Perception and Integrated Language Models for On-road Tasks)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07699 2026-09-01 cs.CL cs.AI 版本更新 62%

DRIP-R: A Benchmark for Decision-Making and Reasoning Under Real-World Policy Ambiguity in the Retail Domain

DRIP-R:零售领域决策与推理在现实政策模糊性下的基准测试

Hsuvas Borkakoty, Sebastian Pohl, Cheng Wang, Bei Chen, Yufang Hou

机构 * Interdisciplinary Transformation University Austria(跨学科转型大学奥地利) Amazon Berlin(亚马逊柏林)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 DRIP-R基准测试通过现实零售政策模糊性构建无唯一正确解决方案的场景,评估LLM在模糊政策下的决策与推理能力,揭示其固有的系统性挑战。

Comments Accepted to EMNLP Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02194 2026-09-01 cs.CL cs.AI 版本更新 62%

Where Does Robustness Live? Neuron-Guided Adaptation for Retrieval-Augmented Language Models

Neuro-RIT: 用于鲁棒检索增强语言模型的神经引导指令微调

Jae O Lee, Jaemin Kim, Sumyeong Ahn, Seo Yeon Park

机构 * Hanyang University(汉阳大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 Neuro-RIT通过神经层面的对齐提升检索增强语言模型的鲁棒性,通过神经属性挖掘分离相关与无关上下文的神经元,并采用两阶段指令微调策略增强噪声鲁棒性。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17173 2026-09-01 cs.CL cs.AI 版本更新 62%

Beyond Factual QA: Mentorship-Oriented Question Answering over Long-Form Multilingual Content

超越事实问答:面向长形式多语言内容的指导型问答

Parth Bhalerao, Ruiwen Guan, Diola Dsouza, Oana Ignat

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MentorQA,首个多语言长形式视频指导型问答数据集和评估框架,通过对比不同架构发现Multi-Agent在复杂和低资源语言中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25256 2026-09-01 cs.CY cs.AI 版本更新 62%

Operationalising AI Regulatory Sandboxes: Activities, Requirements, and Technical Assessment under the EU AI Act

AI监管沙箱的实操:欧盟AI法案下的活动、要求与技术评估

Alessio Buscemi, Thibault Simonetto, Daniele Pagani, German Castignani, Maxime Cordy, Jordi Cabot

机构 * Luxembourg Institute of Science and Technology (LIST)(卢森堡科学与技术研究院) University of Luxembourg(卢森堡大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.CY

AI总结 本文针对欧盟AI监管沙箱实操问题,划分29项活动并推导15项要求,提出含AI技术沙箱的框架,配套开源配置器,助力多方合规与可信AI治理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21054 2026-09-01 cs.AI cs.CL 版本更新 62%

Reasoning or Rambling? Exploring the Effect of Thinking on Agent Persuasion

推理还是漫谈?探究思考过程对智能体说服能力的影响

Haodong Zhao, Jidong Li, Zhaomin Wu, Tianjie Ju, Zhuosheng Zhang, Bingsheng He, Gongshen Liu

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) National University of Singapore(新加坡国立大学) Inner Mongolia Research Institute, Shanghai Jiao Tong University(上海交通大学内蒙古研究院)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文对比通用LLM与LRM,发现推理对智能体说服能力存在二元性影响,还揭示其依赖表面线索的漏洞,提出提示级对抗性论点检测方法以提升鲁棒性。

Comments Accepted as EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30754 2026-09-01 cs.CL 新提交 57%

CLIN: an Objective Framework for Evaluating Creativity in Short Persian Literary Text

CLIN:一种用于评估波斯语短篇文学文本创造性的客观框架

Mohammad Reza Modarres, Armin Tourajmehr, Yadollah Yaghoobzadeh, Mohammad Taher Pilehvar

机构 * Tehran Institute for Advanced Studies, Khatam University(哈塔姆大学德黑兰高等研究院) Cardiff University(卡迪夫大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 针对LLM评估波斯语短篇文学文本创造性的维度依赖问题,提出CLIN框架,用三类代理指标评估TTCT衍生的创造性维度,实现了与零样本LLM相当或更优的人类对齐度且评估成本更低。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30466 2026-09-01 cs.AI cs.IR 新提交 57%

CHASE: How Content Ecosystems Are Reshaped When Ranking Is the Only Target

CHASE:当排序成为唯一目标时,内容生态系统如何被重塑

Qianwen Gao, Zichang Su, Yiwen Hou, Arlen Kumar, Leanid Palkhouski

机构 * University of California, Berkeley(加州大学伯克利分校) Zhejiang University(浙江大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本研究提出CHASE模拟框架,发现针对固定LLM排序信号的重复优化会使内容质量与排序一致性下降,且生态系统动态具领域依赖性,揭示了GEO的群体层面效应。

Comments Accepted to the Conference on Language Modeling (COLM) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30437 2026-09-01 cs.CL 新提交 57%

Graph Evidence Is Not Enough: Diagnosing Native Decoder Use in Graph-Augmented LLMs

仅靠图证据是不够的:诊断图增强大型语言模型中的原生解码器使用情况

Xiaoyu Guo, Pengcheng Chen, Jiong Yu, Yi Lu, Yaohua Wang, Ziyang Li

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 该研究针对图增强LLM检验图证据可被原生解码器使用的假设,通过HopQA诊断任务发现现有模型无法有效利用图证据,提出S²GE方法在多个数据集上大幅提升性能,并揭示了相关 regimes。

Comments 18 pages, 4 figures, ccepted at EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30373 2026-09-01 cs.CL 新提交 57%

Beyond Consensus: Downward Bias and Role Asymmetry in Multi-Agent LLM Judges for Subjective Evaluation

超越共识:用于主观评估的多智能体大语言模型评判器中的向下偏差与角色不对称

Minsoo Song, Chanwoo Kim, Sugyeong Eo, Chanjun Park

机构 * Soongsil University(崇实大学) Yonsei University(延世大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 该研究发现多智能体辩论(MAD)用于主观评估时存在角色不对称导致的向下偏差,会降低与人类判断的对齐度,消除角色不对称可恢复性能,揭示了共识式MAD协议的结构性局限。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30372 2026-09-01 cs.CL 新提交 57%

Auditing MCQA Benchmarks through Probability Landscapes

基于概率景观的MCQA基准测试审计

Minsoo Song, Chanjun Park

机构 * Soongsil University(崇实大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本研究提出两部分概率框架,结合P_top1、H_norm、MPD及噪声注入方法,实现MCQA基准测试的基准级与条目级审计,其结果与专家注释一致,可作为轻量级审计工具。

Comments Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30369 2026-09-01 cs.AI cs.HC 新提交 57%

Augmenting Human Performance with an XR Agent Learning from Online Behavior and BCI Evidence

利用从在线行为和BCI证据学习的XR智能体增强人类表现

Ziheng Li, Xichen He, Haoyan Chen, Charlie Zou, Sheng Bai, Benjamin Yang, Mengyuan Wu, Jake Ledner, Yi-Jie Cheng, Akito Yamauchi, Dishita G Turakhia, Steven Feiner, Paul Sajda

机构 * Columbia University(哥伦比亚大学) Emory University(埃默里大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 研究人员提出OLIVE框架,通过融合EEG与XR游戏行为信号,适配基础模型生成实时辅助智能体,在目标切换时收敛更快,可提升用户目标检测能力且不依赖个人技能。

Comments To appear in ACM UIST 2026. 30 pages, 23 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30188 2026-09-01 cs.CL 新提交 57%

GPAgentBench-2K: Benchmarking Large Language Model Agents in Complex Clinical Action Space

GPAgentBench-2K:复杂临床动作空间中的大语言模型智能体基准测试

Boqi Chen, Xudong Liu, Yunke Ao, Heejin Do, Jianing Qiu

机构 * ETH Zurich(苏黎世联邦理工学院) MBZUAI(穆罕默德·本·扎耶德人工智能大学) University of Toronto(多伦多大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 该研究推出首个面向初级保健临床决策的CMDP LLM智能体基准GPAgentBench-2K,评估16种LLM时发现其存在临床质量-安全差距,且C-GRPO建模约束仍未达临床安全要求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29662 2026-09-01 cs.CL 新提交 57%

ACTD: Anchor-Based Cross-Tokenizer Distillation with Residual Regularization

ACTD:带残差正则化的基于锚点的跨分词器蒸馏

Huiyi Zhang, Zijian Li, Xiaocheng Feng, Weitao Ma, Xiaoliang Yang, Yichong Huang, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Peng Cheng Laboratory(鹏城实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 针对跨分词器蒸馏的词汇与序列不对齐及对齐噪声问题,提出带残差正则化的ACTD方法,在五个推理基准上用三种教师模型评估取得SOTA,多教师扩展版性能优于基线。

Comments Accepted by EMNLP 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29490 2026-09-01 cs.MA cs.AI cs.RO 新提交 57%

Generalizable Multi-Agent Planning from Signal Temporal Logic Specifications via Diffusion

基于扩散模型的、可从信号时序逻辑规范实现通用多智能体规划

Joe Eappen, Zikang Xiong, Shreyash S. Iyengar, Suresh Jagannathan

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 该研究针对多智能体STL规划的通用能力与可扩展性的权衡问题,提出STL引导的扩散方法,实现了可泛化、可扩展且规划多样的多智能体规划,减少了安全违规。

Comments Accepted for publication in IEEE Robotics and Automation Letters (RA-L), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29313 2026-09-01 cs.CV cs.AI 新提交 57%

Hyper3-CLIP: Hierarchy-Conditioned Hyperbolic Vision-Language Training

Hyper3-CLIP:层级条件双曲视觉-语言训练

Matin Mahmood, Antonio Rueda-Toicen, Mohamed ElBassat, Seifeldin Elkerdany, Weixing Wang, Gerard de Melo

机构 * hyper 3 labs(超3实验室) Hasso Plattner Institute(哈索·普拉特纳研究所) University of Potsdam(波茨坦大学) Faculty of Computers and Data Science, Alexandria University(亚历山大大学计算机与数据科学学院) Faculty of Computer Science and Engineering, Alamein International University(阿拉曼国际大学计算机科学与工程学院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 Hyper3-CLIP结合层级条件与双曲几何,通过文本构建多粒度查询层级训练视觉-语言模型,提升图像-文本检索与多标签分类性能,在层级指标上保持竞争力。

Comments 16 pages, 2 figures, ECCV 2026 Beyond Euclidean Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29004 2026-09-01 cs.LG cs.CV cs.IR 新提交 57%

Context-Aware Interpretable Representations for Retrieval and Graph Convolutional Network Classification

面向检索与图卷积网络分类的上下文感知可解释表示

Thiago César Castilho Almeida, Gustavo Rosseto Letício, Vinicius Atsushi Sato Kawai, Daniel Carlos Guimarães Pedronette

机构 * State University of São Paulo (UNESP)(圣保罗州立大学(UNESP))

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本文针对视觉表示的几何与可解释性鸿沟,提出融合流形学习与可解释图嵌入的无监督框架,所获上下文感知表示兼具可解释性、降维能力,且在图像检索与GCN半监督分类任务中表现优异。

Comments Published in the Proceedings of the 2026 International Conference on Multimedia Retrieval (ICMR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28820 2026-09-01 cs.AI cs.CV 新提交 57%

Explainable Artificial Intelligence (XAI) in Computational Pathology: Definitions, Taxonomy, and Recommendations

计算病理学中的可解释人工智能(XAI):定义、分类与建议

Shubham Innani, Suhang You, Adam Shephard, Bhakti Baheti, Francesco Ciompi, Joe Yeong, Nasir Rajpoot, Michael Feldman, Solene Florence Kammerer-Jacquet, Dimitrios Makris, Geert Litjens, Anne L. Martel, Jana Lipkova, April Khademi, Spyridon Bakas, for the MICCAI SIG-CompPath

机构 * Indiana University School of Medicine(印第安纳大学医学院) Indiana University Melvin and Bren Simon Comprehensive Cancer Center(印第安纳大学梅尔文与布伦·西蒙综合癌症中心) University of Warwick(华威大学) Emory University(埃默里大学) Radboud University Medical Center(拉德堡德大学医学中心) Singapore General Hospital(新加坡中央医院)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本综述针对计算病理学(CompPath)中可解释人工智能(XAI)文献碎片化问题,建立病理学中心词汇、分类及任务驱动框架,明确XAI与临床部署的差距并提出推进建议。

Comments On behalf of MICCAI SIG-CompPath. More information: https://miccai.org/index.php/special-interest-groups/sig-comppath/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08311 2026-09-01 cs.SE cs.AI 版本更新 57%

Ouroboros: A Self-Developing Frontier Coding Agent with Reviewed Core Evolution

Ouroboros:一种具有经审核的核心演化机制的自发展前沿编码智能体

Anton Razzhigaev, Andrei Gritsaev, Andrei Kaznacheev, Nikita Dragunov, Roman Yampolskiy, Andrei Kuznetsov

机构 * Lomonosov Moscow State University(莫斯科罗蒙诺索夫国立大学) Skolkovo Institute of Science and Technology(斯科尔科沃科学技术研究所) Artificial Intelligence Research Institute(人工智能研究所)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本研究提出具有经审核核心演化机制的编码智能体Ouroboros,其在三个基准测试中均创最优结果,Hope部署为长期活体演化实验,同时需应对自发展带来的操作安全问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25292 2026-09-01 cs.AI 版本更新 57%

Instruction-Tuned Language Models Cannot Sample from Distributions They Can Describe

指令微调语言模型无法从它们能描述的分布中进行采样

Chaemin Jang, Dongman Lee, Jihee Kim

机构 * School of Computing, KAIST(韩国科学技术院计算学院) School of Business and Technology Management, KAIST(韩国科学技术院商业与技术管理学院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 研究发现指令微调语言模型无法从其能描述的分布中采样,存在“知道/做”分裂,通过让模型描述分布可减半误差,还提出PPA在无额外成本下降低21%误差。

Comments EMNLP Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09156 2026-09-01 cs.LG 版本更新 57%

Activation Steering Transfer to Agents: One Gain Ratio Does Not Identify Potency and Efficacy

存在但重新缩放:加法激活引导的聊天到智能体的转移

Lucas Pinto

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 研究加法激活引导从聊天到智能体的转移,通过匹配信息设计进行研究,发现转移真实但重新缩放,确定了加法特定机制,定位了重新缩放位置,指出智能体部署对引导拒绝绕过影响不可预测。

Comments v3 qualifies the two-sided sign claim to the primary dose grid: the sole positive cell loses CI-exclusion under the registered alpha*-trim. Also discloses the comparison set behind the overlapping-gain pair. 42 pages, 7 figures, 9 tables. Includes an errata section correcting v1's public record. Code: github.com/digdoug/steering-dose-reparametrization

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29689 2026-09-01 cs.CL 版本更新 57%

Can MLLMs Critique Like Humans? Evaluating Open-Ended Aesthetic Reasoning in Multimodal Large Language Models

MLLM 能否像人类一样进行批评?评估多模态大语言模型中的开放式审美推理

Sajjad Ghiasvand, Maryam Amirizaniani, Haniyeh Ehsani Oskouie, Mahnoosh Alizadeh, Ramtin Pedarsani

机构 * UCSB(加州大学圣塔芭芭拉分校) University of Washington(华盛顿大学) UCLA(加州大学洛杉矶分校)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文评估多模态大语言模型在开放式审美批评中的表现,发现基于参考的相似度指标存在误导,模型在选择性、特异性和多样性方面与人类批评存在系统性差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01600 2026-09-01 cs.CV cs.CL cs.RO 版本更新 57%

RoboTrustBench: Benchmarking the Trustworthiness of Video World Models for Robotic Manipulation

RoboTrustBench:机器人操作视频世界模型的可信度基准测试

Huiqiong Li, Jiayu Wang, Zhiting Mei, Anirudha Majumdar, Jingjing Chen, Bin Zhu

机构 * Singapore Management University(新加坡国立管理学院) Fudan University(复旦大学) Princeton University(普林斯顿大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 针对视频世界模型在机器人操作中的可信度问题,提出RoboTrustBench基准,包含正常、约束敏感、反事实和对抗四种场景,通过专家验证的指令-图像对和六维评估协议,发现当前模型在约束推理、反事实基础、物理交互和不安全指令抑制方面存在不足。

Comments EMNLP 2026 Findings, Project: https://huiqiongli.github.io/RoboTrustBench/

详情

展开后加载摘要…

URL PDF HTML 收藏