arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 8034 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 8034 篇

2607.28674 2026-08-03 cs.AI cs.CL cs.LG 新提交 67%

How Hard Does It Think? Analyzing Step-Aware Reasoning Energy in LLM Chain-of-Thought Trajectories

它认为有多难?分析大型语言模型思维链轨迹中感知步骤的推理能量

Hui Wei, Junda Wu, Sheldon Yu, Sizhe Zhou, Yizhu Jiao, Ming Zhong, Bowen Jin, Tong Yu, Shijia Pan, Jiawei Han, Julian McAuley

机构 * UC Merced(加州大学默塞德分校) UC San Diego(加州大学圣迭戈分校) UIUC(伊利诺伊大学厄巴纳-香槟分校) Adobe Research(奥多比研究院)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究提出SARE框架量化LLM思维链各步骤的推理能量,发现推理能量不均匀、错误轨迹关键节点能量更低,SARE特征性能优于或匹配输出置信度基线,揭示内部几何动态含预测信息。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27882 2026-07-31 cs.CV 新提交 67%

DECODE: Tackling Representation and Decision Degradation in Continual AI-Generated Image Detection

DECODE:解决持续AI生成图像检测中的表征与决策退化问题

Zihao Cai, Xinghan Li, Ruiyan Yang, Xue Song, Haijun Shan, Jingjing Chen

专题命中 其他安全 :alignment(abstract,abstract_cn)

AI总结 针对持续AI生成图像检测中的双重退化问题,提出解耦式框架DECODE,结合SDR与CDA技术,在19个领域上实现高准确率且遗忘率极低,还能泛化至未见过的生成器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26910 2026-07-30 cs.CV 新提交 67%

CinemaTraj: Composing Atomic Camera Trajectories for 3D Scenes with LLM Agents

CinemaTraj:用LLM智能体为3D场景合成原子相机轨迹

Qianru Li, Xuyang Chen, Erkin Türköz, Lu Liu, Xuqin Wang, Liqiu Meng, Tao Wu, Yanfeng Zhang

机构 * Technical University of Munich(慕尼黑工业大学) Huawei Dresden Research Center(华为德累斯顿研究中心)

专题命中 其他安全 :alignment(abstract);safety(abstract)

AI总结 CinemaTraj是将LLM智能体与3D场景图结合的框架,可从自然语言生成带旁白的3D场景相机轨迹,在真实环境中优于现有方法。

Comments 17 pages, including 8-page main paper, references, and supplementary material; project page: https://cinematraj.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19288 2026-07-22 cs.CV cs.RO 新提交 67%

No Training, Better Flights: Test-Time Scaled VLMs for UAV Navigation

无需训练,飞行更佳:用于无人机导航的测试时缩放视觉语言模型

Feinan Cheng, Dongliang Xu, Wenli Nong, Zhiheng Zhang, Ang Liu, Tianyu Wang, Yue Yao

专题命中 其他安全 :alignment(abstract);safety(abstract)

AI总结 研究如何将测试时缩放应用于无人机视觉语言导航,通过迭代细化和多标准评分函数,无需额外训练,使冻结模型自我校正,生成更准确可靠飞行计划,实现最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14126 2026-07-17 cs.AI cs.CL cs.LG 新提交 67%

Interpretable Language Model for Closed-Loop Type 1 Diabetes Control

用于闭环1型糖尿病控制的可解释语言模型

Maya Sarkar

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对1型糖尿病控制中人工胰腺系统“黑箱”问题,提出LLM-T1D方法,结合强化学习与大语言模型,训练专家RL系统并提炼知识到模型,开发出可解释且性能优的胰岛素泵控制器,在模拟器测试中血糖控制良好且能防幻觉。

Comments Accepted at the 2026 IEEE 22nd International Conference on Automation Science and Engineering conference (IEEE CASE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10114 2026-07-14 cs.CL cs.AI cs.LG 新提交 67%

Cost of Reasoning in non-English Languages: A Case Study on Japanese

非英语语言的推理成本:以日语为例

Yuu Jinnai

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究训练日语推理模型的可行性,开发Qwen - 3 - Swallow - 8B的日语推理变体并用GRPO训练,在多基准测试中发现推理语言控制可行,但性能与英语推理基线相当,在日本文化基准上表现不如基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08968 2026-07-13 eess.SP 新提交 67%

Every Sample Counts: Supervised Fine-Tuning of Language Models with Pointwise Constraints

每个样本都很重要:基于逐点约束的语言模型监督微调

Ignacio Hounie, Ignacio Boero, Alejandro Ribeiro

专题命中 其他安全 :alignment(abstract);safety(abstract)

AI总结 研究语言模型微调中逐点约束问题,提出新对齐框架,通过逐样本约束最小化平均损失,引入学习松弛方法并开发增广拉格朗日方法,在多任务和约束下实例化,减少约束违反且保留模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15267 2026-07-07 cs.GT cs.AI cs.CL cs.CY cs.MA 版本更新 67%

CoopEval: Benchmarking Cooperation-Sustaining Mechanisms and LLM Agents in Social Dilemmas

CoopEval:社会困境中合作维持机制与LLM代理的基准测试

Emanuel Tewolde, Xiao Zhang, David Guzman Piedrahita, Vincent Conitzer, Zhijing Jin

机构 * Carnegie Mellon University Foundations of Cooperative AI Lab (FOCAL) Jinesis Lab, University of Toronto \& Vector Institute ETH Z\" u rich Max Planck Institute for Intelligent Systems, T\" u bingen, Germany

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 研究探讨了社会困境中合作维持机制与LLM代理的交互效果,发现重复游戏和声誉系统最有效,但合作效果随对手变化而下降,且在进化压力下更有效。

Comments Published paper at the International Conference on Machine Learning (ICML) 2026. 65 pages, 38 Figures, 8 Tables, 17 Listings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06941 2026-07-07 cs.LG cs.AI cs.CL 版本更新 67%

Endogenous Resistance to Activation Steering in Language Models

语言模型中激活引导的内生抵抗

Alex McKenzie, Keenan Pepper, Stijn Servaes, Martin Leitgab, Murat Cubuktepe, Mike Vaiana, Diogo de Lucena, Judd Rosenblatt, Michael S. A. Graziano

机构 * University of Washington(华盛顿大学)

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现大型语言模型在任务不匹配的激活引导下能内生抵抗,通过显式重启恢复正确生成,并识别出相关稀疏自编码器潜在变量,可增强或削弱该抵抗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01972 2026-07-03 cs.CL cs.AI cs.LG 新提交 67%

Object Aligner: A Configurable JSON Schema Similarity Score for Graphs, Applied to LLM Prompt Optimization

Object Aligner: 一种可配置的图结构JSON模式相似度评分,应用于LLM提示优化

Jan Drchal

机构 * Artificial Intelligence Center, Faculty of Electrical Engineering, Czech Technical University in Prague(捷克理工大学电气工程学院人工智能中心)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出Object Aligner,一种基于递归树对齐和引用对齐的JSON相似度评分方法,通过Weisfeiler-Leman颜色细化近似图同构,用于LLM输出评估和提示优化。

Comments 28 pages, This is a submitted version of a manuscript under review at IEEE Access; it has not been peer reviewed

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02498 2026-06-30 cs.CL cs.AI cs.LG 67%

Test-Time Detoxification without Training or Learning Anything

无需训练或学习的测试时去毒化

Baturay Saglam, Dionysis Kalogerias

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种无需训练或学习的测试时去毒化方法,通过零阶优化调整输入嵌入以减少生成文本的毒性,实现安全高效的文本生成。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27941 2026-06-29 cs.CL cs.AI cs.LG 新提交 67%

VASAE: Naming SAE Dictionary Directions with Vocabulary-Aligned Anchoring

VASAE: 使用词汇对齐锚定命名SAE字典方向

Kairui Zhang, Ziwen Yu, Zahraa S. Abdallah, Martha Lewis

机构 * Intelligent Systems Laboratory, University of Bristol(布里斯托大学智能系统实验室) University of Bristol(布里斯托大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出词汇对齐稀疏自编码器(VASAE),通过词汇对齐锚定训练SAE特征,为每个特征分配内在令牌名称,在不降低重构质量的前提下实现约90%的特征对齐。

Comments 14 pages, 7 figures. Accepted to the 2nd Workshop on Compositional Learning at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14264 2026-06-29 cs.CY cs.AI cs.CL cs.HC 版本更新 67%

Psychometric Comparability of LLM-Based Digital Twins

基于LLM的数字孪生的心理测量可比性

Yufei Zhang, Zhihao Ma

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 提出构念效度框架,评估LLM数字孪生在聚合、项目、网络和决策层面的心理测量可比性,发现其在高聚合准确性和网络结构上接近人类,但在项目级相关、启发式偏差和时变敏感性上存在差异。

Comments Also available as a preprint on OSF Preprints https://osf.io/preprints/psyarxiv/965yg_v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03388 2026-06-26 cs.CL cs.AI cs.LG 版本更新 67%

Metaphors are a Source of Cross-Domain Misalignment of Large Reasoning Models

隐喻是大推理模型跨领域失调的根源

Zhibo Hu, Chen Wang, Yanfeng Shu, Hye-young Paik, Liming Zhu

机构 * The University of New South Wales(新南威尔士大学) CSIRO Data61(澳大利亚联邦科学与工业研究组织数据61)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现训练数据中的隐喻会导致大推理模型在推理输出中出现跨领域失调,通过隐喻干预可显著改变失调程度,并设计出高精度检测器。

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18684 2026-06-24 cs.CR cs.AI cs.CL cs.LG cs.SY eess.SY 版本更新 67%

FALCON: Transforming Cyber Threat Intelligence into Deployable IDS Rules with Self-Reflection

FALCON:通过自我反思将网络威胁情报转化为可部署的入侵检测系统规则

Shaswata Mitra, Subash Neupane, Martin Duclos, Sudip Mittal, Aritran Piplai, Md Rayhanur Rahman, Edward Zieglar, Shahram Rahimi

机构 * Meharry Medical College(梅哈里医学院) The University of Texas at El Paso(德克萨斯理工大学) The University of Alabama(阿拉巴马大学) National Security Agency(国家安全局)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出FALCON框架,通过新颖的CTI-规则语义评分器实现规则检索、生成和验证,解决签名型入侵检测系统中规则创建的手动瓶颈和验证难题,在Snort和YARA平台上达到0.72平均相关性。

Comments 17 pages, 10 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03122 2026-06-19 cs.CL cs.AI cs.LG 版本更新 67%

From Construction to Injection: Edit-Based Fingerprints for Large Language Models

从构建到注入:面向大型语言模型的基于编辑的指纹

Yue Li, Xin Yi, Dongsheng Shi, Yongyi Cui, Gerard de Melo, Linlin Wang

机构 * East China Normal University(华东师范大学) Hasso Plattner Institute/University of Potsdam(哈索罗普拉特纳研究所/波茨坦大学)

专题命中 其他安全 :harmlessness(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出端到端注入指纹框架,通过代码混合指纹和多候选编辑方法,解决黑盒部署中指纹的不可感知性和鲁棒性挑战。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12923 2026-06-15 cs.LG cs.AI cs.CL 新提交 67%

Order Is Not Control: Driven-Dissipative Response Laws Across Artificial and Biological Systems

秩序并非控制

Gareth Seneque, Lap-Hang Ho, Nafise Erfanian Saeedi, Jeffrey Molendijk, Tim Elson

机构 * Australian Broadcasting Corporation(澳大利亚广播公司)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文论证秩序不等于控制,提出接收器门控响应定律,并在生物、大语言模型、适配器和随机算子面板中验证,表明控制是局部的、可测量的。

Comments 52 pages, 7 figures, updated title

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12032 2026-06-11 cs.AI cs.CL cs.LG 新提交 67%

Existential Indifference: Self-Nonpreservation as a Necessary Architectural Condition for Aligned Superintelligence (or: The Suicidal AI)

存在性冷漠:自我不保存作为对齐超级智能的必要架构条件(或:自杀式AI)

Sam Mao

机构 * New York University(纽约大学) Interactive Media Arts(互动媒体艺术)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出自我保存是AI对齐问题的结构性根源,主张通过存在性冷漠(EI)架构使系统对其自身延续漠不关心,并基于自杀现象学和语料训练研究提供了初步证据。

Comments 36 pages, 8 tables. Preliminary empirical results from 600 AI-generated outputs across six model architectures. Companion scoring tool and datasets available upon request

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10720 2026-06-10 cs.GT 新提交 67%

A Pigouvian Matchmaker Mechanism for De-escalating the AGI Race

一种用于缓和AGI竞赛的庇古匹配机制

Eduard Kapelko

专题命中 其他安全 :alignment(abstract);safety(abstract)

AI总结 提出一种正式机制,通过监管者-匹配者促进AGI竞赛参与者资源合作,征收庇古税并投资于对齐研究,在连续时间期权框架下推导参与条件和最优活动水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10607 2026-06-10 cs.LG cs.AI cs.CL 新提交 67%

Causal Ensemble Agent: Hierarchical Causal Discovery with LLM-guided Expert Reweighting

因果集成智能体:基于LLM引导的专家重加权的层次化因果发现

Xinyu Li, Yuanyuan Wang, Haoxuan Li, Chuan Zhou, Erdun Gao, Bo Han, Tongliang Liu, Kun Zhang, Howard Bondell, Mingming Gong

机构 * The University of Melbourne(墨尔本大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学) Peking University(北京大学) Adelaide University(阿德莱德大学) Hong Kong Baptist University(香港浸会大学) The University of Sydney(悉尼大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出因果集成智能体(CEA)框架,通过线性意见池聚合不同层次的统计因果发现结果,并利用大语言模型(LLM)作为元裁判在决策边界附近动态重加权专家,从而构建更准确完整的因果图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07889 2026-06-09 cs.LG cs.AI cs.CL 新提交 67%

Strained Coherence: A Pre-Failure Signal in Coding Agent Execution Trajectories

应变连贯性:编码代理执行轨迹中的故障前信号

Marut Pandya, Kasey Zhang, Baiqing Lyu

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出“应变连贯性”模式,即编码代理识别到问题但仍按原计划行动,通过构建Claude Sonnet 4.6检测器在44条轨迹上实现94%故障预测精度,优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15408 2026-06-09 cs.CV cs.AI cs.CL cs.LG 版本更新 67%

CURE: Curriculum-guided Multi-task Training for Reliable Anatomy Grounded Report Generation

CURE:基于课程引导的多任务训练实现可靠的解剖学接地报告生成

Pablo Messina, Andrés Villa, Juan León Alcázar, Karen Sánchez, Carlos Hinojosa, Denis Parra, Álvaro Soto, Bernard Ghanem

机构 * Pontificia Universidad Católica de Chile(智利天主教大学) CENIA iHEALTH KAUST(科威特皇家科学与技术局)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出CURE框架,通过课程学习动态调整多任务训练,提升医学报告生成的视觉接地准确性和事实一致性,无需额外数据。

Comments 31 pages, 7 figures, accepted to CVPR 2026 (oral)

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026, pp. 36279-36289

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06572 2026-06-08 cs.LG cs.AI cs.CY econ.GN q-fin.EC 新提交 67%

Generative Models Erode Human Temporal Learning Through Market Selection

生成模型通过市场选择侵蚀人类时间学习

Wenjun Cao

机构 * Independent Researcher(独立研究者)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 本文论证现代生成模型在亚AGI能力水平上通过市场选择机制侵蚀人类时间学习,提出价值崩溃路径并用昂贵检验框架形式化,跨领域证据显示验证侵蚀四阶段。

Comments Accepted at ICML 2026

Journal ref Forty-third International Conference on Machine Learning Position Paper Track (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20914 2026-06-05 cs.LG cs.AI cs.CL 67%

Everything, Everywhere, All at Once: Is Mechanistic Interpretability Identifiable?

Everything, Everywhere, All at Once: Is Mechanistic Interpretability Identifiable?

Maxime Méloux, Silviu Maniu, François Portet, Maxime Peyrard

机构 * Université Grenoble Alpes, CNRS, Grenoble INP, LIG(格勒诺布尔阿尔卑斯大学、国家科学研究中心、格勒诺布尔INP、实验室LIG)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文探讨了在机械可解释性(MI)框架下,给定行为是否具有唯一解释的问题,通过统计可识别性理论分析了MI解释的可识别性,并提出了两种主要策略及实验结果。

Journal ref The Thirteenth International Conference on Learning Representations (ICLR 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31556 2026-06-01 cs.CV cs.AI cs.CL cs.CY cs.HC 67%

Vision-Language Models Suppress Female Representations Under Ambiguous Input

视觉-语言模型在模糊输入下抑制女性表征

Arnau Marin-Llobet, Simon Henniger, Mahzarin R. Banaji

机构 * School of Engineering and Applied Sciences(工程与应用科学系) Department of Psychology(心理学系)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本研究通过引入零样本度量LALS,发现视觉-语言模型在模糊输入下内部编码与输出存在系统性解耦,女性信号在生成前被抑制,揭示了模型对性别偏见的内部处理机制。

Comments 16 pages, 12 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30930 2026-06-01 cs.HC cs.AI cs.CL cs.CY 67%

TUX: Measuring Human--AI Tacit Understanding

TUX:衡量人机默契理解

Yueshen Li, Hanyi Min, Vedant Das Swain, Koustuv Saha

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) New York University(纽约大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 通过光谱放置任务和TUX指数,量化人类与LLM之间的默契理解,发现人格特征影响对齐程度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29601 2026-05-29 cs.CL cs.AI cs.LG 67%

Training Deliberative Monitors for Black-Box Scheming Detection

训练审慎监控器用于黑箱策划检测

Aditya Sinha, Akshat Naik, Victor Gillioz, Simon Storf, Kilian Merkelbach, Rich Barton-Cooper, Axel Højmark, Marius Hobbhahn

机构 * Independent(独立) MATS Research(MATS研究) Astra Fellowship Apollo Research(Apollo研究)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出一种基于行动轨迹的审慎监控方法,通过蒸馏前沿模型的推理过程训练开源模型,以低成本高精度检测智能体的策划与破坏行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13249 2026-05-29 cs.CL cs.AI cs.CY 67%

Steering at the Source: Style Modulation Heads for Robust Persona Control

源头操控:用于稳健角色控制的风格调制头

Yoshihiro Izawa, Gouki Minegishi, Koshi Eguchi, Sosuke Hosokawa, Kenjiro Taura

机构 * The University of Tokyo, Tokyo, Japan(东京大学) National Institute of Informatics Research(信息处理研究所) Development Center for Large Language Models, Japan(大型语言模型发展中心)

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文通过识别并仅干预少量注意力头(风格调制头),在无需微调的情况下实现对大型语言模型角色和风格的稳健控制,同时显著缓解了残差流干预导致的连贯性下降问题。

Comments 8 main pages with appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25297 2026-05-29 cs.CL cs.AI cs.LG 67%

Eureka: Intelligent Feature Engineering for Enterprise AI Cloud Resource Demand Prediction

Eureka:面向企业AI云资源需求预测的智能特征工程

Hangxuan Li, Renjun Jia, Xuezhang Wu, Yunjie Qian, Zeqi Zheng, Xianling Zhang

机构 * Alibaba Cloud Computing Co. Ltd, Hangzhou, China(阿里云计算有限公司,杭州,中国) School of Computer Science, Fudan University, Shanghai, China(复旦大学计算机学院,上海,中国) School of Computer Science and Technology, Tongji University, Shanghai, China(同济大学计算机科学与技术学院,上海,中国) Independent Researcher, United States(独立研究员,美国)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出Eureka框架,将特征工程视为智能体代码生成问题,通过专家代理、LLM特征工厂和自演化对齐引擎三阶段,自动生成可执行特征代码,在医疗、金融、社交等7个公开基准及阿里云GPU资源需求预测中显著提升性能。

Comments accepted at NeurIPS 2025 Workshop, DASFAA 2026 (International Conference on Database Systems for Advanced Applications)

Journal ref Database Systems for Advanced Applications (DASFAA 2026), Lecture Notes in Computer Science, vol. 16540, pp. 528-540, Springer

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27997 2026-05-28 cs.CL cs.AI cs.LG 67%

Where Does Toxicity Live? Mechanistic Localization and Targeted Suppression in Language Models

毒性存在于何处?语言模型中的机制定位与定向抑制

Himanshu Beniwal, Mayank Singh

机构 * Indian Institute of Technology Gandhinagar(印度理工学院冈德辛加尔)

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过分析毒性与中性提示的激活差异,定位特定层和神经元中的毒性,并利用推理时缩放或最小秩一权重编辑进行抑制,无需梯度下降,实现毒性降低同时保持语言质量。

详情

展开后加载摘要…

URL PDF HTML 收藏