arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-09 至 2026-02-09 共收录 52 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 7 篇

2602.06836 2026-02-09 cs.AI 83%

LLM Active Alignment: A Nash Equilibrium Perspective

LLM主动对齐:从纳什均衡视角出发

Tonghan Wang, Yuqi Pan, Xinyi Yang, Yanchen Jiang, Milind Tambe, David C. Parkes

机构 * College of AI, Tsinghua University, Beijing, China(人工智能学院,清华大学,北京,中国) Harvard University, Cambridge, MA, USA(哈佛大学,马萨诸塞州剑桥,美国) Department of Electronic Engineering, Tsinghua University, Beijing, China(电子工程系,清华大学,北京,中国)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.AI

AI总结 本文提出了一种基于纳什均衡的LLM主动对齐方法,通过建模代理行为以避免文本空间计算难题,并展示其在社交媒体中防止政治排斥的应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06788 2026-02-09 cs.LG 83%

Displacement-Resistant Extensions of DPO with Nonconvex $f$-Divergences

对抗位移的DPO扩展:非凸f-散度

Idan Pipano, Shoham Sabach, Kavosh Asadi, Mohammad Ghavamzadeh

机构 * Faculty of Data and Decision Sciences(数据与决策科学学院) Technion - Israel Institute of Technology(技术ion-以色列理工学院) Meta Qualcomm AI Research(高通人工智能研究)

专题命中 偏好对齐 :DPO(title,abstract);RLHF(abstract);分类 cs.LG

AI总结 本文提出了一种对抗位移的DPO扩展方法,通过非凸f-散度改进了传统DPO,提供了更强的理论保证和实际表现。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06669 2026-02-09 cs.CL cs.AI 82%

compar:IA: The French Government's LLM arena to collect French-language human prompts and preference data

compar:IA:法国政府的LLM竞技场,用于收集法语人类提示和偏好数据

Lucie Termignon, Simonas Zilinskas, Hadrien Pélissier, Aurélien Barrot, Nicolas Chesnais, Elie Gavoty

机构 * The French Government(法国政府)

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);DPO(abstract);safety(abstract)

AI总结 compar:IA由法国政府开发,旨在通过收集法语人类提示和偏好数据,提升非英语语言中LLM的性能和文化契合度,同时推动多语言模型训练和评估的国际发展。

Comments 18 pages, 7 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06763 2026-02-09 cs.CL 70%

R-Align: Enhancing Generative Reward Models through Rationale-Centric Meta-Judging

R-Align: 通过以推理为中心的元判断增强生成奖励模型

Yanlin Lai, Mitt Huang, Hangyu Guo, Xiangfeng Wang, Haodong Li, Shaoxiong Zhan, Liang Zhao, Chengyuan Yao, Yinmin Zhang, Qi Han, Chun Yuan, Zheng Ge, Xiangyu Zhang, Daxin Jiang

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL

AI总结 R-Align通过引入黄金判断和明确监督推理对齐,提高生成奖励模型的推理一致性,从而增强RLHF的性能。

Comments Github: https://github.com/lyn22333/R-Align Huggingface: https://huggingface.co/collections/lyn22333/r-align

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06195 2026-02-09 cs.CV 67%

DeDPO: Debiased Direct Preference Optimization for Diffusion Models

DeDPO:用于扩散模型的去偏直接偏好优化

Khiem Pham, Quang Nguyen, Tung Nguyen, Jingsen Zhu, Michele Santacatterina, Dimitris Metaxas, Ramin Zabih

机构 * Cornell University(康奈尔大学) Rutgers University(罗格斯大学) NYU(纽约大学)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract)

AI总结 DeDPO通过整合因果推理的去偏技术,提升扩散模型在低成本合成监督下的对齐性能,实现与人类标注数据相当的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06714 2026-02-09 cs.HC 50%

PrefIx: Understand and Adapt to User Preference in Human-Agent Interaction

PrefIx: 在人机交互中理解并适应用户偏好

Jialin Li, Zhenhao Chen, Hanjun Luo, Hanan Salam

专题命中 偏好对齐 :alignment(abstract)

AI总结 PrefIx通过交互作为工具范式,评估智能体在人机交互中的偏好适应能力,提升用户体验和偏好对齐度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00744 2026-02-09 cs.SD 50%

ACE-Step 1.5: Pushing the Boundaries of Open-Source Music Generation

ACE-Step 1.5:推动开源音乐生成的边界

Junmin Gong, Yulin Song, Wenxiao Zhao, Sen Wang, Shengyuan Xu, Jing Guo, Xuerui Yang

机构 * ACE Studio(ACE工作室) Step Fun

专题命中 偏好对齐 :alignment(abstract)

AI总结 ACE-Step 1.5通过高效开源模型实现商业级音乐生成,结合内在强化学习与混合架构,支持多语言创作与风格控制。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 8 篇

2602.01539 2026-02-09 cs.AI cs.CL cs.LG cs.MA 85%

MAGIC: A Co-Evolving Attacker-Defender Adversarial Game for Robust LLM Safety

MAGIC: 一种共进化攻击者-防御者对抗游戏用于鲁棒大语言模型安全

Xiaoyu Wen, Zhida He, Han Qi, Ziyu Wan, Zhongtian Ma, Ying Wen, Tianhang Zheng, Xingcheng Xu, Chaochao Lu, Qiaosheng Zhang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MAGIC通过共进化对抗游戏提升大语言模型的安全性,攻击者与防御者智能体在多轮强化学习中相互演化,有效识别并抵御未知攻击模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06623 2026-02-09 cs.CL cs.CR 79%

Do Prompts Guarantee Safety? Mitigating Toxicity from LLM Generations through Subspace Intervention

提示是否保证安全?通过子空间干预减轻大语言模型生成中的毒性

Himanshu Singh, Ziwei Xu, A. V. Subramanyam, Mohan Kankanhalli

机构 * Department of Computer Science(计算机科学系) School of Computing, National University of Singapore(新加坡国立大学计算机学院) Department of Electronics and Communications Engineering(电子与通信工程系)

专题命中 安全训练 :safety(title,abstract);分类 cs.CL

AI总结 本文提出了一种子空间干预策略,通过减少大语言模型生成中的毒性,同时保持生成文本的流畅性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06258 2026-02-09 cs.LG cs.AI 73%

GRP-Obliteration: Unaligning LLMs With a Single Unlabeled Prompt

GRP-Obliteration: 通过单个无标签提示解耦大语言模型

Mark Russinovich, Yanan Cai, Keegan Hines, Giorgio Severi, Blake Bullwinkel, Ahmed Salem

机构 * Microsoft(微软)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 GRP-Obliteration通过单个无标签提示解耦大语言模型,利用GRPO技术有效移除安全约束,实现更强的不对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06540 2026-02-09 cs.AI cs.CL 62%

AgentCPM-Report: Interleaving Drafting and Deepening for Open-Ended Deep Research

AgentCPM-Report: 交错起草与深入以促进开放性深度研究

Yishan Li, Wentong Chen, Yukun Yan, Mingwei Li, Sen Mei, Xiaorong Wang, Kunpeng Liu, Xin Cong, Shuo Wang, Zhong Zhang, Yaxi Lu, Zhenghao Liu, Yankai Lin, Zhiyuan Liu, Maosong Sun

机构 * AgentCPM Team(AgentCPM团队)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

AI总结 AgentCPM-Report通过交错起草与深入的方法,提升开放性深度研究的性能,优于现有闭源系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06359 2026-02-09 cs.LG cs.AI 62%

Training Data Selection with Gradient Orthogonality for Efficient Domain Adaptation

基于梯度正交性的训练数据选择用于高效的领域适应

Xiyang Zhang, Yuanhe Tian, Hongzhi Wang, Yan Song

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出OGS方法,通过梯度正交性选择训练数据,提升领域适应的效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06375 2026-02-09 cs.AI 57%

Difficulty-Estimated Policy Optimization

难度估计策略优化

Yu Zhao, Fan Jiang, Tianle Liu, Bo Zeng, Yu Liu, Longyue Wang, Weihua Luo

机构 * Alibaba International Digital Commerce(阿里巴巴国际数字商务) School of Software Technology, Dalian University of Technology(大连理工大学软件学院)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 DEPO通过动态难度估计器优化推理对齐的效率和鲁棒性,减少回放成本并提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07210 2026-02-09 cs.RO cs.AI 57%

HyPlan: Hybrid Learning-Assisted Planning Under Uncertainty for Safe Autonomous Driving

HyPlan:在不确定环境下通过混合学习辅助规划实现安全自动驾驶

Donald Pfaffmann, Matthias Klusch, Marcel Steinmetz

机构 * Saarland University, Computer Science Dept.(萨尔兰大学计算机科学系) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心) French National Centre for Scientific Research (CNRS)(法国国家科学研究中心)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 HyPlan通过结合多智能体行为预测、深度强化学习和POMDP规划,实现安全且高效的自动驾驶导航

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04188 2026-02-09 cs.CV 50%

DiMo: Discrete Diffusion Modeling for Motion Generation and Understanding

DiMo:用于运动生成与理解的离散扩散建模

Ning Zhang, Zhengyu Li, Kwong Weng Loh, Mingxi Xu, Qi Wang, Zhengyu Wen, Xiaoyu He, Wei Zhao, Kehong Gong, Mingyuan Zhang

机构 * Huawei Central Media Technology Institute(华为中央媒体技术研究所) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 安全训练 :alignment(abstract)

AI总结 DiMo提出了一种离散扩散式框架,实现双向文本-运动理解和生成,通过迭代掩码标记细化提升运动质量和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 3 篇

2602.05444 2026-02-09 cs.CL 85%

Causal Front-Door Adjustment for Robust Jailbreak Attacks on LLMs

因果前门调整用于对抗大语言模型的鲁棒性劫持攻击

Yao Zhou, Zeen Song, Wenwen Qiang, Fengge Wu, Shuyi Zhou, Changwen Zheng, Hui Xiong

机构 * Institute of Software Chinese Academy of Sciences, Beijing, China(中国科学院软件研究所) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学) Institute of Information Engineering Chinese Academy of Sciences, Beijing, China(中国科学院信息工程研究所) Hong Kong University of Science and Technology, China, Hong Kong, China(香港科学与技术大学)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL

AI总结 本文提出CFA²攻击方法,通过因果前门准则和稀疏自编码器实现对大语言模型的鲁棒性劫持,提升攻击成功率并提供机制解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06440 2026-02-09 cs.CL cs.AI cs.CR 79%

TrailBlazer: History-Guided Reinforcement Learning for Black-Box LLM Jailbreaking

TrailBlazer: 基于历史的强化学习用于黑盒大语言模型劫持

Sung-Hoon Yoon, Ruizhi Qian, Minda Zhao, Weiyue Li, Mengyu Wang

机构 * Daegu Gyeongbuk Institute of Science and Technology(大邱庆 bun 科学技术研究院) Harvard University(哈佛大学) University of Southern California(南加州大学)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);red teaming(abstract);分类 cs.CL、cs.AI

AI总结 TrailBlazer通过历史感知强化学习提升黑盒大语言模型劫持效率,实现更高效的攻击策略和更高的查询效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06630 2026-02-09 cs.CR 50%

TrapSuffix: Proactive Defense Against Adversarial Suffixes in Jailbreaking

TrapSuffix: 对抗对抗性后缀的主动防御在劫持中

Mengyao Du, Han Fang, Haokai Ma, Gang Yang, Quanjun Yin, Shouling Ji, Ee-Chien Chang

专题命中 越狱攻击 :jailbreak(abstract)

AI总结 TrapSuffix通过主动防御机制,使攻击者陷入无赢困境,有效降低劫持攻击成功率并提高可追溯性。

Comments 23 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 提示注入 1 篇

2507.02735 2026-02-09 cs.CR cs.AI 79%

Meta SecAlign: A Secure Foundation LLM Against Prompt Injection Attacks

Meta SecAlign: 一种针对提示注入攻击的 secure LLM 基础

Sizhe Chen, Arman Zharmagambetov, David Wagner, Chuan Guo

机构 * FAIR at Meta(Meta 的 FAIR 部门) UC Berkeley(加州大学伯克利分校)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 Meta SecAlign 是首个开源的 LLM,具备内置的模型级防御,实现了商业级性能,且在复杂代理任务中表现优异,同时在提示注入攻击中展现出更高的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与事实性 5 篇

2505.23506 2026-02-09 cs.LG stat.ML 70%

Position: Epistemic uncertainty estimation methods are fundamentally incomplete

位置:epistemic不确定性估计方法本质上是不完整的

Sebastián Jiménez, Mira Jürgens, Willem Waegeman

机构 * Department of Data Analysis and Mathematical Modeling, Ghent University, Ghent, Belgium(数据分析与数学建模系,根特大学,根特,比利时)

专题命中 幻觉与事实性 :safety(abstract);trustworthy(abstract);分类 cs.LG

AI总结 本文指出epistemic不确定性估计方法存在固有缺陷,导致不确定性量化不准确且难以解释,需在高风险决策中谨慎使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06103 2026-02-09 cs.LG 70%

Toward Faithful and Complete Answer Construction from a Single Document

从单个文档构建忠实且完整的答案

Zhaoyang Chen, Cody Fleming

机构 * Department of Mechanical Engineering(机械工程系) Iowa State University(爱荷华州立大学)

专题命中 幻觉与事实性 :safety(abstract);AI safety(abstract);分类 cs.LG

AI总结 EVE通过结构化框架提升文档基础推理的完整性和准确性,同时解决单次生成中覆盖与准确性的权衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06920 2026-02-09 cs.CL cs.AI 62%

Halluverse-M^3: A multitask multilingual benchmark for hallucination in LLMs

Halluverse-M^3: 一个多任务多语言的幻觉基准测试用于LLMs中的幻觉

Samir Abdaljalil, Parichit Sharma, Erchin Serpedin, Hasan Kurban

机构 * Texas A&M University(德克萨斯农工大学) University of Maryland, Baltimore(马里兰大学巴尔的摩分校) Hamad Bin Khalifa University(哈马德·本·卡尔法大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 Halluverse-M^3是一个多语言多任务基准测试,用于评估大型语言模型中的幻觉检测性能,涵盖四种语言和两种生成任务,揭示了不同任务和语言下的幻觉检测挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06570 2026-02-09 cs.CL 57%

Baichuan-M3: Modeling Clinical Inquiry for Reliable Medical Decision-Making

Baichuan-M3:用于可靠医疗决策的临床查询建模

M3 Team, Chengfeng Dou, Fan Yang, Fei Li, Jiyuan Jia, Qiang Ju, Shuai Wang, Tianpeng Li, Xiangrong Zeng, Yijie Zhou, Hongda Zhang, Jinyang Tai, Linzhuang Sun, Peidong Guo, Yichuan Mo, Xiaochuan Wang, Hengfu Cui, Zhishou Zhang

机构 * Baichuan-M3 Team(Baichuan-M3团队)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL

AI总结 Baichuan-M3通过建模临床查询流程,实现了医疗决策支持的可靠性和准确性,优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26829 2026-02-09 cs.LG cs.CR 57%

Layer of Truth: Probing Belief Shifts under Continual Pre-Training Poisoning

真相层:在持续预训练中毒下的信念转变探究

Svetlana Churina, Niranjan Chebrolu, Kokil Jaidka

机构 * Centre for Trusted Internet \& Community, National University of Singapore, Singapore

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

AI总结 本研究揭示了持续预训练中虚假信息如何取代模型内部事实表示,通过实验发现中毒对模型信念的影响及可逆性,强调了对事实完整性进行监控的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 隐私与版权 2 篇

2602.06331 2026-02-09 cs.LG 70%

Don't Break the Boundary: Continual Unlearning for OOD Detection Based on Free Energy Repulsion

不要破坏边界:基于自由能排斥的持续性无学习用于OOD检测

Ningkang Peng, Kun Shao, Jingyang Mao, Linjing Qian, Xiaoqian Peng, Xichen Yang, Yanhui Gu

机构 * School of Computer and Electronic Information, Nanjing Normal University(计算机与电子信息学院,南京师范大学) School of Artificial Intelligence and Information Technology, Nanjing University of Chinese Medicine(人工智能与信息科技学院,南京中医药大学)

专题命中 隐私与版权 :safety(abstract);trustworthy(abstract);分类 cs.LG

AI总结 本文提出TFER框架,通过自由能原理构建Push-Pull机制,实现边界保持的持续无学习,提升OOD检测性能和模型稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06449 2026-02-09 cs.CL 57%

Evaluating an evidence-guided reinforcement learning framework in aligning light-parameter large language models with decision-making cognition in psychiatric clinical reasoning

评估一种证据引导的强化学习框架在对齐光参数大语言模型与精神科临床推理决策认知中的作用

Xinxin Lin, Guangxin Dai, Yi Zhong, Xiang Li, Xue Xiao, Yixin Zhang, Zhengdong Wu, Yongbo Zheng, Runchuan Zhu, Ming Zhao, Huizi Yu, Shuo Wu, Jun Zhao, Lingming Hu, Yumei Wang, Ping Yin, Joey W. Y. Chan, Ngan Yin Chan, Sijing Chen, Yun Kwok Wing, Lin Lu, Xin Ma, Lizhou Fan

机构 * The Chinese University of Hong Kong, Shatin, N.T., Hong Kong SAR, China(香港中文大学) Shandong University, Jinan, China(山东大学) Peking University Sixth Hospital, Beijing, China(北京大学第六医院) Inspur Cloud Information Technology Co., Ltd., Jinan, China(Inspur 云技术有限公司) Fudan University, Shanghai, China(复旦大学) Shandong Provincial Hospital Affiliated to Shandong First Medical University, Jinan, China(山东第一医科大学附属山东省人民医院) Jilin University, Changchun, China(吉林大学) Hong Kong ICI Cloud Service Limited, Hong Kong SAR, China(香港ICI云服务有限公司) Shandong First Medical University, Jinan, China(山东第一医科大学)

专题命中 隐私与版权 :alignment(abstract);分类 cs.CL

AI总结 本研究提出ClinMPO框架,通过证据引导的强化学习使轻量LLM在复杂精神病学推理任务中达到超越人类的准确率。

Comments 21 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 安全评测 20 篇

2602.06268 2026-02-09 cs.CL cs.LG 88%

MPIB: A Benchmark for Medical Prompt Injection Attacks and Clinical Safety in LLMs

MPIB:用于医疗提示注入攻击和大语言模型临床安全性的基准

Junhyeok Lee, Han Jang, Kyu Sung Choi

机构 * Seoul National University College of Medicine(首尔国立大学医学院) Seoul National University(首尔国立大学) Seoul National University College of Medicine, Seoul National University Hospital(首尔国立大学医学院、首尔国立大学医院)

专题命中 安全评测 :safety(title,abstract);prompt injection(title,abstract);分类 cs.CL、cs.LG

AI总结 MPIB是一个用于评估医疗提示注入攻击和大语言模型临床安全性的基准,通过测量临床危害事件率和攻击成功率来评估模型的安全性。

Comments 13 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06650 2026-02-09 cs.CL 88%

Beyond Static Alignment: Hierarchical Policy Control for LLM Safety via Risk-Aware Chain-of-Thought

超越静态对齐:通过风险感知的思维链实现LLM安全的分层策略控制

Jianfeng Si, Lin Sun, Weihong Lin, Xiangzheng Zhang

机构 * Qiyuan Tech, Beijing, China(奇渊科技,北京,中国)

专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.CL

AI总结 PACT通过分层策略架构和风险感知推理,解决LLM安全与有用性之间的权衡问题,提升动态安全控制和可控性。

Comments 13 pages, 5 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06443 2026-02-09 cs.CR cs.AI 83%

TrajAD: Trajectory Anomaly Detection for Trustworthy LLM Agents

TrajAD:用于可信大语言模型代理的轨迹异常检测

Yibing Liu, Chong Zhang, Zhongyi Han, Hansong Liu, Yong Wang, Yang Yu, Xiaoyan Wang, Yilong Yin

机构 * School of Software, Shandong University(山东大学软件学院) Sonli Holding Group Co., Ltd.(山东利集团有限公司) Shandong Huazhi Talent Technology Co., Ltd.(山东华智人才科技有限公司) Information Technology Service Center of People’s Court(人民法院信息技术服务中心)

专题命中 安全评测 :trustworthy(title,abstract);safety(abstract);分类 cs.AI

AI总结 TrajAD通过细粒度过程监督训练的专用验证器,解决大语言模型代理轨迹异常检测问题,提升过程可靠性。

Comments 9 pages, 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04836 2026-02-09 cs.AI 70%

Are AI Capabilities Increasing Exponentially? A Competing Hypothesis

人工智能能力是否呈指数增长?一个竞争性假设

Haosen Ge, Hamsa Bastani, Osbert Bastani

机构 * Wharton AI \& Analytics Initiative, The Wharton School, University of Pennsylvania, USA Department of Operations, Information Decisions, The Wharton School, University of Pennsylvania, USA Department of Computer Information Science, University of Pennsylvania, USA

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 本文通过分析数据和提出复杂模型,质疑人工智能能力的指数增长假设,指出拐点已过去并提出未来可能的转折点。

详情

展开后加载摘要…

URL PDF HTML 收藏