arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9346 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9346 篇

2602.04289 2026-05-15 cs.CL cs.LG 62%

Proxy Compression for Language Modeling

代理压缩用于语言建模

Lin Zheng, Xinyu Li, Qian Liu, Xiachong Feng, Lingpeng Kong

机构 * University of Hong Kong(香港大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本文提出代理压缩方法,通过联合训练原始字节序列和压缩视图,提升语言模型训练效率,并在代码建模中显著优于纯字节级基线。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14517 2026-05-15 cs.CL cs.AI 62%

Dimension-Level Intent Fidelity Evaluation for Large Language Models: Evidence from Structured Prompt Ablation

大型语言模型的维度意图保真度评估:基于结构化提示消融的证据

GAng Peng

机构 * Huizhou Lateni AI Technology Co., Ltd.(惠州拉提尼人工智能技术有限公司) Huizhou University(惠州大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种维度意图保真度评估框架,通过2880个跨三语言、三任务领域和六种LLM的结构化提示消融研究,分别衡量结构恢复和意图保真度,揭示了系统性的结构保真度分裂,并证明了维度保真度评分比整体评分更可靠。

Comments Preprint. 30 tasks, 3 languages, 6 LLMs, 2,880 outputs; includes human evaluation and structured prompt ablation

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04601 2026-05-15 cs.SE cs.AI cs.CL 62%

Vibe Code Bench: Evaluating AI Models on End-to-End Web Application Development

Vibe Code Bench:评估AI模型在端到端Web应用开发中的表现

Hung Tran, Langston Nashold, Rayan Krishnan, Antoine Bigeard, Alex Gu

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Vibe Code Bench,通过100个Web应用规格和964个浏览器工作流评估AI模型在端到端应用开发中的性能,揭示了可靠开发仍为前沿挑战,并提出评估协议和人类对齐研究。

Comments 23 pages, 8 figures. Accepted to ACM CAIS 2026. Live leaderboard: https://www.vals.ai/benchmarks/vibe-code. Benchmark first released Nov 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13370 2026-05-14 cs.LG cs.CL 62%

Phasor Memory Networks: Stable Backpropagation Through Time for Scalable Explicit Memory

相位记忆网络:用于可扩展显式记忆的稳定反向传播通过时间

Sungwoo Goo, Hwi-yeol Yun, Sangkeun Jung

机构 * College of Pharmacy(药学院) Chungnam National University(Chungnam国立大学) Department of Computer Science & Engineering(计算机科学与工程系)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本文提出Phasor Memory Network,通过相位动力学和分层可学习锚点解决显式记忆的稳定性问题,实验证明其在Copy-Paste任务中达到高精确度,且在参数规模上超越了Mamba模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15297 2026-05-14 cs.CY cs.AI cs.HC cs.SI 62%

VERA-MH Concept Paper

VERA-MH概念论文

Luca Belli, Kate H. Bentley, Will Alexander, Emily Ward, Matt Hawrilenko, Kelly Johnston, Mill Brown, Adam M. Chekroud

机构 * Spring Health Yale University School of Medicine(耶鲁大学医学院)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.CY

AI总结 VERA-MH旨在通过自动化评估AI聊天机器人在心理健康中的安全性,尤其关注自杀风险。该系统利用用户代理和判断代理进行模拟对话评分,已初步测试了GPT-5、Claude Opus和Claude Sonnet。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11887 2026-05-13 cs.CL cs.LG 62%

Qwen-Scope: Turning Sparse Features into Development Tools for Large Language Models

Qwen-Scope:将稀疏特征转化为大语言模型的开发工具

Boyi Deng, Xu Wang, Yaoning Wang, Yu Wan, Yubo Ma, Baosong Yang, Haoran Wei, Jialong Tang, Huan Lin, Ruize Gao, Tianhao Li, Qian Cao, Xuancheng Ren, Xiaodong Deng, An Yang, Fei Huang, Dayiheng Liu, Jingren Zhou

机构 * Qwen Team(Qwen团队)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.LG

AI总结 Qwen-Scope通过稀疏自编码器为大语言模型提供开发工具,支持推理引导、评估分析、数据驱动工作流和训练优化,展示了SAEs在模型诊断与改进中的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11334 2026-05-13 cs.LG cs.CL cs.IR 62%

VERDI: Single-Call Confidence Estimation for Verification-Based LLM Judges via Decomposed Inference

VERDI:基于验证的LLM裁判的单次调用置信度估计方法

Jasmine Qi, Danylo Dantsev, Muyang Sun

机构 * Indeed Inc(Indeed公司)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 VERDI通过分解推理过程提取置信度信号,无需额外调用,提升验证型LLM裁判的可信度评估。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11205 2026-05-13 cs.LG cs.AI 62%

The Scaling Law of Evaluation Failure: Why Simple Averaging Collapses Under Data Sparsity and Item Difficulty Gaps, and How Item Response Theory Recovers Ground Truth Across Domains

评估失败的标度定律:为什么简单的平均在数据稀疏性和项目难度差异下崩溃,以及项目响应理论如何在不同领域中恢复真实值

Jung Min Kang

机构 * Independent Researcher(独立研究员)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了简单平均在数据稀疏性和项目难度差异下导致评估排名失真问题,通过模拟实验展示了项目响应理论(IRT)在不同领域中保持高排名相关性的能力。

Comments 15 pages, 4 tables, 1 figure. Code at https://github.com/testofschool/evaluation-failure-scaling-law

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05665 2026-05-13 cs.RO cs.AI cs.CL 62%

Characterizing the Robustness of Black-Box LLM Planners Under Perturbed Observations with Adaptive Stress Testing

基于扰动观测的黑盒大语言模型规划器鲁棒性表征:适应性压力测试

Neeloy Chakraborty, John Pohovey, Melkior Ornik, Katherine Driggs-Campbell

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了在扰动观测下大语言模型规划器的鲁棒性,提出适应性压力测试方法,通过蒙特卡洛树搜索高效搜索提示扰动空间,发现导致模型高不确定或崩溃的场景和配置。

Comments Accepted to ACL Findings 2026; 31 pages, 26 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09493 2026-05-12 cs.AI cs.LG 62%

Consensus Sampling for Safer Generative AI

共识采样用于更安全的生成式AI

Adam Tauman Kalai, Yael Tauman Kalai, Or Zamir

机构 * OpenAI MIT(麻省理工学院) Tel Aviv University(特拉维夫大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出共识采样算法,通过聚合多个概率分布提升生成模型安全性,其在保证安全性的前提下有效避免分歧,通过R-鲁棒性理论保障信息泄露和对抗影响的界限,实验验证了其在合成分布和图像生成中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12437 2026-05-12 cs.LG cs.AI 62%

A method for the systematic generation of graph XAI benchmarks via Weisfeiler-Leman coloring

一种通过Weisfeiler-Leman着色系统生成图XAI基准的方法

Michele Fontanesi, Alessio Micheli, Marco Podda, Domenico Tortorella

机构 * Department of Computer Science, University of Pisa(意大利比萨大学计算机科学系)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种自动化生成图XAI基准的方法,利用Weisfeiler-Leman算法提取子图特征,构建了OpenGraphXAI基准集,用于评估图解释器的有效性。

Journal ref Data Mining and Knowledge Discovery, vol. 40(4), article no. 42 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08200 2026-05-12 cs.AI cs.CV cs.LG 62%

Where Reliability Lives in Vision-Language Models: A Mechanistic Study of Attention, Hidden States, and Causal Circuits

在视觉-语言模型中可靠性在哪里存在:注意力、隐藏状态和因果回路的机制研究

Logan Mann, Ajit Saravanan, Ishan Dave, Shikhar Shiromani, Saadullah Ismail, Yi Xia, Emily Huang

机构 * UC Santa Barbara(加州大学圣巴巴拉分校) UC Berkeley(加州大学伯克利分校) NVIDIA(英伟达) Algoverse AI Research(Algoverse人工智能研究) Brown University(布朗大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文通过机制性研究发现,视觉-语言模型的可靠性主要体现在隐藏状态几何、分层边际形成和稀疏晚层回路,而非注意力图的锐度。

Comments 15 pages, 4 figures, 10 tables. Accepted at the ICLR 2026 Workshop on Multimodal Reasoning. Code and probe-training pipelines: https://github.com/itsloganmann/VLM-Reliability-Probe

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07677 2026-05-11 cs.IR cs.AI cs.CL 62%

TRACE: Tourism Recommendation with Accountable Citation Evidence

TRACE:基于可问责引用证据的旅游推荐

Zixu Zhao, Sijin Wang, Yu Hou, Yuanyuan Xu, Yufan Sheng, Xike Xie, Wenjie Zhang, Won-Yong Shin, Xin Cao

机构 * UNSW Sydney(新南威尔士大学悉尼分校) University of Adelaide(阿德莱德大学) Yonsei University(延世大学) USTC(中国科学技术大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 TRACE通过多轮对话结合评论引用和显式拒绝机制,解决旅游推荐中信任、可验证性和适应性问题,提出三项能力差距并验证评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07186 2026-05-11 cs.CL cs.AI 62%

The Text Uncanny Valley: Non-Monotonic Performance Degradation in LLM Information Retrieval

文本恐怖谷:LLM信息检索中的非单调性能退化

Zekai Tong, Ruiyao Xu, Aryan Shrivastava, Chenhao Tan, Ari Holtzman

机构 * University of Chicago(芝加哥大学) Northwestern University(西北大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了文本碎片化对LLM信息检索性能的影响,发现性能呈现U型曲线,提出模式过渡假说解释LLM在不同文本状态下的工作模式变化。

Comments 18 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06731 2026-05-11 cs.CR cs.CL cs.LG 62%

When Routine Chats Turn Toxic: Unintended Long-Term State Poisoning in Personalized Agents

当常规聊天变得有毒:个性化代理中无意的长期状态污染

Xiaoyu Xu, Minxin Du, Qipeng Xie, Haobin Ke, Qingqing Ye, Haibo Hu

机构 * The Hong Kong Polytechnic University(香港理工大学) Hong Kong University of Science and Technology, HKUST (Guangzhou)(香港科学与技术大学(广州))

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.LG

AI总结 研究探讨了个性化代理中因常规交互导致的长期状态污染问题,提出ULSPB基准和Harm Score指标,并通过StateGuard防御机制降低安全风险。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13075 2026-05-08 cs.CL cs.AI 62%

DeEscalWild: A Real-World Benchmark for Automated De-Escalation Training with SLMs

DeEscalWild:一个用于自动缓和训练的现实世界基准数据集

Md Hasebul Hasan, Krity Haque Charu, Eshwara Prasad Sridhar, Shuchisnigdha Deb, Mohammad A. Islam

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Department of Industrial, Manufacturing, and Systems Engineering(工业、制造与系统工程系) University of Texas at Arlington(德克萨斯大学阿灵顿分校)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出DeEscalWild基准数据集,通过多阶段流程从公开视频库中提取真实警察与平民互动数据,用于训练小型语言模型的缓和任务,实验表明经过该数据微调的SLMs在多个指标上优于基线模型。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01839 2026-05-08 cs.LG cs.AI q-bio.GN 62%

DOGMA: Weaving Structural Information into Data-centric Single-cell Transcriptomics Analysis

DOGMA: 将结构信息编织进数据导向的单细胞转录组学分析

Ru Zhang, Xunkai Li, Yaxin Deng, Sicheng Liu, Daohan Su, Qiangqiang Dai, Hongchao Qin, Rong-Hua Li, Guoren Wang, Jia Li

机构 * Department of Computer Science, Beijing Institute of Technology(北京理工大学计算机科学系) The Hong Kong University of Science and Technology (GZ)(香港科学与技术大学(广州))

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 DOGMA通过多级生物先验知识对原始数据进行结构重塑和语义增强,结合统计对齐和细胞本体学,提升细胞图谱的生物基础性和跨物种对齐能力。

Comments 34 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05463 2026-05-08 cs.LG cs.AI 62%

Robustness of Graph Self-Supervised Learning to Real-World Noise: A Case Study on Text-Driven Biomedical Graphs

图自监督学习在现实世界噪声中的鲁棒性:基于文本驱动的生物医学图的案例研究

Othmane Kabal, Mounira Harzallah, Fabrice Guillet, Hideaki Takeda, Ryutaro Ichise

机构 * National Institute of Informatics(国家信息研究所) Institute of Science Tokyo(东京科学研究所)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了图自监督学习在现实世界噪声下的鲁棒性,提出NATD-GSSL框架,通过对比噪声图与清洁图评估方法,发现关系重建对噪声敏感而特征重建更鲁棒,GNN架构对噪声也有显著影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06816 2026-05-08 cs.CL cs.CY cs.HC 62%

How do datasets, developers, and models affect biases in a low-resourced language?: The Case of the Bengali Language

数据集、开发者和模型如何影响低资源语言中的偏见?:孟加拉语的案例

Dipto Das, Shion Guha, Bryan Semaan

机构 * Department of Computer Science University of Toronto Toronto Ontario Canada(计算机科学系多伦多大学多伦多安大略加拿大) Faculty of Information University of Toronto Toronto Ontario Canada(信息学院多伦多大学多伦多安大略加拿大) Department of Information Science University of Colorado Boulder Boulder Colorado United States(信息科学系科罗拉多大学波德 Boulder科罗拉多美国) University of Toronto(多伦多大学) University of Colorado Boulder(科罗拉多大学波德)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.CY

AI总结 本文研究了孟加拉语中基于性别、宗教和国籍身份的偏见问题,通过分析mBERT和BanglaBERT模型发现,尽管语义内容相似,但模型仍存在偏见,揭示了算法审计中方法论和数据来源的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01555 2026-05-05 cs.CL cs.AI cs.HC 62%

Automated Interpretability and Feature Discovery in Language Models with Agents

在语言模型中通过代理实现自动化可解释性和特征发现

Arnau Marin-Llobet, Javier Ferrando

机构 * Harvard University(哈佛大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一个自主多代理框架,用于自动化大型语言模型的内部特征发现与解释,通过两个耦合循环提升解释精度和可验证性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01091 2026-05-05 cs.CY cs.AI cs.MA 62%

Governing What the EU AI Act Excludes: Accountability for Autonomous AI Agents in Smart City Critical Infrastructure

欧盟人工智能法案所排除的治理:自主AI代理在智能城市关键基础设施中的问责制

Talal Ashraf Butt, Muhammad Iqbal, Razi Iqbal

机构 * Higher Colleges of Technology(高等技术学院) Central Michigan University(中央密歇根大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本文探讨了欧盟人工智能法案在智能城市关键基础设施中自主AI代理问责制的不足,提出AgentGov-SC治理架构以弥补监管空白。

Comments 24 pages, 3 figures, 8 tables. Submitted to Computer Law & Security Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00907 2026-05-05 cs.CV cs.AI cs.LG 62%

TRIP-Evaluate: An Open Multimodal Benchmark for Evaluating Large Models in Transportation

TRIP-Evaluate: 一个用于评估交通领域大模型的开放多模态基准

Han Gong, Zhen Zhou, Yunyang Shi, Yan Tan, Jinbiao Huo, Qi Hong, Zhiyuan Liu

机构 * School of Transportation(交通学院) Southeast University(东南大学) School of Artificial Intelligence and Computer Science(人工智能与计算机科学学院) Jiangnan University(江南大学) Department of Civil and Environmental Engineering(土木与环境工程系) Hong Kong Polytechnic University(香港理工大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 TRIP-Evaluate是首个开放多模态交通评估基准,通过837项任务覆盖车辆、交通管理、旅行者和规划设计功能,提供能力、模态和难度标签,支持跨模态诊断,揭示大模型在多步工程计算、规则约束推理和多模态场景理解方面的不足。

Comments 19 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00839 2026-05-05 cs.AI cs.LG 62%

2026 Roadmap on Artificial Intelligence and Machine Learning for Smart Manufacturing

2026 年人工智能与机器学习在智能制造中的路线图

Jay Lee, Hanqi Su, Marco Macchi, Adalberto Polenghi, Wei Wu, Zhiheng Zhao, George Q. Huang, Kiva Allgood, Devendra Jain, Benedikt Gieger, Vibhor Pandhare, Soumyabrata Bhattacharjee, Ram Mohril, Lingbao Kong, Qiyuan Wang, Xinlan Tang, Sungjong Kim, Chan Hee Park, Byeng D. Youn, Guo Dong Goh, Xi Huang, Wai Yee Yeong, Yung C Shin, He Zhang, Zitong Wang, Fei Tao, Jagjit Singh Srai, Satyandra K. Gupta, Byung Gun Joung, Albin John, John W. Sutherland, Sang Won Lee, Olga Fink, Vinay Sharma, Faez Ahmed, Wei Chen, Mark Fuge, Arild Waaler, Martin G. Skjæveland, Dimitris Kyritsis, Wei Chen, VispiNevile Karkaria, Yi-Ping Chen, Ying-Kuan Tsai, Joseph Cohen, Xun Huan, Jing Lin, Liangwei Zhang, Gregory W. Vogl, Aaron W. Cornelius, Xiaodong Jia, Dai-Yan Ji, Takanobu Minami, Ruoxin Wang

机构 * Center for Industrial Artificial Intelligence, Department of Mechanical Engineering, University of Maryland, College Park(工业人工智能中心,机械工程系,马里兰大学College Park分校) Department of Management, Economics and Industrial Engineering, Politecnico di Milano(管理、经济与工业工程系,米兰理工学院) Department of Industrial and Systems Engineering, The Hong Kong Polytechnic University(工业与系统工程系,香港理工大学) Centre for Advanced Manufacturing & Supply Chains, World Economic Forum(先进制造与供应链研究中心,世界经济论坛) Department of Mechanical Engineering, Indian Institute of Technology Indore(机械工程系,印度理工学院Indore分校) Future Information Innovative College, Fudan University(未来信息创新学院,复旦大学) Department of Mechanical Engineering, Seoul National University(机械工程系,首尔国立大学) Department of Mechanical and Information Engineering, University of Seoul(机械与信息工程系,首尔大学) Onepredict Corp.(Onepredict公司) School of Mechanical and Aerospace Engineering, Nanyang Technological University(机械与航空航天工程学院,南洋理工大学) Singapore Centre for 3D Printing, Nanyang Technological University(新加坡3D打印中心,南洋理工大学) Mechanical Engineering, Purdue University(机械工程系,普渡大学) Digital Twin International Research Center, International Institute for Interdisciplinary and Frontiers, Beihang University(数字孪生国际研究中心, interdisciplinary and Frontiers 国际研究院,北京航空航天大学) School of Automation Science and Electrical Engineering, Beihang University(自动化科学与电气工程学院,北京航空航天大学) Department of Engineering, University of Cambridge(工程系,剑桥大学) Center for Advanced Manufacturing, University of Southern California(先进制造中心,南加州大学) School of Sustainability Engineering and Environmental Engineering, Purdue University(可持续工程与环境工程系,普渡大学) School of Mechanical Engineering, Sungkyunkwan University(机械工程系,全南大学) Intelligent Maintenance and Operations Systems, EPFL(智能维护与运营系统,苏黎世联邦理工学院) Department of Mechanical Engineering, Massachusetts Institute of Technology(机械工程系,麻省理工学院) J. Mike Walker ’66 Department of Mechanical Engineering, Texas A&M University(J. Mike Walker ’66 机械工程系,德克萨斯A&M大学) Department of Mechanical and Process Engineering, ETH Zürich(机械与工艺工程系,苏黎世联邦理工学院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨人工智能与机器学习在智能制造中的发展现状与未来方向,涵盖基础理论、应用领域及新兴技术,旨在推动创新与产业应用。

Comments This paper has been accepted for publication in the Journal Machine Learning: Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05534 2026-05-05 cs.LG cs.AI 62%

A Unified Theory of Sparse Dictionary Learning in Mechanistic Interpretability: Piecewise Biconvexity and Spurious Minima

稀疏字典学习在机制可解释性中的统一理论:分段双凸性与虚假极值

Yiming Tang, Harshvardhan Saini, Zhaoqian Yao, Zheng Lin, Yizhen Liao, Jingyi Cui, Yisen Wang, Mengnan Du, Dianbo Liu

机构 * National University of Singapore(新加坡国立大学) Indian Institute of Technology, Dhanbad(印度德里理工学院) Chinese University of Hong Kong(香港中文大学) Hong Kong University of Science and Technology(香港科学与技术大学) Peking University(北京大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文提出稀疏字典学习的统一理论,揭示其分段双凸性及虚假极值问题,通过线性表示基准揭示路径学,提出特征锚定技术提升特征恢复性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27977 2026-05-04 cs.AI cs.LG 62%

D3-Gym: Constructing Real-World Verifiable Environments for Data-Driven Discovery

D3-Gym:构建现实世界可验证环境用于数据驱动发现

Hanane Nour Moussa, Yifei Li, Zhuoyang Li, Yankai Yang, Cheng Tang, Tianshu Zhang, Nesreen K. Ahmed, Ali Payani, Ziru Chen, Huan Sun

机构 * The Ohio State University(俄亥俄州立大学) Cisco Research(思科研究)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 D3-Gym通过构建首个自动化的可验证环境数据集,提升科学数据驱动发现的模型能力,验证信号质量高,训练效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00436 2026-05-04 cs.CL cs.AI 62%

Impact of Task Phrasing on Presumptions in Large Language Models

任务表述对大语言模型中假设的影响

Kenneth J. K. Ong

机构 * AI.DA STC ST Engineering(AI.DA STC ST工程)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了任务表述如何导致大语言模型产生假设,影响其适应能力,通过囚徒困境实验发现中性表述可减少假设影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08418 2026-05-01 cs.LG cs.AI 62%

Taxon: Hierarchical Tax Code Prediction with Semantically Aligned LLM Expert Guidance

Taxon: 基于语义对齐的LLM专家指导的层级税码预测

Jihang Li, Qing Liu, Zulong Chen, Jing Wang, Wei Wang, Chuanfei Xu, Zeyi Wen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Alibaba Group(阿里巴巴集团) Guangdong Laboratory of Artificial Intelligence and Digital Economy (Shenzhen)(广东人工智能与数字经济实验室(深圳))

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Taxon框架,通过语义对齐和专家指导实现层级税码预测,结合多专家架构和语义一致性模型,在实际业务中提升准确性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12622 2026-05-01 cs.AI cs.CR cs.ET cs.LG cs.SY eess.SY 62%

The AI Risk Repository: A Comprehensive Meta-Review, Database, and Taxonomy of Risks From Artificial Intelligence

人工智能风险仓库:人工智能风险的全面元综述、数据库和分类

Peter Slattery, Alexander K. Saeri, Emily A. C. Grundy, Jess Graham, Michael Noetel, Risto Uuk, James Dao, Soroush Pour, Stephen Casper, Neil Thompson

机构 * MIT AI Risk Initiative(麻省理工学院人工智能风险倡议)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文构建了首个公开可访问的人工智能风险数据库,通过系统综述和专家咨询,分类了777个风险,涵盖因果因素和领域分类,为协调管理AI风险提供基础。

Journal ref Patterns 101517 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01929 2026-04-30 cs.SD cs.AI cs.LG 62%

Woosh: A Sound Effects Foundation Model

Woosh:一种声音效果基础模型

Gaëtan Hadjeres, Marc Ferras, Khaled Koutini, Benno Weck, Alexandre Bittar, Thomas Hummel, Zineb Lahrichi, Hakim Missoum, Joan Serrà, Yuki Mitsufuji

机构 * Sony AI(索尼人工智能)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文介绍了Sony AI发布的Woosh声音效果基础模型,提供高质量音频编码器/解码器、文本-音频对齐模型及文本到音频和视频到音频生成模型,展示了其在公开和私有数据上的竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25847 2026-04-29 math.OC cs.AI cs.LG 62%

From Soliloquy to Agora: Memory-Enhanced LLM Agents with Decentralized Debate for Optimization Modeling

从独白到广场:基于去中心化辩论的记忆增强型LLM代理用于优化建模

Jianghao Lin, Zi Ling, Chenyu Zhou, Tianyi Xu, Ruoqing Jiang, Zizhuo Wang, Dongdong Ge

机构 * Antai College of Economics and Management(上海交通大学安泰经济管理学院) University of Chicago Booth School of Business(芝加哥大学布斯商学院) The Chinese University of Hong Kong, Shenzhen (CUHK-Shenzhen)(香港中文大学(深圳)) School of Economics and Management(清华大学经济管理学院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Agora-Opt框架,结合去中心化辩论与读写记忆库,实现优化建模的模块化代理系统,通过去中心化辩论协议实现多代理团队的协同优化,提升建模可靠性。

Comments Working Paper

详情

展开后加载摘要…

URL PDF HTML 收藏