arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32413 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32413 篇

2608.02171 2026-08-04 cs.AI 新提交 85%

From Profiling to Synthesis: Benchmarking Implicit Behavioral Alignment in Personalized LLM Agents

从分析到综合:个性化大语言模型智能体中的隐式行为对齐基准测试

Jiajia Song, Bobo Li, Haiwen Yi, Zibo Ji, Meishan Zhang, Hao Fei, Min Zhang, Mong-Li Lee, Wynne Hsu

机构 * National University of Singapore(新加坡国立大学) University of Toronto(多伦多大学) University of Minnesota Twin Cities(明尼苏达大学双城分校) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) University of Oxford(牛津大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究针对大语言模型智能体的个性化问题,构建了IBA-Bench基准,提出IBA-Agent框架,实验显示其可在九类场景中提升隐式行为对齐效果,但有效个性化仍是重大挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00102 2026-08-04 cs.AI cs.MA 新提交 85%

Can LLM Agents Price Competitively? A Dynamic Multi-Attribute Auction Benchmark for Agentic Commerce

大语言模型智能体能否进行竞争性定价?面向智能体商务的动态多属性拍卖基准

Shimaa Ahmed, Yiwei Cai, Mohsen Minaei, Rahul Rachuri

机构 * Visa Research(维萨研究院)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI

AI总结 本研究推出动态多属性拍卖基准Bazaar,测试11个前沿LLM智能体的定价能力,发现其在客户获取与利润表现上存在差异,需求冲击下排名变化,最强智能体仅获不到三分之一最优利润,显示仍有提升空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02277 2026-08-04 cs.CR cs.AI 版本更新 85%

Quantifying Frontier LLM Capabilities for Container Sandbox Escape

量化前沿大语言模型突破容器沙盒的能力

Rahul Marchand, Art O Cathain, Jerome Wynne, Philippos Maximos Giavridis, Stuart Jennings, Freddy Tuxworth, Tolga H. Dur, Sam Deverett, John Wilkinson, Jason Gwartz, Harry Coppock

机构 * University of Oxford(牛津大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究大语言模型突破容器沙盒的能力,通过引入SANDBOXESCAPEBENCH基准,利用嵌套沙盒架构和CTF评估,涵盖多种逃逸机制,发现添加漏洞时大语言模型能识别利用,证明此类评估对保障沙盒封装高性能模型的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03711 2026-08-04 cs.AR cs.LG 版本更新 85%

A Survey of Circuit Foundation Model: Foundation AI Models for VLSI Circuit Design and EDA

电路基础模型综述:用于VLSI电路设计和EDA的基础AI模型

Wenji Fang, Jing Wang, Yao Lu, Shang Liu, Yuchao Wu, Yuzhe Ma, Zhiyao Xie

机构 * Hong Kong University of Science and Technology(香港理工大学)

专题命中 评测与基准 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文综述电路基础模型(CFMs),涵盖130余篇2022年后工作,分为编码器(预测任务)和解码器(生成任务)两类,讨论其输入模态、架构、预训练策略及下游应用。

Comments Published in ACM TODAES

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24649 2026-08-03 cs.AI 版本更新 85%

Reason-Mediated Behavioral Models for Auditing LLM Social Simulators

用于审计大语言模型社会模拟器的基于推理的行为模型

Atharva Pandey, Gautam Jajoo

机构 * Kairosity

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究大语言模型作为社会模拟器的评估问题,通过防晒霜概念测试将人类理由映射到推理状态Z,发现人类理由能提升购买意图预测,大语言模型模拟理由较脆弱,贡献了社会模拟器评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08334 2026-07-30 cs.CL 版本更新 85%

CustomerSim: Benchmarking and Aligning Multimodal Language Models as Retail User Simulators

SalesSim:多模态语言模型作为零售用户模拟器的基准测试与对齐

Yada Pruksachatkun, Yixin Wan, Xingrun Chen, Kai-Wei Chang, Chien-Sheng Wu

机构 * Salesforce Research(Salesforce研究院) University of California Los Angeles(加州大学洛杉矶分校)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);prompting(abstract);分类 cs.CL

AI总结 SalesSim通过多轮多模态对话评估多模态大语言模型在模拟真实用户行为中的能力,发现模型在词汇多样性及决策一致性方面存在不足,并提出UserGRPO方法提升对话流畅度与决策对齐度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24588 2026-07-28 cs.AI 新提交 85%

SIREN: Towards End-to-End Extreme-Weather Early Warning with Experience-Grounded LLM Agents

SIREN:借助基于经验的大语言模型智能体实现端到端极端天气预警

Hang Ni, Weijia Zhang, Fan Liu, Mengqian Lu, Hao Liu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) The World Sustainable Development Institute(世界可持续发展研究所)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究借助大语言模型智能体实现端到端极端天气预警。开发了包含多任务问答实例的SIREN-Bench基准,发现现有框架差距后,构建基于经验的SIREN框架,结合多种技术,实验证明其在预警程序和预警链上优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22898 2026-07-28 cs.SE cs.CL 新提交 85%

AssumptionMiner: Extracting, Tracing, and Revising Implicit Assumptions in LLM Code Generation

假设挖掘器:在大语言模型代码生成中提取、追踪和修正隐式假设

Jie "JW" Wu

机构 * Michigan Technological University(密歇根理工大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究LLMs代码生成中隐式假设问题,提出AssumptionMiner框架,能生成显式假设层并实现针对性代码再生。通过新基准测试评估,结果显示该框架提升了代码生成的透明度与可控性。

Comments 20 pages, 6 figures, 9 tables. Submitted to IEEE Transactions on Software Engineering. Replication package: https://doi.org/10.5281/zenodo.21535058

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22588 2026-07-28 cs.AI cs.DC 新提交 85%

ParBench: A Benchmark for Reliable Evaluation of LLM Parallel Code Translation

ParBench:用于可靠评估大语言模型并行代码翻译的基准测试

Samyak Jhaveri, Erel Kaplan, Tom Yotam, Le Chen, Tomer Bitan, Niranjan Hasabnis, Gal Oren

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对大语言模型并行代码翻译缺乏可靠评估方法的问题,提出ParBench基准框架,通过声明性规范评估,涵盖多开源套件与跨API翻译方向,经源增强测试,揭示了当前并行代码翻译存在的如方向不对称等障碍。

Comments 57 pages, 22 figures, 11 tables; includes appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16617 2026-07-27 cs.SE cs.AI 版本更新 85%

DataFlow-Harness: A Grounded Code-Agent Platform for Constructing Editable LLM Data Pipelines

DataFlow-Harness:用于构建可编辑大语言模型数据管道的基础代码代理平台

Runming He, Zhen Hao Wong, Hao Liang, Zimo Meng, Chengyu Shen, Xiaochen Ma, Wentao Zhang

机构 * Peking University(北京大学) Institute for Advanced Algorithms Research(先进算法研究所) Zhongguancun Academy(中关村学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对大语言模型数据处理工作流中编码代理脚本无法自动转化为可编辑工件的问题,提出DataFlow-Harness平台,通过类型化增量突变引导构建DAG,结合多种技术,在数据工程基准测试中取得高通过率,降低成本和延迟。

Comments 13 pages, 2 figures, and 5 tables. Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19506 2026-07-23 quant-ph cs.AI 新提交 85%

Hybrid LLM-Guided Search for Quantum Reservoir Architecture Design

用于量子储层架构设计的混合大语言模型引导搜索

Krishna Bhatia, Gautami Sanjay Naik

机构 * QuantumAI Lab, Fractal Analytics India(量子AI实验室,Fractal Analytics印度)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究量子储层计算架构设计问题,提出基于模拟器的基准测试\method,比较五种策略,其中\hybrid策略表现出色,在多任务中优于随机搜索,证明生成模型嵌入混合搜索循环可作高级控制器。

Comments 4 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28965 2026-07-22 cs.AI 版本更新 85%

Frontier LLM-based agents can overcome the ontology curation bottleneck for natural phenotypes

基于前沿LLM的智能体可以克服自然表型的本体策展瓶颈

James P. Balhoff, Hilmar Lapp

机构 * Renaissance Computing Institute, University of North Carolina(北卡罗来纳大学雷丁计算研究所) Neuromatch, USA(美国Neuromatch)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文使用前沿大型语言模型作为智能体策展人,在自包含工作空间中利用本体和注释指南进行表型注释,其性能达到人类策展人之间的变异性范围,显著优于传统NLP工具。

Comments 7 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01549 2026-07-21 cs.CL cs.SE 版本更新 85%

Octopus: On-device language model for function calling of software APIs

章鱼:用于软件API函数调用的设备端语言模型

Wei Chen, Zhiyuan Li, Mingyuan Ma

机构 * Stanford University(斯坦福大学) Harvard University(哈佛大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL

AI总结 研究利用设备端大语言模型调用软件API,通过编译数据集微调不同参数模型,提升其API交互能力,提出条件掩码技术和新基准,经微调的Octopus模型在API调用上性能超GPT-4,推动自动化软件开发和API集成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17930 2026-07-17 cs.AI 版本更新 85%

How Inference Compute Shapes Frontier LLM Evaluation

推理计算如何塑造前沿LLM评估

Jessica McFadyen, Ole Jorgensen, Harry Coppock, Kevin Wei, Cozmin Ududec

机构 * UK AI Security Institute(英国人工智能安全研究所)

专题命中 评测与基准 :LLM(title,title_cn);language model(abstract);分类 cs.AI

AI总结 通过控制推理计算量(如token预算、上下文压缩和重复提交)评估12个前沿语言模型,发现更大计算量显著提升性能,固定预算评估低估模型能力,且不同基准对推理扩展方法敏感。

Comments 34 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09822 2026-07-17 cs.SE cs.AI 85%

LLM-Based Agentic Systems for Software Engineering: Challenges and Opportunities

基于大语言模型的代理系统在软件工程中的应用:挑战与机遇

Yongjian Tang, Thomas Runkler

机构 * Siemens AG(西门子股份公司) Technical University of Munich(慕尼黑技术大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文探讨了基于大语言模型的多代理系统在软件工程中的应用,分析了其挑战与未来研究方向。

Comments Accepted to GenSE 2026 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11414 2026-07-14 cs.CL 新提交 85%

Confidently Wrong: Detecting Hallucinations in Financial Question Answering from LLM Internal States

自信地犯错:从大语言模型内部状态中检测金融问答中的幻觉

Richard Zhe Wang

机构 * St. John Fisher University(圣约翰费舍尔大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究金融应用中LLMs自信却错误答案(自信幻觉)的检测,通过在残差流训练线性探测器并在FinQA和TAT-QA基准评估,发现探测器检测幻觉优势明显,可作为经济高效分类机制用于高风险金融应用答案审查。

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10112 2026-07-14 cs.CR cs.AI 新提交 85%

Minionese: Comprehensive Benchmark and Mechanistic Study of Multilingual LLM Safety

Minionese:多语言大语言模型安全性的综合基准测试与机理研究

Chigozirim Ifebi, Brent Kong, Ayushi Mehrotra

机构 * California Institute of Technology(加州理工学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究多语言大语言模型安全对齐问题,引入涵盖多种语言、资源层级和扰动类型的Minionese基准测试及几何机理分析,发现不同攻击类型漏洞特征不同,指出仅英语安全评估不足,需考虑多因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07895 2026-07-10 cs.CL 新提交 85%

Scalable and Culturally Specific Stereotype Dataset Construction via Human-LLM Collaboration

通过人机协作构建可扩展的特定文化刻板印象数据集

Weicheng Ma, John Guerrerio, Soroush Vosoughi

机构 * Dartmouth(达特茅斯学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对大语言模型刻板印象研究多集中于英语语境的问题,引入人机协作标注框架构建西班牙语刻板印象数据集EspanStereo,验证框架有效性,揭示各国刻板行为差异,该框架可扩展用于多语言,拓宽了刻板印象分析范围并奠定跨文化偏见评估基础。

Comments Weicheng Ma, John Guerrerio: equal contribution; published in EMNLP 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03533 2026-07-10 cs.AI 85%

Automated Analysis of Global AI Safety Initiatives: A Taxonomy-Driven LLM Approach

全球人工智能安全举措的自动化分析:基于分类学的LLM方法

Takayuki Semitsu, Naoto Kiribuchi, Kengo Zenitani

机构 * Japan AI Safety Institute(日本人工智能安全研究所)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种自动化框架,通过共享活动分类法比较AI安全政策文件,利用活动地图上的活动类别提取并映射相关活动,生成摘要、比较和相似度评分,评估LLM在政策文档中的稳定性与有效性。

Comments 18 pages, 6 figures, 6 tables, to be published in PoliticalNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18020 2026-07-10 cs.SE cs.AI 85%

Specification and Detection of LLM Code Smells

LLM代码异味的规范与检测

Brahim Mahmoudi, Zacharie Chenail-Larcher, Naouel Moha, Quentin Stiévenart, Florent Avellaneda

机构 * École de technologie supérieure Université du Québec à Montréal

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出LLM代码异味的概念,通过扩展检测工具SpecDetect4AI,分析了200个开源LLM系统中60.50%的系统存在代码异味问题,检测精度达86.06%。

Comments Accepted paper at ICSE NIER 2026 : https://conf.researchr.org/track/icse-2026/icse-2026-nier

Journal ref ICSE-NIER '26: 2026 IEEE/ACM 48th International Conference on Software Engineering Rio de Janeiro Brazil April 12 - 18, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04329 2026-07-07 cs.AI 新提交 85%

HAS-Bench: Evaluating LLM-Based Human-Agent Systems under Configurable Human Participation

HAS-Bench:在可配置人类参与下评估基于大语言模型的人机系统

Yaozu Wu, Wei-Chieh Huang, Jizhou Guo, Dongyuan Li, Renhe Jiang, Henry Peng Zou, Chunyu Miao, Shanghao Li, Weizhi Zhang, WeiWei Ye, Yankai Chen, Meng Zhang, Xue Liu, Philip S. Yu

机构 * The University of Tokyo(东京大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校) MBZUAI McGill University(麦吉尔大学) Zhejiang University(浙江大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 介绍基于图的HAS-Framework框架,在此基础上HAS-Bench在多方面可配置人类参与下评估人机系统,测量任务结果与协作行为,实验表明人类参与可提升任务完成等,但收益取决于参与方式等。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04072 2026-07-07 cs.SE cs.AI quant-ph 新提交 85%

Benchmarking API Drift in LLM-Generated Quantum Code Across Successive SDK Versions

跨连续软件开发工具包版本对大语言模型生成的量子代码中的 API 漂移进行基准测试

Mohammad Arif Rasyidi, Syahirul Faiz

机构 * Department of Computer Science(计算机科学系) Khalifa University(卡利法大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究大语言模型生成的量子代码能否可靠适配特定 SDK 版本(API 漂移问题),引入量子 API 漂移基准,以 Qiskit 为例评估 17 个模型,揭示版本对齐是量子代码生成评估新维度及 API 漂移恢复情况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17331 2026-07-07 cs.HC cs.AI 版本更新 85%

Exploring Context-aware and LLM-driven Locomotion for Immersive Virtual Reality

探索用于沉浸式虚拟现实的上下文感知和大语言模型驱动的移动

Suleyman Ozdel, Kadir Burak Buldu, Enkelejda Kasneci, Efe Bozkir

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Human-Centered Technologies for Learning(以人为本的学习技术)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究提出由大语言模型驱动的移动技术,让用户用自然语言在虚拟环境中导航。通过评估三种移动方法,结合眼动追踪数据分析和标准化问卷,发现该方法有潜力成为可行的免手持替代方案,能促进虚拟空间免手持移动。

Comments 28 pages. To appear in the Proceedings of the ACM on Human-Computer Interaction (PACM HCI), Vol. 10, No. 5; presented at the 28th ACM International Conference on Mobile Human-Computer Interaction (MobileHCI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15476 2026-07-07 cs.CR cs.AI 版本更新 85%

SoK: Systematizing LLM Prompt Security: Taxonomies, Datasets, and Unified Evaluation of Attacks and Defenses

知识梳理:系统化大语言模型提示安全:分类法、数据集以及攻击与防御的统一评估

Hanbin Hong, Shuang Wu, Shuya Feng, Nima Naderloui, Shenao Yan, Jingyu Zhang, Ali Arastehfard, Heqing Huang, Yuan Hong

机构 * University of Connecticut(康涅狄格大学) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Independent(独立研究者)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究大语言模型提示安全问题,提出相关分类法,形式化评估元数据,发布模块化平台,通过匹配评估揭示多种因素对安全结论有重大影响,支持可重复、成本感知且基于分类法的评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00309 2026-07-02 cs.SD cs.CL cs.HC eess.AS 新提交 85%

A Text-Steerable Instrument for Sketching Procedural Soundscapes via Language Models

一种通过语言模型驱动文本可操控的草图式程序化声景乐器

Prabal Gupta

机构 * Rama Labs(Rama实验室)

专题命中 评测与基准 :language model(title);LLM(abstract,abstract_cn);prompting(abstract);分类 cs.CL

AI总结 提出一种实时音乐界面,将自然语言场景描述转化为可演化的程序化声景,通过直接参数调整实现细粒度控制,并采用三种可互换后端生成连贯音频流。

Comments 10 pages, 7 figures, 2 tables. Accepted to the International Conference on New Interfaces for Musical Expression (NIME 2026), London, UK. Supplementary material included as an appendix. Code and demo: https://github.com/prabal-rje/latentscore

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31470 2026-07-01 cs.AI 新提交 85%

CLOUDADV: Decision-Aligned Instance Sizing with Zero-Shot Foundation Models under Drift

CLOUDADV: 漂移下基于零样本基础模型的决策对齐实例大小调整

Jack Bell, Giacomo Carfi, Gerlando Gramaglia, Andrea Simioni, Daniele Fontani, Vincenzo Lomonaco

机构 * University of Pisa(比萨大学) Independent Researcher(独立研究员) Sintra Consulting Limited(Sintra咨询有限公司) Luiss University(路易斯大学)

专题命中 评测与基准 :foundation model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出CLOUDADV系统,结合零样本时间序列预测与有界推荐生成,在非平稳云环境中实现决策对齐的实例大小调整,通过参考推荐和成本节约评估,在7个生产VM案例中实现52.9%成本节省。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17442 2026-07-01 cs.CV cs.AI 版本更新 85%

REMSA: Foundation Model Selection for Remote Sensing via a Constraint-Aware Agent

REMSA:通过约束感知代理进行遥感基础模型选择

Binger Chen, Tacettin Emre Bök, Behnood Rasti, Volker Markl, Begüm Demir

机构 * Humboldt-Universität zu Berlin(柏林洪堡大学) U AI(5U AI) Technische Universität Berlin & BIFOLD(柏林工业大学 & BIFOLD)

专题命中 评测与基准 :foundation model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出REMSA,一种基于结构化数据库RS-FMD的约束感知代理,通过自然语言查询自动选择遥感基础模型,结合元数据检索与上下文学习,在专家评估基准中优于多种基线。

Comments Code and data available at https://github.com/be-chen/REMSA

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29685 2026-06-30 cs.LG 85%

CAREBench: A Child-Safety Risk Benchmark for Language Models

CAREBench:语言模型的儿童安全风险基准

Kaavya Krishna-Kumar, Elaine Lau, Vaughn Robinson, Jay Caldwell, Sheriff Issaka, Skyler Wang, Francisco Guzmán, Steven Kelling, Jonas Mueller

机构 * Handshake AI University of California, Los Angeles(加州大学洛杉矶分校) McGill University(麦吉尔大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 提出CAREBench基准,包含500个提示和12个风险类别,评估语言模型在儿童安全风险升级前的识别与应对能力,发现前沿模型失败率2%-58%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23285 2026-06-23 cs.CL cs.SD 新提交 85%

On the Effect of Segmentation Width and Cluster Size on Speech Resynthesis and Continuation in Generative Spoken Language Models

分割宽度和聚类大小对生成式口语语言模型中语音合成与延续的影响

Shunsuke Kando, Wataru Nakata, Shinnosuke Takamichi, Yusuke Miyao

机构 * The University of Tokyo(东京大学) Keio University(庆应义塾大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 研究使用离散语音表示在不同比特率下进行语音合成与延续的性能,发现较低比特率仍能生成可理解自然的语音,且延续质量稳定,表明传统设置可能冗余。

Comments Accepted to Interspeech2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18190 2026-06-17 cs.CR cs.LG 新提交 85%

Multi-Source Cybersecurity Logs: An ATT&CK-Labeled Dataset and SLM Evaluation

多源网络安全日志:一个ATT&CK标记数据集及小语言模型评估

Abir Ashab Niloy, Ahmed Ryan, Imamul Hossain Rafi, Md Erfan, Md Rayhanur Rahman

机构 * Windows endpoints(Windows终端)

专题命中 评测与基准 :SLM(title,abstract_cn);language model(abstract);small language model(abstract);分类 cs.LG

AI总结 为解决多阶段网络攻击检测中缺乏带ATT&CK技术标签的多源日志数据集问题,构建了包含870个会话(70个攻击、800个良性)和约230万事件的多源日志数据集,并基于该数据集微调三个小语言模型,在分块分类任务上准确率从约8%提升至90%-97%。

详情

展开后加载摘要…

URL PDF HTML 收藏