arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11618 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2798 篇

2606.23285 2026-06-23 cs.CL cs.SD 新提交 85%

On the Effect of Segmentation Width and Cluster Size on Speech Resynthesis and Continuation in Generative Spoken Language Models

分割宽度和聚类大小对生成式口语语言模型中语音合成与延续的影响

Shunsuke Kando, Wataru Nakata, Shinnosuke Takamichi, Yusuke Miyao

机构 * The University of Tokyo(东京大学) Keio University(庆应义塾大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 研究使用离散语音表示在不同比特率下进行语音合成与延续的性能,发现较低比特率仍能生成可理解自然的语音,且延续质量稳定,表明传统设置可能冗余。

Comments Accepted to Interspeech2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18190 2026-06-17 cs.CR cs.LG 新提交 85%

Multi-Source Cybersecurity Logs: An ATT&CK-Labeled Dataset and SLM Evaluation

多源网络安全日志:一个ATT&CK标记数据集及小语言模型评估

Abir Ashab Niloy, Ahmed Ryan, Imamul Hossain Rafi, Md Erfan, Md Rayhanur Rahman

机构 * Windows endpoints(Windows终端)

专题命中 评测与基准 :SLM(title,abstract_cn);language model(abstract);small language model(abstract);分类 cs.LG

AI总结 为解决多阶段网络攻击检测中缺乏带ATT&CK技术标签的多源日志数据集问题,构建了包含870个会话(70个攻击、800个良性)和约230万事件的多源日志数据集,并基于该数据集微调三个小语言模型,在分块分类任务上准确率从约8%提升至90%-97%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14388 2026-06-15 cs.LG 新提交 85%

A Low-Rank Subspace Analysis of LLM Interventions

LLM干预的低秩子空间分析

Angira Sharma, Christian Schroeder de Witt, Philip Torr, Anisoara Calinescu, Jialin Yu

机构 * University of Cambridge(剑桥大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.LG

AI总结 提出诊断框架,将行为建模为激活空间中的低秩子空间,发现干预一个行为会不对称地影响其他行为,效果与子空间重叠和决策子空间角度相关。

Comments Mechanistic Interpretability Workshop @ ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13247 2026-06-12 cs.AI 新提交 85%

EPIG: Emotion-Based Prompting for Personalised Image Generation

EPIG:基于情感提示的个性化图像生成

Emna Othmen, Mohamed Yassine Landolsi, Lotfi Ben Romdhane

机构 * MARS Research Lab LR17ES05, ISITCom, University of Sousse(苏塞大学ISITCom学院MARS研究实验室LR17ES05)

专题命中 评测与基准 :prompting(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出EPIG方法,利用心理学效价-唤醒模型在提示层面增强情感表达,无需训练即可控制生成图像的唤醒度,在10个多样化提示上平均唤醒误差降低14%-17%。

Comments Submitted to arXiv. 20 pages, 4 figures. Work on emotion-based prompt engineering for text-to-image diffusion models with applications in personalized image generation

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13380 2026-06-12 quant-ph cs.AI 新提交 85%

An LLM System for Autonomous Variational Quantum Circuit Design

用于自主变分量子电路设计的大语言模型系统

Kenya Sakka, Wataru Mizukami, Kosuke Mitarai

机构 * Center for Quantum Information and Quantum Biology(量子信息与量子生物学中心) The University of Osaka(大阪大学) Graduate School of Engineering Science(工学研究科)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出一个基于大语言模型的自主代理框架,通过迭代设计量子电路,在量子特征映射和变分量子本征求解器任务中取得优于或媲美现有方法的性能。

Comments 63 pages, 19 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09435 2026-06-09 cs.CL 新提交 85%

MUDIDI: A Two-Stage Framework for Multilingual Dictionary Digitization with Language Models

MUDIDI:一种基于语言模型的多语言词典数字化两阶段框架

David Setiawan, Temuulen Khishigsuren, Milind Agarwal, Pagnarith Pit, Aso Mahmudi, Ekaterina Vylomova

机构 * School of Computing and Information Systems, The University of Melbourne(墨尔本大学计算与信息系统学院) Melbourne School of Psychological Sciences, The University of Melbourne(墨尔本大学墨尔本心理科学学院) LILT

专题命中 评测与基准 :language model(title,abstract);LLM(abstract_cn);large language model(abstract);分类 cs.CL

AI总结 提出MUDIDI两阶段框架,结合语言模型实现多语言词典数字化,在字符识别、标记保留和词条分割上优于现有OCR和视觉语言模型,并发布30本公共领域词典的标注数据集。

Comments 9 pages, preprint, submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07978 2026-06-09 cs.CL 新提交 85%

MechLens: Late Crystallization of Factual Knowledge Explains Intervention Effectiveness in Language Models

MechLens:事实知识的晚期结晶解释语言模型中的干预有效性

Xueping Gao

机构 * Alibaba Cloud(阿里云)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);language model(title);分类 cs.CL

AI总结 本文发现LLM中的事实知识在最后层突然“结晶”,而非逐层涌现,并基于此提出结晶引导的干预原则,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06881 2026-06-08 cs.LG 新提交 85%

GlucoFM-Bench: Benchmarking Time-Series Foundation Models for Blood Glucose Forecasting

GlucoFM-Bench:血糖预测的时间序列基础模型基准测试

Baiying Lu, Zhaohui Liang, Ryan Pontius, Shengpu Tang, Temiloluwa Prioleau

机构 * Department of Computer Science(计算机科学系) Dartmouth College(达特茅斯学院) Emory University(埃默里大学) Quantitative Biomedical Sciences(定量生物医学科学)

专题命中 评测与基准 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出GlucoFM-Bench基准,评估8种时间序列基础模型与监督深度学习模型在15个糖尿病数据集上的血糖预测性能,发现预训练模型在零样本和少样本场景表现优异,但全样本下轻量LSTM仍最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17168 2026-08-19 cs.CL cs.AI 新提交 85%

Can LLMs Reason in a Legally Meaningful Manner? A Small-scale Study on European Court of Human Rights Cases

大语言模型能否以具有法律意义的方式进行推理?针对欧洲人权法院案件的小规模研究

Amogh Raina, Ilias Chalkidis, Daniel Hershcovich, Henrik Palmer Olsen

机构 * University of Copenhagen(哥本哈根大学) Faculty of Law, University of Copenhagen(哥本哈根大学法学院) Department of Computer Science, University of Copenhagen(哥本哈根大学计算机科学系)

专题命中 评测与基准 :LLM(summary_cn,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本研究以欧洲人权法院案件为测试平台,评估OpenAI GPT 5.4的法律推理表现,发现其推理质量不足、LLM评估不可替代人工,且专家提示未提升预测准确率。

Comments 24 pages, 4 figures, 4 tables, Submitted to AI4LAW Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10475 2026-08-12 cs.AI cs.CL cs.GT 新提交 85%

Evaluating Rational Contracting in Natural Language

评估自然语言中的理性缔约

Bhavyesh Sajja, Max Kleiman-Weiner, Roger Zimmermann, Tan Zhi-Xuan

专题命中 评测与基准 :LLM(summary_cn,abstract);language agent(abstract);分类 cs.CL、cs.AI

AI总结 本研究针对自然语言缔约的评估缺口,构建理性框架并开发ContractSim评估套件,发现当前LLM智能体在高不确定性下缔约及执行协议存在不足,为相关智能体设计指明改进方向。

Comments 9 pages, 5 figures, 2 tables (Appendix: 34 pages, 6 figures, 9 tables)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08822 2026-08-11 cs.AI cs.CL 新提交 85%

Automated Generation of Complexity-Validated Decision Scenarios Using Large Language Models

利用大语言模型自动生成经复杂度验证的决策场景

Abdalla Doleh, Toni Somers, Ratna Babu Chinnam

机构 * Wayne State University(韦恩州立大学)

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 本研究针对手动生成决策场景的缺陷,开发了基于大语言模型的自动化流水线,生成并验证了4238个多领域场景,证实其具备良好心理测量学特性,可用于AI系统认知评估。

Comments 38 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07688 2026-08-11 cs.AI cs.CL cs.CR cs.HC cs.MA 新提交 85%

IntelliAudit: Using Large Language Models to Evaluate Audit Controls

IntelliAudit:使用大语言模型评估审计控制

Allison Wilson, Sina Moradi Sabet, Diar Shakimov, Panteha Shahrivar, Mohammad Reza Bagheri, Dean Konenkamp, Mohammad A. Tayebi

机构 * Coca-Cola(可口可乐公司) Telus(德达斯电信公司)

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 本文提出基于检索的多智能体系统IntelliAudit,用于辅助IT审计证据评估,在ISO/IEC 27001上的评估显示其可支持审计工作,需作为决策支持工具使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04339 2026-08-06 cs.CL cs.AI cs.CE stat.ML 新提交 85%

Equitable System-Prompt Selection via Constrained Mixed-Strategy GroupDRO

基于约束混合策略GroupDRO的公平系统提示选择

Mengyu Xu, Qiaoxin Yang, Zhihan Liu, Ruiyao Xu, Zachary Liu, Kezhen Chen, Chongyang Gao

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对LLM不同表述问题的答案质量不均问题,提出约束混合策略GroupDRO框架选择系统提示,在双语医疗和消费金融基准上使LLM的最差损失平均降低13.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13036 2026-07-16 cs.CL cs.AI 新提交 85%

Ask Before You Diagnose: Safe-Psych, a Sequential Evaluation Benchmark for LLMs in Psychiatry

诊断前先询问:Safe-Psych,一种用于精神病学领域大语言模型的顺序评估基准

Oriana Presacan, Andreea Grama, Larisa Irimină, Alireza Nik, Jaya Ojha, Vajira Thambawita, Ciprian I. Băcilă, Bogdan Ionescu, Michael A. Riegler

机构 * National University of Science and Technology Politehnica Bucharest(布加勒斯特理工大学国立科技大学) Psychiatric Hospital Doctor Gheorghe Preda(格奥尔基·普雷达医生精神病医院) Oslo Metropolitan University(奥斯陆都市大学) Kristiania University of Applied Sciences(克里斯蒂亚尼亚应用科学大学) SimulaMet(SimulaMet公司) Lucian Blaga University of Sibiu(锡比乌卢西安·布拉加大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究针对大语言模型在精神病学决策支持中处理证据不完整问题,引入顺序评估基准Safe-Psych,通过模拟真实临床记录及精神科医生行动标签,评估多个模型,发现模型存在过早诊断等问题,揭示其局限性,为改善模型安全性研究提供支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00918 2026-07-02 cs.CL cs.AI cs.MA 新提交 85%

From Personas to Plot: Character-Grounded Multi-Agent Story Generation for Long-Form Narratives

从角色到情节:基于角色的多智能体长篇小说生成

Aayush Aluru, Chloe Ho, Muhammad Hammouri, Kerry Luo, Myra Malik, Ryan Lagasse, Arjun Bahuguna, Vasu Sharma

机构 * Pocket FM Princeton University(普林斯顿大学) University of Michigan(密歇根大学) University of Maryland(马里兰大学) Universitat Pompeu Fabra(庞培法布拉大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出MAGNET多智能体叙事引擎和ATLAS幻觉检测管线,通过角色代理和世界状态追踪,在100页故事中减少41%注释和50%幻觉,实现连贯长篇小说生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31522 2026-07-02 cs.CL cs.AI 新提交 85%

FinPersona-Bench: A Benchmark for Longitudinal Psychometric Stability of Autonomous Financial Agents

FinPersona-Bench: 自主金融代理纵向心理测量稳定性的基准

Muhammad Usman Safder, Ayesha Gull, Rania Elbadry, Fan Zhang, Yankai Chen, Xueqing Peng, Xue, Liu, Preslav Nakov, Zhuohan Xie

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) The University of Tokyo(东京大学) McGill University(麦吉尔大学) The Fin AI(Fin AI公司) Kyoto University(京都大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出FinPersona-Bench基准,通过合成市场分离价格与价值,评估LLM金融代理在长期部署中指令显著性衰减现象,发现指令重固化的效果因代理类型和市场环境而异。

Comments 29 pages, includes figures and tables; formalizes Mandate Salience Decay and introduces FinPersona-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30887 2026-07-01 cs.CL cs.AI cs.MA 新提交 85%

Training Therapeutic Judges and Multi-Agent Systems for Human-Aligned Mental Health Support

训练治疗性评判者与多智能体系统以实现人类对齐的心理健康支持

Mizanur Rahman, Abeer Badawi, Elahe Rahimi, Laleh Seyyed-Kalantari, Frank Rudzicz, Enamul Hoque, Elham Dolatabadi

机构 * York University(约克大学) Vector Institute(向量研究所) Connected Minds Dalhousie University(达尔豪斯大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出一个框架,通过两阶段训练(TheraJudge评判者与TheraAgent多智能体系统)将治疗性响应生成转化为决策优化问题,显著提升心理健康LLM的治疗质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30790 2026-07-01 cs.CL cs.AI 新提交 85%

Indi-RomCoM: Code-Mixed Benchmark for Evaluating LLMs on Romanized Indic-English Instructions

Indi-RomCoM:评估LLM在罗马化印度语-英语混合指令上的基准测试

Avisha Das, Mihir Parmar, Mohana Ramnath, Pulkit Verma

机构 * Shiv Nadar University Chennai(金奈希夫·纳达尔大学) Google Cloud AI Research(谷歌云人工智能研究) IIT Madras(印度理工学院马德拉斯分校)

专题命中 评测与基准 :LLM(title_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出Indi-RomCoM基准,用于评估大语言模型在罗马化印度语-英语混合指令上的表现,涵盖7个任务、4种语言和3种混合强度,发现模型性能随混合密度增加而下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24950 2026-06-25 cs.LG cs.AI 新提交 85%

MacroLens: A Multi-Task Benchmark for Contextual Financial Reasoning under Macroeconomic Scenarios

MacroLens:宏观经济情景下的多任务上下文金融推理基准

Patara Trirat, Jin Myung Kwak, Jay Heo, Heejun Lee, Sung Ju Hwang

机构 * KAIST(韩国科学技术院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 针对金融决策中价格、基本面、宏观和文本四信号联合评估的缺失,构建了涵盖4426只美股、七个任务、1130个宏观事件的基准,评估19种方法,揭示上下文特征的重要性。

Comments 25 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24523 2026-06-24 cs.CL cs.AI 新提交 85%

Poster: Exploring the Limits of Audio-Based Detection of Turkish Phone Call Scams

海报:探索基于音频的土耳其电话诈骗检测的极限

Arda Eren, Micheal Cheung, Youqian Zhang, Grace Ngai, Eugene Yujun Fu

机构 * The Hong Kong Polytechnic University(香港理工大学) The Education University of Hong Kong(香港教育大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对土耳其语电话诈骗,构建首个多模态数据集(100对音频-文本),评估7个LLM在三种输入条件下的检测性能,发现基于文本的输入优于直接音频处理。

Comments Poster paper accepted at 47th IEEE Security & Privacy 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20683 2026-06-23 cs.AI cs.CL 新提交 85%

From Question Answering to Task Completion: A Survey on Agent System and Harness Design

从问答到任务完成:智能体系统与执行框架设计综述

Jianyuan Guo, Zhiwei Hao, Chengcheng Wang, Cheng Fan, Tingzhang Luo, Hongguang Li, Ying Gao, Hefei Mei, Jiankun Peng, Rongjian Xu, Minjing Dong, Han Wu, Mengyu Zheng, Kai Han, Shiqi Wang, Chang Xu, Yunhe Wang

机构 * City University of Hong Kong(香港城市大学) University of Sydney(悉尼大学) Peking University(北京大学) TokenRhythm Technologies(TokenRhythm 科技公司)

专题命中 评测与基准 :LLM(summary_cn,abstract);foundation model(abstract);分类 cs.CL、cs.AI

AI总结 本文从模型-执行框架视角综述LLM智能体,分析模型瓶颈与执行框架设计,提出六组件分解法,并探讨任务完成、效率与可靠性的影响因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23676 2026-06-23 cs.LG cs.AI math.OC stat.ML 新提交 85%

Open Problem: Is AdamW Effective Under Heavy-Tailed Noise?

开放问题:AdamW 在重尾噪声下是否有效?

Dingzhi Yu, Hongyi Tao, Yuanyu Wan, Luo Luo, Lijun Zhang

机构 * Nanjing University(南京大学) Zhejiang University(浙江大学) Fudan University(复旦大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出开放问题:AdamW 在重尾噪声下能否收敛?通过加权度量基准和走廊下界机制,揭示分母记忆可能隐藏大梯度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18636 2026-06-18 cs.CL cs.AI 新提交 85%

PEC-Home: Interpretation of Progressively Elliptical Commands in Smart Homes

PEC-Home:智能家居中渐进式省略命令的解释

Yingyu Shan, Zeming Liu, Silin Li, Boao Qian, Jiashu Yao, Yuhang Guo, Haifeng Wang

机构 * Beijing Institute of Technology(北京理工大学) Beihang University(北京航空航天大学) Baidu Inc.(百度公司)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对智能家居中用户因共享上下文而使用渐进式省略命令导致的指代和意图歧义问题,提出首个模拟家庭数据集PEC-Home,实验表明现有LLM助手难以准确执行省略命令。

Comments Accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10064 2026-06-10 cs.LG cs.AI 新提交 85%

Bittensor Agent Arenas as a Trajectory Primitive: Distilling a Shopping Agent from ShoppingBench Subnet Traces

Bittensor 智能体竞技场作为轨迹基元:从 ShoppingBench 子网轨迹中蒸馏购物智能体

Shardul Bansal, Seth Schilbe, Jarrod Barnes

机构 * ORO AI Dynamical Systems(动力系统)

专题命中 评测与基准 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);post-training(abstract);分类 cs.AI、cs.LG

AI总结 针对小模型后训练缺乏多轮轨迹数据的问题,利用 Bittensor 子网 SN15 的竞技机制生成激励对齐的轨迹,通过结构质量过滤提取智能体轨迹,后训练 Qwen3-4B 模型在 ShoppingBench 上达到 42.7% ASR,接近合成数据基线。

Comments 10 pages, 4 figures, Data and Models available at: https://huggingface.co/collections/oro-ai/shoppingbench-sn15-trajectory-primitive

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07520 2026-06-09 cs.CL cs.LG 新提交 85%

TinyJudge: Unverifiable Constraint Alignment via Lightweight Specialist Ensembles

TinyJudge: 通过轻量级专家集成实现不可验证约束对齐

Yirong Zeng, Yufei Liu, Xiao Ding, Yutai Hou, Yuxian Wang, Wu Ning, Haonan Song, Dandan Tu, Qixun Zhang, Yuxiang He, Bibo Cai, Ting Liu

机构 * Harbin Institute of Technology SCIR Lab(哈尔滨工业大学SCIR实验室) Peking University(北京大学) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 针对LLM遵循不可验证约束时奖励黑客和计算开销大的问题,提出TinyJudge框架,利用多个小型语言模型集成提供奖励,在五个基准上平均性能提升约10%,奖励精度提升12%,训练速度提升3倍。

Comments ACL 2026 Main Conference;15 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18671 2026-08-20 cs.CV 新提交 85%

Vision-Language Models for Egocentric Video: From Hand-Object Interaction to Embodied AI

用于第一人称视角视频的视觉-语言模型:从手-物交互到具身智能

Mohammad Zamani, Fatemeh Ziaeetabar

机构 * University of Tehran(德黑兰大学)

专题命中 评测与基准 :language model(title,abstract);foundation model(abstract);prompting(abstract)

AI总结 本综述梳理了用于第一人称视角视频理解的视觉-语言模型的发展,分析其挑战、研究方向与局限,明确了可部署具身智能的关键优先方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03874 2026-08-05 cs.AI cs.CL cs.LG 新提交 85%

ContinualSkillBench: Can LLM Agents Truly Evolve Their Capabilities?

ContinualSkillBench:大语言模型智能体真的能发展其能力吗?

Tianyi Guan, Yiding Wang, Haotong Yang, Siyuan Cao, Shirui Liu, Yi Hu, Jiaqi Li, Muhan Zhang

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出动态评估框架ContinualSkillBench,发现大语言模型智能体顺序执行可提升任务性能,上下文学习与显式技能维护效果相当,弱模型易积累零散技能,当前机制仍难整合经验为稳健可迁移技能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00895 2026-08-04 cs.CR 新提交 85%

Multi-LLM Consensus Framework for Evaluating Banking-Sector NIDS Dataset Coverage of MITRE ATT&CK Techniques

用于评估银行领域NIDS数据集对MITRE ATT&CK技术覆盖度的多大型语言模型(Multi-LLM)共识框架

Sanjida Khanom, Sadia Afrin Khan, Adrita Rahman Tory, Md. Ahsan Habib, Khondokar Fida Hasan

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 该研究提出多大型语言模型共识框架,评估NIDS基准数据集对银行领域MITRE ATT&CK技术的覆盖度,发现UNSW-NB15覆盖得分最高、CIC-DDoS2019盲区大,为行业化NIDS评估奠定基础并推动银行原生数据集研发。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28801 2026-08-03 cs.CL cs.AI cs.LG 新提交 85%

Benchmarks Are Not Monolithic: Sample-Level Auditing and Orchestration for LLM Evaluation

基准并非单一整体:面向大语言模型评估的样本级审计与编排

Philipp D. Siedler, Jordan Sassoon

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究提出样本级审计的元评估框架,标注五大基准的内部异质性,可编排复合基准子集实现模型能力针对性评估,为基准重组提供原则性方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27421 2026-07-31 cs.CL cs.AI cs.LG 新提交 85%

Selecting Open-Weight Language Models for Zero-Shot Intent Classification: A Systematic Evaluation of 41 Models

选择用于零样本意图分类的开放权重语言模型:41种模型的系统评估

Parishruthi Ganesh, Gerry Dozier, Cheryl Seals

专题命中 评测与基准 :language model(title,abstract);instruction tuning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究通过系统评估41种开放权重语言模型,为意图分类场景下选择符合计算、延迟等约束的模型提供了实用指导。

详情

展开后加载摘要…

URL PDF HTML 收藏