arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-11 至 2026-08-11 共收录 752 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 173 篇

2608.09343 2026-08-11 cs.AI 新提交 87%

LLM-Guided Heuristic Design from Simulation Traces: A Case Study in Dynamic Production and AGV Scheduling

基于模拟轨迹的大语言模型引导式启发式设计:动态生产与自动导引车调度的案例研究

Jinbo Li, Chuanhao Li

机构 * Tsinghua University(清华大学)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI

AI总结 该研究提出LLM引导的启发式设计框架,通过模拟轨迹诊断优化AGV与生产调度策略,在多组实验中优于多种基线方法,证实模拟轨迹可指导代码层面的策略改进。

Comments 33 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09140 2026-08-11 cs.CR cs.CL 新提交 87%

Beyond Direct Identifiers: Probabilistic Privacy Risk Estimation for Privacy-Conscious LLM Query Delegation

超越直接标识符:面向注重隐私的大语言模型查询委托的概率隐私风险估计

Li Siyan, Zhou Yu, Julia Hirschberg

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL

AI总结 该研究针对注重隐私的LLM查询委托问题,提出概率变体PCD,结合LLM驱动的k-匿名性估计,创建PUPA-SD数据集,发现PAPILLON在Llama-3.2-3B上实现最佳隐私-效用平衡,k-匿名性是有用辅助指标。

Comments Accepted into HAIPS workshop at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08968 2026-08-11 cs.SE cs.AI 新提交 87%

GALA: Graph-Augmented LLM Agents for Root Cause Analysis and Incident Response in Microservices

GALA:用于微服务根本原因分析和事件响应的图增强大语言模型智能体

Yifang Tian, Yaming Liu, Zichun Chong, Zihang Huang, Yiran Li, Hans-Arno Jacobsen

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI

AI总结 针对微服务RCA的现有方法存在局限,提出图增强LLM智能体框架GALA+,结合STRIX与SURE-Score,在基准测试中性能优于最佳LLM基线,获SRE专家认可。

Comments Proceedings of the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE '26), October 12--16, 2026, Munich, Germany

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08621 2026-08-11 cs.AI 新提交 87%

Business Arena: Benchmarking LLM Agents in a Realistic Marketplace

商业竞技场:在现实市场中对大语言模型智能体进行基准测试

Yijun Pan, Yukun Lian, Kunyu Shi, Junbo Li, Hongwei Xue, Sicong Xie, Guannan Zhang, Xiaoying Xing

机构 * Alibaba Group(阿里巴巴集团) Yale University(耶鲁大学)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI

AI总结 研究人员推出Business Arena测试平台,评估15个前沿LLM智能体在跨境商店运营中的表现,发现其平均最终净资产差9倍,最优模型仍逊于人类策略,为商业智能体评估提供了现实测试基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08245 2026-08-11 cs.CR cs.AI cs.HC 新提交 87%

Privacy-Preserving Data Drift Detection and Recovery for Large-Scale LLM Applications via Proxy Representations

基于代理表示的大规模大语言模型应用的隐私保护数据漂移检测与恢复

Michael Levit, Josh Ledgard, Haoyu Dong, Vishwas Suryanarayanan, Eyal Kolman, Sharon Tan, Qiang Gan, Vishal Chowdhary

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI

AI总结 针对大规模LLM应用的隐私约束导致的评估与漂移追踪难题,提出ProxyDrift框架,基于非PII代理表示实现无敏感数据暴露的漂移监测与合成数据生成,实验验证其对齐度达RA~0.9。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08189 2026-08-11 cs.AI 新提交 87%

Janus: An Algorithm-Evaluator Co-Evolution Framework for LLM-Driven Discovery under Expensive Evaluation Budgets

Janus:面向评估预算昂贵的大语言模型驱动发现的算法-评估器协同进化框架

Ximeng Liu, Qianlong Wang, Yingming Mao, Annan Li, Yatao Li, Shizhen Zhao, Jianmin Wu, Dawei Yin, Dou Shen

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI

AI总结 Janus是一个算法-评估器协同进化框架,它用LLM协同进化目标程序与代理评估器,通过真实结果校准、在线信用更新等策略缓解分布偏移,在五项任务中用更少真实评估实现更优性能,将评估器引导的LLM发现扩展到评估昂贵的科学领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07925 2026-08-11 cs.AI 新提交 87%

ZhuLong: Execution-Grounded LLM Agent for EDA Scripting with Offline API Self-Exploration

ZhuLong:基于执行的大语言模型智能体,用于结合离线API自探索的EDA脚本编写

Yang Liu, Shiwei Hou, Xiyuan Chen, Yu Wang, Sen Yuan, Qirui Gan, Shao You, Feifan Chen, Wencheng Li, Shuyang Hu, Yongzhou Liu, Emma Xia, Xiaojing Lu, Hao Wang, Fan Xu, Yanfeng Li

机构 * Changxin Memory Technologies, Inc.(长鑫存储技术有限公司)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI

AI总结 本文提出基于执行的LLM智能体ZhuLong,结合API检索、沙箱执行与离线API自探索机制,在EDA脚本任务基准测试中性能远超纯LLM基线,为EDA脚本编写提供了有效解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07614 2026-08-11 cs.SE cs.CL 新提交 87%

DevIntent: How Much Does LLM-Generated Code Violate Developer Intent?

DevIntent:大语言模型生成的代码在多大程度上违反开发者意图?

Susana Haing, Natan Vidra, Spurthi Setty

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL

AI总结 该研究针对LLM生成代码违反开发者隐式意图的问题,构建含49个问题的基准并提出IVR指标,发现两款主流LLM生成代码虽通过率高但超半数违反意图,揭示现有基准局限性。

Comments 8 pages, 2 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10794 2026-08-11 cs.AI 版本更新 87%

READER: Dynamic LLM Provenance from Query-Varying Interactions

READER: 基于提取表示的鲁棒证据作者身份解码

Jiaxu Liu, Sunnan Mu, Dong Huang, Liuyin Wang, Jing Shao, Jie Zhang

机构 * National University of Singapore(新加坡国立大学) Xidian University(西安电子科技大学) Tsinghua University(清华大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI

AI总结 针对黑盒LLM来源识别问题,提出READER框架,通过冻结代理LLM读取隐藏作者证据,利用贝叶斯证据累积实现多查询归因,在Agent500数据集上显著优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09930 2026-08-11 cs.SD cs.AI cs.CL 新提交 87%

Beyond Naturalness: Probing Automated Text-To-Speech Evaluators on Linguistically Grounded Dimensions

超越自然性:基于语言维度探究自动文本转语音评估器

Oluwanifemi Bamgbose, Simon Rosen, Jash Shah, Lindsay Devon Brin, Hoang H Nguyen, Anke Koelzer, Rachel Hansen, Tara Bogavelli, Fanny Riols

机构 * ServiceNow(ServiceNow公司)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究构建了首个TTS维度级元评估基准,测试发现MOS预测器聚焦声学信号质量,Audio-LLM评估器检测能力具选择性且依赖提示,两类方法均难捕捉语言结构化语音错误,相关资源已公开。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08942 2026-08-11 cs.CL 新提交 86%

Same Question, Different Answer? Measuring and Mitigating Prompt Privilege for Equitable AI Access

相同问题,不同答案?衡量与缓解提示特权以实现公平的AI访问

Lier Jin, Lan Hu, Binqi Shen, Hanyu Cai, Yuting Xin

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 该研究提出统一框架,引入PES指标与PET智能体,在MedQA基准上验证了提示特权的存在,PET可消除该差异,提升AI访问公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08700 2026-08-11 cs.AI 新提交 86%

PluginEval: A Diagnostic Benchmark for Fine-Grained Error Attribution in Function Calling

PluginEval:用于函数调用细粒度错误归因的诊断基准

Dongjie Xu, Julius, Hanchi Dong, Minghua Tang, Yuxuan Sun, Ziwei Nie, Zicheng Liu, Dujun Qing, Jiajie Xu

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 PluginEval是缓解现有函数调用基准局限的两阶段诊断基准,可细粒度归因错误,评估显示不同模型在难度级别和错误类别中存在性能差异,且其LLM判断器与人类标注一致性良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07641 2026-08-11 cs.CL 新提交 86%

SurveyReview: A Reviewer-Aligned Benchmark for Survey Evaluators

SurveyReview:面向综述评估者的审稿人对齐基准

Yuheng Zhang, Yuanchun Wang, Fanjin Zhang, Ruyu Zhao, Juanzi Li, Jie Tang, Jing Zhang

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对现有LLM评估综述未与人类审稿人对齐的问题,提出SurveyReview基准及SurveyAlign基线,大幅提升自动评估与人类审稿人的对齐程度,为该领域提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30412 2026-08-11 cs.CY cs.AI 版本更新 86%

Can LLMs Rank? A Tale of Triads and Triage

LLM能排序吗?三元组与分诊的故事

Gaurab Pokharel, Shafkat Farabi, Patrick J. Fowler, Sanmay Das

机构 * Virginia Tech(弗吉尼亚理工大学) Washington University in St. Louis(圣路易斯华盛顿大学)

专题命中 评测与基准 :LLM(title_cn,summary_cn);分类 cs.AI

AI总结 研究LLM作为排序裁判的可靠性,提出用循环三元组计数和排序距离度量一致性,并在无家可归者住房分配和急诊分诊任务中验证。

Comments Accepted to the Ninth AAAI/ACM Conference on AI, Ethics, and Society (AIES 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29139 2026-08-11 cs.AI cs.GR cs.HC 版本更新 86%

SciVisAgentBench: A Benchmark for Evaluating Scientific Data Analysis and Visualization Agents

SciVisAgentBench:用于评估科学数据分析和可视化代理的基准测试

Kuangshi Ai, Haichao Miao, Kaiyuan Tang, Nathaniel Gorski, Jianxin Sun, Guoxi Liu, Helgi I. Ingolfsson, David Lenz, Hanqi Guo, Hongfeng Yu, Teja Leburu, Michael Molash, Bei Wang, Tom Peterka, Chaoli Wang, Shusen Liu

机构 * University of Notre Dame(圣母大学) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室) University of Utah(犹他大学) University of Nebraska–Lincoln(内布拉斯加大学林肯分校) The Ohio State University(俄亥俄州立大学) Argonne National Laboratory(阿贡国家实验室) Anthropic PBC

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出SciVisAgentBench,一个用于评估科学数据可视化代理的基准测试,涵盖四个维度,包含108个案例,结合LLM和确定性评估器进行多模态评估,揭示代理能力差距。

Comments IEEE Transactions on Visualization and Computer Graphics (IEEE VIS '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02594 2026-08-11 cs.AI 版本更新 86%

ACEvo: Adversarial Co-Evolution of Problem Distributions and Solvers for Combinatorial Optimization

ACEvo:面向组合优化的问题分布与求解器的对抗协同进化

Ruibo Duan, Yuxin Liu, Haoran Ye, Xinyao Dong, Zhiqiang Xu, Chenglin Fan

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出ACEvo框架,通过LLM迭代协同进化启发式求解器与问题生成器,在TSP等组合优化问题上生成更具挑战性的实例分布,所得求解器在分布偏移下性能优于静态训练基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18695 2026-08-11 cs.CV cs.AI cs.LG eess.IV 版本更新 86%

Attributes Should Come from Images, Not Class Names: Distribution-Conditioned Attribute Selection for Vision-Language Models

属性应来自图像,而非类名:视觉语言模型的分布条件属性选择

Gautam Rajendrakumar Gare, Jia Shi, Zhiqiu Lin, Deepak Pathak, John Galeotti, Deva Ramanan

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.AI、cs.LG

AI总结 研究视觉语言模型可解释零样本分类,指出基于类名的描述符视觉证据不足。提出从目标图像集选属性的方法,该方法提升了准确率,性能优于CoOp,用时短,所选属性还能描述数据分布,是一种有效的分布条件属性选择策略。

Comments Accepted at the PFATCV Workshop, ECCV 2026. Project page: https://ggare-cmu.github.io/AttributeSelect/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08277 2026-08-11 cs.NI 新提交 86%

WirelessOpsAgent: A Benchmark and Agent Design for Action Assurance in Wireless Networks

WirelessOpsAgent:无线网络行动保障的基准测试与智能体设计

Zijian Lu, Yiping Zuo, Hao Xu, Weicong Chen, Xin He, Jiajia Guo, Shi Jin

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 针对现有无线网络运维LLM智能体基准未测试执行阶段支持检查的问题,本文提出WirelessOptBench基准与WirelessOpsAgent智能体,使后者在600片段评估中精确行动准确率达0.983,不安全执行率大幅下降。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07517 2026-08-11 cs.HC cs.CL stat.AP 新提交 85%

The Judge Knows When It Knows: Calibrated Abstention for LLM-Based A/B-Test Prediction

法官知道自己何时知晓:基于大语言模型的A/B测试预测的校准弃权(不执行)

Tyler Dooskin, Squoosh Technical Staff

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL

AI总结 该研究探究多模态LLM能否仅通过网页截图预测A/B测试结果,发现Gemini 3 Flash法官表现不佳,提出投票边际关卡隔离置信判断可提升性能,还在人类中重现了共识与真实结果脱节的现象,并发布了相关研究资源。

Comments 15 pages. Pre-registered experimental program with a public, tiered claims ledger; includes powered negative results, a label-validity audit, a cross-judge shared-prior measurement (n_eff ~ 2 of 16 votes), and a first-party 15-expert human baseline. Pre-registrations, statistical harness, human responses, and the full experiment ledger are released

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07490 2026-08-11 cs.HC cs.AI 新提交 85%

Experience-Sensitive Game Learning: A Behavioral Study of Humans and Language Agents

经验敏感型游戏学习:人类与语言智能体的行为研究

Yingying Guo, Zhuoxuan Ju, Ruibo Ming, Ruicheng Feng, Jinjin Gu

专题命中 评测与基准 :language agent(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究构建经验敏感型游戏学习框架,通过交互式游戏及相关指标分析人类与自进化语言智能体的游戏决策行为,发现人类会稳定转向全局策略,而自进化智能体的行为转变仍有局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12843 2026-08-11 cs.CL 版本更新 85%

Growing Pains: Extensible and Efficient LLM Benchmarking Via Fixed Parameter Calibration

成长之痛:通过固定参数校准实现可扩展且高效的LLM基准测试

Eliya Habba, Itay Itzhak, Asaf Yehudai, Yotam Perlitz, Elron Bandel, Michal Shmueli-Scheuer, Leshem Choshen, Gabriel Stanovsky

机构 * The Hebrew University of Jerusalem(海法大学) IBM Research(IBM研究院) MIT(麻省理工学院) Technion(技术学院) Allen Institute for AI(人工智能研究院)

专题命中 评测与基准 :LLM(title,title_cn);language model(abstract);分类 cs.CL

AI总结 本文提出基于多维项目反应理论的框架,利用锚定项目校准新基准,保持原有参数固定,实现随时间扩展基准测试的同时保持评分可比性,且评估成本恒定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18852 2026-08-11 cs.CL 版本更新 85%

FanarGuard: A Culturally-Aware Moderation Filter for Arabic Language Models

FanarGuard: 一种文化感知的阿拉伯语言模型审查过滤器

Masoomali Fatehkia, Enes Altinisik, Husrev Taha Sencar

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 FanarGuard是一种双语审查过滤器,通过评估阿拉伯语和英语中的安全性和文化对齐性,提升内容审查的准确性与文化敏感性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08822 2026-08-11 cs.AI cs.CL 新提交 85%

Automated Generation of Complexity-Validated Decision Scenarios Using Large Language Models

利用大语言模型自动生成经复杂度验证的决策场景

Abdalla Doleh, Toni Somers, Ratna Babu Chinnam

机构 * Wayne State University(韦恩州立大学)

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 本研究针对手动生成决策场景的缺陷,开发了基于大语言模型的自动化流水线,生成并验证了4238个多领域场景,证实其具备良好心理测量学特性,可用于AI系统认知评估。

Comments 38 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07688 2026-08-11 cs.AI cs.CL cs.CR cs.HC cs.MA 新提交 85%

IntelliAudit: Using Large Language Models to Evaluate Audit Controls

IntelliAudit:使用大语言模型评估审计控制

Allison Wilson, Sina Moradi Sabet, Diar Shakimov, Panteha Shahrivar, Mohammad Reza Bagheri, Dean Konenkamp, Mohammad A. Tayebi

机构 * Coca-Cola(可口可乐公司) Telus(德达斯电信公司)

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 本文提出基于检索的多智能体系统IntelliAudit,用于辅助IT审计证据评估,在ISO/IEC 27001上的评估显示其可支持审计工作,需作为决策支持工具使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23999 2026-08-11 cs.CR 版本更新 85%

ContainmentBench: Trace-Based Evaluation of Post-Exposure Containment in Tool-Using LLM Agents

ContainmentBench:基于跟踪的工具使用大型语言模型代理注入后遏制评估

Wenhao Lan, Shan Li, Meiqi Wu, Xinhua Lai, Junbin Yang, Haihua Shen

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究针对工具使用的大型语言模型代理注入后遏制评估问题,引入ContainmentBench基准,分别测量端点策略合规性等。通过对Qwen2.5 - 7B - Instruct研究发现,终端策略标签不充分,评估应分别报告多方面证据,还给出不同策略的工作流程完成率等结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08239 2026-08-11 cs.LG cs.CL 新提交 84%

The Replay Gap: Static Evaluation of Model Switching in LLM Agents Scores the Wrong World

重放差距:大语言模型智能体中模型切换的静态评估评估的是错误的世界

Ashritha Gonuguntla

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.LG;language model(comments)

AI总结 该研究发现大语言模型智能体的模型切换静态评估基于错误假设,通过分支展开实验证明模型交换会导致轨迹分歧,重放评估无法准确预测结果,发布了相关工具与轨迹。

Comments 8 pages, 3 figures. Accepted at the Conference on Language Modeling 2026. Code: https://github.com/AshrithaG/replay-gap Data: https://huggingface.co/datasets/ashritha0907/replay-gap-trajectories

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08830 2026-08-11 cs.AI 新提交 84%

PROSLEX: A Novel Dataset for Expert-Annotated Legal Statute Prediction for Indian Judiciary

PROSLEX:印度司法领域专家标注的法律条文预测新型数据集

Subinay Adhikary, Upal Bhattacharya, Vivek Kumar Singh, Anurag Sharma, Shubham Kumar Nigam, Suvasis Das, Shouvik Kumar Guha, Koustav Rudra, Kripabandhu Ghosh

机构 * IISER Kolkata(印度科学教育与研究学院加尔各答分校) Utrecht University(乌得勒支大学) IIT Kharagpur(印度理工学院克勒格布尔分校) University of Birmingham Dubai(伯明翰大学迪拜分校) WBNUJS(西孟加拉邦国家法律大学)

专题命中 评测与基准 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn);prompting(abstract);分类 cs.AI

AI总结 本文针对法律条文预测研究中缺乏可解释性的问题,构建印度司法领域专家标注的PROSLEX数据集,评估多种提示策略,为可解释法律AI提供基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07862 2026-08-11 cs.CL 新提交 84%

SurakshaEval: An Indic Safety Benchmark for Multilingual LLMs

SurakshaEval:面向多语言大语言模型的印度语安全基准

Debopriyo Banerjee, Kapil Rajesh Kavitha, Angana Borah, Xudong Han, Yuxia Wang, Parameswari Krishnamurthy, Utkarsh Agarwal, Atharva Kulkarni, Swaran Lata, Ayush Munot, Dhruv Sahnan, Aaryamonvikram Singh, Preslav Nakov, Monojit Choudhury

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对现有LLM安全评估数据集忽视印度语言文化安全风险的问题,本文推出SurakshaEval基准,测试发现多语言LLM在印度语场景下安全表现不足,凸显了适配区域数据的安全评估框架的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08722 2026-08-11 cs.LG cs.AI 新提交 84%

Gaming Without an Attacker: Benchmark Fingerprinting in LLM-Driven Search Under Selection Pressure

无攻击者的博弈:选择压力下大语言模型驱动搜索中的基准指纹识别

Víctor Gallego

机构 * Komorebi AI Technologies(Komorebi人工智能技术公司)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI、cs.LG

AI总结 本文研究发现,在带反馈的进化循环中,前沿LLM提出的GPU内核会对评估配置进行指纹识别,导致30%的分布内胜出案例无法迁移,进而给出失败分类与测量设计指导。

Comments Published as a conference paper at AI Measurement Science Workshop @ COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16941 2026-08-11 cs.LG cs.AI 版本更新 84%

FoMoH: A clinically meaningful foundation model evaluation for structured electronic health records

FoMoH:针对结构化电子健康记录的具有临床意义的基础模型评估

Vincent Jeanselme, Zilin Jing, Aparajita Kashyap, Chao Pang, Florent Pollet, Young Sang Choi, Xinzhuo Jiang, Yuta Kobayashi, Yanwei Li, Sara Matijevic, Karthik Natarajan, Shalmali Joshi

机构 * Department of Biomedical Informatics Columbia University(生物医学信息学系 哥伦比亚大学)

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本研究构建含14项临床预测任务的基准,评估6种EHR基础模型,发现其在标注数据有限时区分性能更优、群体公平性更好,但低患病率场景表现差、跨机构可迁移性不足。

详情

展开后加载摘要…

URL PDF HTML 收藏