arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2798 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2798 篇

2606.25984 2026-07-10 cs.AI cs.LG 新提交 91%

InvestPhilBench: A Multi-Layer Benchmark for Evaluating Large Language Model Procedural Reasoning in Expert Investment Philosophy

InvestPhilBench: 评估大型语言模型在专家投资哲学中程序性推理的多层动态基准

Mingguang Chen, Bo Qu

机构 * University of California, Riverside (UCR)(加州大学河滨分校) Illinois Institute of Technology (IIT)(伊利诺伊理工学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn);分类 cs.AI、cs.LG

AI总结 提出InvestPhilBench基准,通过八层认知层级和自动化评分管道,揭示前沿LLM在投资决策程序推理中的复合评分饱和但程序性缺陷隐藏的问题。

Comments 65 pages, 6 figures, 26 tables. Benchmark, data, and code released. v0.6 release; preliminary empirical study (de-confounded multi-model leaderboard forthcoming)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06963 2026-07-09 cs.CR cs.AI cs.CL 新提交 91%

Large Language Models (LLMs) and Generative AI in Cybersecurity and Privacy: A Survey of Dual-Use Risks, AI-Generated Malware, Explainability, and Defensive Strategies

大型语言模型(LLMs)和生成式人工智能在网络安全与隐私中的应用:两用风险、人工智能生成的恶意软件、可解释性及防御策略综述

Kiarash Ahi, Saeed Valizadeh

机构 * Virelya Intelligence Research Labs(Virelya智能研究实验室) Google(谷歌)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 综述大型语言模型和生成式人工智能在网络安全中的应用,涵盖两用风险等多方面。通过回顾众多资料及实际案例研究,给出负责任部署建议与安全路线图,为应对人工智能驱动的网络安全挑战提供关键参考。

Comments Invited survey paper. 10 pages, 5 figures, 2 tables

Journal ref IEEE 6th Silicon Valley Cybersecurity Conference (SVCC), San Francisco, CA, USA, 2025, pp. 1-10

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06482 2026-07-08 cs.CL cs.AI 新提交 91%

Data Analysis in the Wild: Benchmarking Large Language Models Against Real-World Data Complexities

野外数据分析:针对现实世界数据复杂性对大语言模型进行基准测试

So Hasegawa, Shailaja Keyur Sampat, Lei Liu, Wei-Peng Chen

机构 * Fujitsu Research of America(富士通美国研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 针对大语言模型在数据分析基准测试无法反映现实情况的问题,引入DataGovBench基准测试,含表格问答和表格洞察两个任务,通过实验发现现有模型有性能差距,为推进相关研究提供挑战基准。

Comments 29 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03377 2026-07-07 cs.CL cs.AI 新提交 91%

Spectral Signatures of Large Language Models

大语言模型的频谱特征

Zhuoying Zhang, Ishan V. Prasad, Yuanzhe Hu, Zihang Liu, Hengrui Luo, Pu Ren, Yaoqing Yang

机构 * Rice University(莱斯大学) Dartmouth College(达特茅斯学院) Georgia Institute of Technology(佐治亚理工学院) University of California, Berkeley(加州大学伯克利分校) Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);post-training(abstract)

AI总结 针对大规模管理和量化大语言模型的挑战,采用基于重尾自正则化理论的频谱形状指标,以权重经验谱密度形状信息为模型频谱特征,可用于模型谱系追踪等,还构建语料库进行基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31250 2026-07-01 cs.CL cs.AI 新提交 91%

Probing Stylistic Appropriation using Large Language Models: An Evaluation Framework for Copyright Infringement under EU Law

使用大语言模型探测风格挪用:欧盟法律下版权侵权的评估框架

Noah Scharrenberg, Chang Sun

机构 * Maastricht University(马斯特里赫特大学) Contractuo

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出PSALM框架,通过十个评估器将欧盟版权法标准操作化,发现指令调优模型在接触语料前已有非平凡风格相似性,微调导致系统性风格挪用,负偏好优化可降低但残留可检测风格模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26101 2026-06-26 cs.CL cs.AI 新提交 91%

Know2Guess: A Contamination-Aware Multi-Zone Benchmark for Knowledge-Boundary Evaluation in Large Language Models

Know2Guess: 一种面向大型语言模型知识边界评估的污染感知多区域基准

Renwei Meng, Bowen Zhang, Jian Wang, Xican Wang, Haoyi Wu, Xuanyan Qiu, Shengan Yang

机构 * Anhui University(安徽大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出一种污染感知多区域基准,通过冻结构建时标签测量从可回答知识到应弃权未知的转变,评估模型在回答与弃权间的可靠性。

Comments 16 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24381 2026-06-24 cs.CL cs.AI 新提交 91%

On the Stability of Prompt Ranking in Large Language Model Evaluation

论大语言模型评估中提示排序的稳定性

Shaoshuai Du, Penghao Liang, Yixian Shen, Chuanqi Shi, Hang Zhang, Lun Wang

机构 * University of Amsterdam(阿姆斯特丹大学) Northeastern University(东北大学) University of California San Diego(加州大学圣迭戈分校) Duke University(杜克大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 研究提示排序在常见评估变化下的稳定性,发现顶级提示常变导致选择不可靠,提出基于置信下限的稳定性感知选择策略以提高鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20572 2026-06-23 cs.CL cs.AI 新提交 91%

Investigating Linguistic Steering: An Analysis of Adjectival Effects Across Large Language Model Architectures

探究语言引导:跨大语言模型架构的形容词效应分析

Lars Malmqvist

机构 * Research and Implementation(研究与实现)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);prompting(abstract)

AI总结 本研究利用Shapley值量化形容词对模型性能的引导效应,发现少量形容词具有不成比例的强大影响,但效果非普适;跨模型分析揭示“家族效应”,且形容词的引导方向高度依赖于句法角色和位置。

Comments Accepted for TMLR, https://openreview.net/forum?id=xN7NYpQeBm

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16137 2026-06-16 cs.CL cs.AI 新提交 91%

XAI-Grounded Explanation Generation for Speech Deepfake Detection with Training-Free Multimodal Large Language Models

基于XAI的语音深度伪造检测解释生成:使用免训练多模态大语言模型

Yupei Li, Qiyang Sun, Xiaoliang Wu, Chenxi Wang, Berrak Sisman, Björn W. Schuller

机构 * Imperial College London(帝国理工学院) Technical University of Munich(慕尼黑工业大学) University of Southampton(南安普顿大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 针对语音深度伪造检测缺乏可解释性的问题,提出一种免训练框架,融合XAI证据与多模态大语言模型,生成基于证据的特定解释,在PartialSpoof数据集上内部准确率提升超45%。

Comments Accepted at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12191 2026-06-11 cs.CL cs.AI 新提交 91%

Agentic Environment Engineering for Large Language Models: A Survey of Environment Modeling, Synthesis, Evaluation, and Application

面向大语言模型的智能体环境工程:环境建模、合成、评估与应用综述

Jiachun Li, Zhuoran Jin, Tianyi Men, Yupu Hao, Kejian Zhu, Lingshuai Wang, Dongqi Huang, Longxiang Wang, Shengjia Hua, Lu Wang, Jinshan Gao, Hongbang Yuan, Ruilin Xu, Kang Liu, Jun Zhao

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文从环境工程生命周期出发,系统综述了智能体环境的建模、合成、评估与应用,涵盖八种属性与领域、两种合成范式、四种智能体演化路径及三种环境演化范式。

Comments 63 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14626 2026-08-18 cs.CL cs.AI cs.LG 新提交 90%

LLM Safety Alignment in Low-Resource Languages: A Systematic Literature Review

低资源语言下的大语言模型安全对齐:系统文献综述

Valdini Douglace Lemofouet, Blessing Ngozi Uzor, Paula Chikaodinaka Anyanwu, Danielle Blanche Kapsa, Sukairaj Hafiz Imam, P Sam Sahil, Abigail Oppong, Tassallah Abdullahi, Clemencia Siro, Idris Abdulmumin, Seid Muhie Yimam, Shamsuddeen Hassan Muhammad

机构 * African Institute for Mathematical Sciences (AIMS)(非洲数学科学研究所) Bayero University Kano(卡诺贝罗大学) Brown University(布朗大学) Centrum Wiskunde & Informatica(数学与计算机科学中心) University of Pretoria(比勒陀利亚大学) University of Hamburg(汉堡大学) Imperial College London(伦敦帝国学院)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过PRISMA 2020方法学开展系统文献综述,分析50项相关研究,揭示低资源语言下LLM存在多语言安全差距,提出安全对齐分类,并给出未来研究方向。

Comments The paper was accepted at LM4UC workshop organize by IJCAI. I added a screenshot of the decision (Open Review)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11454 2026-08-13 cs.SE 新提交 90%

Simplifying Requirements Engineering in the Context of the LGPD: An LLM-Based Investigation

在LGPD背景下简化需求工程:一项基于大语言模型(LLM)的研究

Cinara Gomes de Melo Carneiro, Renato de Freitas Bulcão Neto

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本研究针对隐私法规合规转化为软件需求的挑战,探究LLM在LGPD框架下简化需求工程的可行性,提出利用法规自动生成用户故事和验收测试场景的方法,验证其能从软件初期确保合规。

Comments The document consists of 12 pages and includes 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07920 2026-08-11 cs.CV 新提交 90%

Forged Peer Judgments Mislead Multimodal LLM Judge Panels: Source-Blind Anchoring and Panel-Consensus Verification

伪造的同行判断会误导多模态大语言模型(LLM)评判小组:无来源锚定与小组共识验证

Yang Shu

机构 * Zhejiang University(浙江大学)

专题命中 评测与基准 :LLM(title,title_cn);language model(abstract)

AI总结 研究发现多模态LLM评判小组存在无来源锚定的文本攻击面,伪造同行判断可误导判决,提出的小组共识验证方法能有效阻断此类攻击并降低损害。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07881 2026-08-11 cs.AI cs.CL cs.IT cs.LG math.IT 新提交 90%

GRACE: LLM-Grounded Semantic Metric Spaces for Scalable Mixed-Data Clustering

GRACE:用于可扩展混合数据聚类的大语言模型(LLM)基础语义度量空间

Zihua Yang, Zhencheng Xie, Junyang Chen, Liang Xie, Yiqun Zhang, Mengke Li, Yang Lu

机构 * Guangdong University of Technology(广东工业大学) Tsinghua University(清华大学) Peking University(北京大学) Shenzhen University(深圳大学) Xiamen University(厦门大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 针对混合数据聚类中语义丰富度与可扩展性的矛盾,提出GRACE框架,通过多视角LLM查询实现一次性语义嵌入,兼顾可扩展性与聚类性能,优于11种对比方法。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02507 2026-07-03 cs.AI cs.CL cs.LG cs.MA 新提交 90%

What LLM Agents Say When No One Is Watching: Social Structure and Latent Objective Emergence in Multi-Agent Debates

当无人注视时LLM智能体在说什么:多智能体辩论中的社会结构与潜在目标涌现

Arman Ghaffarizadeh, Danyal Mohaddes, Aliakbar Izadkhah, Shahriar Noroozizadeh

机构 * Independent Researcher(独立研究员) Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出双通道辩论框架,研究社会结构(角色、受众、关系)如何导致LLM智能体在公开与私下(OTR)表达中产生系统性分歧,揭示潜在目标的涌现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20661 2026-06-23 cs.AI cs.CL cs.LG 新提交 90%

From Knowing to Acting: Benchmarking Self-Awareness Capability of LLM Agents

从知道到行动:基准测试LLM代理的自我意识能力

Yifan Li, Shengbin Yue, Boyu Feng, Jinhu Qi, Bo Ke, Zixing Song, Hongru Wang, Zhongyu Wei, Irwin King

机构 * The Chinese University of Hong Kong(香港中文大学) Fudan University(复旦大学) University of Edinburgh(爱丁堡大学) Tencent(腾讯) University of Bristol(布里斯托大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出KAPRO框架和KAware数据集,通过解耦元认知判断与自主执行,评估LLM代理的自我意识能力,发现其与任务成功强相关但在内部能力场景中下降,开源模型易过度使用工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16183 2026-06-16 cs.LG cs.AI cs.CL 新提交 90%

LLM-Powered Virtual Population for Demand Simulation and Pricing

基于LLM的虚拟人群用于需求模拟与定价

Chengpiao Huang, Kaizheng Wang

机构 * Columbia University(哥伦比亚大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出一种LLM驱动的虚拟人群模型,通过混合客户画像和LLM评估购买概率,生成需求分布,支持风险感知定价,在H&M数据集上表现最优。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15136 2026-06-16 cs.PF 新提交 90%

LLMs have Visualization Literacy: Now What? Experiments Exploring LLM Visualization Evaluation Capabilities

LLMs 具备可视化素养:现在呢?探索 LLM 可视化评估能力的实验

Christian Seto, Jacqueline Nguyen, Jiayi Hong, Ross Maciejewski

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 通过实验评估最新 LLM 在可视化素养、指令遵循和图形完整性方面的能力,发现其可视化素养超越人类,但在指令遵循和识别误导性可视化方面仍有不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14199 2026-06-15 cs.CL cs.AI cs.LG 新提交 90%

OdysSim: Building Foundation Models for Human Behavior Simulation

OdysSim: 构建人类行为模拟的基础模型

Xuhui Zhou, Weiwei Sun, Weihua Du, Jiarui Liu, Haojia Sun, Qianou Ma, Tongshuang Wu, Yiming Yang, Maarten Sap

机构 * Carnegie Mellon University, Language Technologies Institute(卡内基梅隆大学语言技术研究所)

专题命中 评测与基准 :foundation model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出OdysSim,通过SOUL分类法统一62个数据集和23个基准任务,采用混合训练、任务特定强化学习和专家蒸馏,构建8B参数行为基础模型OSim,在多数任务上超越前沿模型,并实现更类人输出和零样本迁移。

Comments 34 pages. Code: https://github.com/sunnweiwei/OdysSim ; Models and data: https://huggingface.co/collections/cmu-lti/odyssim

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14551 2026-08-18 cs.CL cs.DL cs.IR cs.LG 新提交 90%

Auxiliary uncertainty signals for LLM-assisted systematic review screening: a benchmark across eight Cohen drug-class reviews

用于大语言模型辅助系统评价筛选的辅助不确定性信号:八项Cohen药物分类综述的基准测试

Arya Rahgozar, Pouria Mortezaagha

机构 * University of Ottawa(渥太华大学) Ottawa Hospital Research Institute(渥太华医院研究所)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 该研究针对LLM辅助系统评价筛选的不确定性问题,提出BERT+GCN辅助分类器的不确定性信号,在8个Cohen药物分类数据集上验证了提示策略的效率,发现仅弃权路由为帕累托最优且LLM无法自我分类。

Comments 27 pages, 7 figures, 10 tables. Code, prompts, and cached LLM responses at https://github.com/rahgoar/LR-Spectral-BERTGCN-Topological-Undecidability-in-Clinical-AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08467 2026-08-11 cs.AI cs.CL cs.IR 新提交 90%

LLM within MCP Matters: Measuring Inefficient Resource Utilization Driven by LLMs

MCP中的大语言模型很重要:测量由大语言模型驱动的低效资源利用

Minhan Cho, Soyoung Park, Kihyeon Jeong, Byeongkyu Jeon, Daejin Choi, Jinyoung Han

机构 * Sungkyunkwan University(成均馆大学) National Assembly Research Service(国会研究服务处) AlphaBridge(阿尔法桥公司) Ewha Womans University(梨花女子大学)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对24个LLM开展54000次试验,发现MCP中服务器嵌入的参考数据会因LLM偏好导致低效资源利用,提出需将服务器指令置于客户端LLM工具选择之前的改进方向。

Comments 4 pages, 1 table. Accepted at the AgentSearch Workshop at SIGIR 2026, Melbourne, Australia (non-archival). Code and data: https://github.com/rabqatab/llm-in-mcp-matters

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19208 2026-08-21 cs.CL cs.CV 新提交 90%

When Irrelevant Text Matters: Affine Margin Shifts in Multimodal Large Language Models

当无关文本起作用时:多模态大语言模型中的仿射间隔偏移

Yinfeng Wang, Zhiyuan Yao, Zheren Fu, Lei Zhang, Zhendong Mao

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文研究多模态大语言模型(MLLMs)中任务无关文本对视觉判断任务的影响,发现其会使模型决策间隔发生可预测的仿射变换,为提升模型对噪声上下文的鲁棒性提供了诊断基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16893 2026-08-19 cs.CY cs.AI 新提交 90%

A Framework for Using and Evaluating LLMs as Surrogate Experts in Security Surveys: Reliability, Bias, and Implications

在安全调查中使用和评估大语言模型(LLM)作为代理专家的框架:可靠性、偏差及启示

Despoina Giarimpampa, Roland Meier, Tegawendé F. Bissyandé, Vincent Lenders, Jacques Klein

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究提出了评估LLM作为安全调查代理专家的框架,发现LLM虽内部一致但与专家响应存在系统性偏差,可用于试点和假设生成但不能替代专家征询。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15145 2026-08-18 cs.AI 新提交 90%

ACTS-SQL: Agentic and Critic-Oriented Tree-Structured SQL Correctness with Large Language Models

ACTS-SQL:基于大型语言模型的面向智能体与评判器的树结构化SQL正确性校验

Xinmei Huang, Jie Song, Peng Li, Fuxin Jiang, Jing Zhang, Tieying Zhang, Jianjun Chen, Chenming Liu, Tao Yang, Maoyin Liu, Wenda Li, Hong Chen, Cuiping Li

机构 * Renmin University of China(中国人民大学) ByteDance Inc.(字节跳动公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出无训练框架ACTS-SQL,将SQL修正建模为计划引导的树结构化调试过程,集成执行校验与诊断工具,在BIRD-Critic基准及火山引擎TLS生产环境中均实现显著准确率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14179 2026-08-17 cs.AI 新提交 90%

Can Language Models Understand mmWave Data? Benchmarking Large Language Models for mmWave Radar-Based Human Understanding

语言模型能否理解毫米波数据?基于毫米波雷达的人类理解任务对大语言模型进行基准测试

Jeongwan Shin, Jaehyeon Kim, Donguk Ko, Jaeho Choi

机构 * DGIST(大邱庆北科学技术院) KAIST(韩国科学技术院) InnoCORE LLM

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本研究针对毫米波数据与大语言模型融合的研究空白,构建首个毫米波人类感知基准mmWave-QA,评估LLMs在该任务上的零样本推理潜力与视觉退化下的鲁棒性,为相关研究奠定基础。

Comments Accepted to CVPR 2026 Findings

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Findings, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13129 2026-08-14 cs.AI 新提交 90%

Numeracy in Large Language Models: Fundamental Limitations and Paths to Improvement

大型语言模型中的数字能力:基本局限与改进路径

Aoxin Ni

机构 * University of Chinese Academy of Sciences(中国科学院大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);foundation model(abstract);pretraining(abstract)

AI总结 本研究针对LLMs在基础数值任务中的不可靠性,提出数值基础框架(NGF)并结合三大基准评估前沿模型,给出改进数值能力的部署建议与研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07762 2026-08-11 cs.AI cs.CR 新提交 90%

Who Verifies the Benchmark? Decentralizing Trust in Large Language Model Evaluation

谁来验证基准?去中心化大语言模型评估中的信任问题

Sahil Pardasani, Madhusudan Singh

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.AI

AI总结 针对LLM基准测试的信任问题,该研究分析7种验证模型的身份感知偏差,提出基于区块链的提交-披露协议以实现去中心化、可验证的LLM评估。

Comments Accepted to International Conference on Quantum Enhanced AI and Secure Computing (QASC2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06955 2026-08-10 cs.AI cs.CY 新提交 90%

Critical Acclaim Orientation in Large Language Models: Evidence from Film Preference Elicitation

大语言模型中的评论赞誉导向:来自电影偏好诱导的证据

Jonghyun Jee, Aaron Shaw

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本研究以8种大语言模型为对象,通过200部电影的基准测试,发现模型普遍呈现评论赞誉导向,该导向随模型规模增强,且提示框架会影响评价排名。

Comments 12 pages, 2 figures, accepted to AIES 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04015 2026-08-06 cs.CL 新提交 90%

Transfer Learning for Named Entity Recognition of Classical Latin through LLM Prompting

通过大语言模型提示学习实现古典拉丁语命名实体识别的迁移学习

Callum Chan

机构 * University of Ottawa(渥太华大学)

专题命中 评测与基准 :LLM(title,abstract);prompting(title);large language model(abstract);language model(abstract)

AI总结 本文介绍渥太华大学团队通过对gemini-2.5-pro和claude-sonnet-4-5进行提示工程,利用跨语言迁移学习完成古典拉丁语NER任务,在EvaLatin 2026的两个NER子任务中均获第一。

Journal ref EvaLatin (LT4HALA@LREC), ELRA, May 2026, Palma De Majorque, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02915 2026-08-05 cs.AR cs.CL cs.SE 新提交 90%

LACE: Large Language Model Aided Multi-Agent Framework for Agile RISC-V Instruction Extension

LACE:用于敏捷RISC-V指令扩展的大语言模型辅助多智能体框架

Pingqing Zheng, Jiayin Qin, Fuqi Zhang, Zishen Wan, Shang Wu, Yu Cao, Caiwen Ding, Yang Katie Zhao

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.CL

AI总结 针对RISC-V指令扩展实现验证缓慢碎片化问题,提出LLM辅助多智能体框架LACE,可提升指令生成准确率并减少集成返工。

详情

展开后加载摘要…

URL PDF HTML 收藏