arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32271 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32271 篇

2403.08213 2024-10-23 cs.CL 90%

Can Large Language Models Identify Authorship?

Baixiang Huang, Canyu Chen, Kai Shu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,comments);分类 cs.CL

Comments Accepted to EMNLP 2024 Findings. The main paper is 9 pages long, with 16 pages total. The code, results, dataset, and additional resources are available on the project website: https://llm-authorship.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08851 2024-10-14 cs.CL 90%

Measuring the Inconsistency of Large Language Models in Preferential Ranking

Xiutian Zhao, Ke Wang, Wei Peng

专题命中 评测与基准 :language model(title,abstract);large language model(title,abstract);LLM(abstract);分类 cs.CL

Comments In Proceedings of the 1st Workshop on Towards Knowledgeable Language Models (KnowLLM 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.06824 2024-08-20 cs.AI 90%

The Geometry of Truth: Emergent Linear Structure in Large Language Model Representations of True/False Datasets

Samuel Marks, Max Tegmark

专题命中 评测与基准 :language model(title,abstract);large language model(title,abstract);LLM(abstract);分类 cs.AI

Comments Conference on Language Modeling, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.18376 2024-07-29 cs.HC cs.CL cs.CY cs.MM cs.SI 90%

Exploring Bengali Religious Dialect Biases in Large Language Models with Evaluation Perspectives

Azmine Toushik Wasi, Raima Islam, Mst Rafia Islam, Taki Hasan Rafi, Dong-Kyu Chae

专题命中 评测与基准 :language model(title,abstract);large language model(title,abstract);LLM(abstract);分类 cs.CL

Comments 10 Pages, 4 Figures. Accepted to the 1st Human-centered Evaluation and Auditing of Language Models Workshop at CHI 2024 (Workshop website: https://heal-workshop.github.io/#:~:text=Exploring%20Bengali%20Religious%20Dialect%20Biases%20in%20Large%20Language%20Models%20with%20Evaluation%20Perspectives)

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.10700 2024-04-30 cs.DL cs.CL cs.CY 90%

Topics, Authors, and Institutions in Large Language Model Research: Trends from 17K arXiv Papers

Rajiv Movva, Sidhika Balachandar, Kenny Peng, Gabriel Agostini, Nikhil Garg, Emma Pierson

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,comments);分类 cs.CL

Comments NAACL 2024. Data & code available at https://github.com/rmovva/LLM-publication-patterns-public

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.02588 2024-04-04 cs.CL 90%

Large Language Models for Expansion of Spoken Language Understanding Systems to New Languages

Jakub Hoscilowicz, Pawel Pawlowski, Marcin Skorupa, Marcin Sowański, Artur Janicki

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,comments);分类 cs.CL

Comments Code and info on model checkpoint are available at https://github.com/Samsung/MT-LLM-NLU

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.03788 2024-03-07 cs.CL 90%

PPTC-R benchmark: Towards Evaluating the Robustness of Large Language Models for PowerPoint Task Completion

Zekai Zhang, Yiduo Guo, Yaobo Liang, Dongyan Zhao, Nan Duan

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,comments);分类 cs.CL

Comments LLM evaluation, Multi-turn, Multi-language, Multi-modal benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.01767 2023-11-08 cs.CL 90%

PPTC Benchmark: Evaluating Large Language Models for PowerPoint Task Completion

Yiduo Guo, Zekai Zhang, Yaobo Liang, Dongyan Zhao, Nan Duan

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,comments);分类 cs.CL

Comments LLM evaluation, PPT task completion

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.05657 2023-10-10 cs.CL 90%

A Closer Look into Automatic Evaluation Using Large Language Models

Cheng-Han Chiang, Hung-yi Lee

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,comments);分类 cs.CL

Comments EMNLP 2023 findings (short paper). Code: https://github.com/d223302/A-Closer-Look-To-LLM-Evaluation/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24297 2026-08-26 cs.HC 新提交 89%

When AI "Works," When Does Help Begin?: Intergenerational Support Around Older Adults' LLM Usage

当AI“发挥作用”时,何时需要提供帮助?:围绕老年人使用大语言模型(LLM)的代际支持

Hyehyun Chu, Yuri Lee, Yeon Su Park, Saelyne Yang, Juho Kim

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 该研究针对6名老年人和7名年轻人开展定性研究,发现代际LLM支持存在信号不足、知识无法复用的问题,据此提出代际LLM支持的相关设计启示。

Comments 5 pages, 1 table, Accepted by CSCW 2026 workshop Growing Up (and Old) with AI: Co-Constructing the Future for Family-Centered AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24269 2026-08-26 cs.SE cs.CR 新提交 89%

Towards LLM-Enhanced Android Taint Analysis

面向大语言模型增强的Android污点分析

Nicholas Miazzo, Marco Alecci, Jordan Samhi, Jacques Klein, Eleonora Losiouk

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本文探究商用LLM能否有效推理Android应用的污点流,提出智能体交互策略,在DroidBench基准上Gemini-3 Flash的F1分数达0.96(优于FlowDroid的0.55),还能识别真实应用中FlowDroid未发现的潜在数据泄露,可补充传统静态污点分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23630 2026-08-26 cs.SE 新提交 89%

FPGAgent: An LLM-Assisted Framework for Autonomous HLS Code Generation and Verification in FPGA Environments

FPGAgent:一种用于FPGA环境中自主HLS代码生成与验证的大语言模型辅助框架

Tianyu Wang, Wenjie Wang, Jianguo Yao, Haibing Guan, Xijun Li

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 FPGAgent是首个经成熟基准验证的任务规范到可执行HLS生成的多智能体框架,可自主生成并验证FPGA的HLS代码,在HLS-Eval基准上可综合率等指标平均提升16.9%等,大幅提升了LLM生成HLS代码的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14646 2026-08-26 cs.SE cs.PL 版本更新 89%

ALT4Decompile: Inferring C-aligned Abstract Loop Tree for LLM-Based Binary Decompilation

ALT4Decompile:用于基于大语言模型的二进制反编译的C语言对齐抽象循环树推断

Yongpan Wang, Puzhuo Liu, Xin Xu, Siyuan Li, Yaowen zheng, Xiaodong Gu, Beijun Shen

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 ALT4Decompile通过构建C语言对齐的抽象循环树(ALT)弥合汇编与C的语法差距,微调适配ALT的LLM生成反编译代码,在多数据集上实现最优反编译效果,提升了测试用例通过率。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23282 2026-08-25 cs.SE 新提交 89%

From Natural Language Policies to Executable Obligations: A Verification Harness for Dependable In-Car LLM Agents

从自然语言策略到可执行义务:面向可靠车载大语言模型智能体的验证工具

Radouane Bouchekir, Damir Safin, Tomas Bueno Momcilovic

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本研究提出AgentGuardUtil工具,将车载LLM智能体纳入验证-修正循环,通过运行时策略编译器和25个确定性门等机制,保障智能体满足车载操作策略,提升任务可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22459 2026-08-25 cs.HC 新提交 89%

"I want to be pushed, I want to grow": Enabling social workers to design evaluations of LLM augmentation in their work

“我想要被推动,我想要成长”:让社会工作者能够设计工作中大型语言模型(LLM)增强的评估方案

Anna Kawakami, Chloe Qianhui Zhao, Renee Shelby, Fernando Diaz, Haiyi Zhu, Kenneth Holstein

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 本研究提出工作者驱动的AI测量方法,通过与19名校社工作者开展8场研讨会,设计LLM评估基准,验证其可区分6种先进LLM性能,该方法可作为自上而下AI评估的补充。

Comments Accepted at AIES 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01317 2026-08-25 cs.SE cs.CR 版本更新 89%

SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces

SABER:在有状态项目工作区中对LLM编码代理的操作安全性进行基准测试

Qi Hu, Yifeng Tang, Qinghua Wang, Lanyang Zhao, Pengji Zhang, Yuhao Qing, Xin Yao, Dong Huang, Lin Zhang, Zhuoran Ji

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出SABER基准,通过将模型置于真实代理式项目中并评估最终环境状态,来衡量LLM编码代理的操作安全性,发现最佳模型的有害安全违规率超过54%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21165 2026-08-24 cs.HC cs.CY 新提交 89%

Distilling Black-Box Machine Learning into a Small, Self-Explaining Language Model for Learning Analytics

将黑盒机器学习模型蒸馏为用于学习分析的小型自解释语言模型

Chenguang Pan, Airui Meng, Youmi Suk

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract)

AI总结 本研究提出两阶段微调流水线,将黑盒ML模型蒸馏为小型自解释LLM,可在普通设备上离线预测解释,在教育数据集上表现良好且数据不外泄。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20304 2026-08-21 q-fin.RM 新提交 89%

Calibration-Induced Degeneracy in LLM Financial Forecasting: An Audit-Trailed Case Study on Next-Day Market Risk

LLM金融预测中校准诱导的退化:关于次日市场风险的审计跟踪案例研究

Arin Mohanty

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 该研究以次日市场风险为对象,发现LLM金融预测中存在校准诱导的退化问题,提出校准可行性检查点,验证低成本基准的关键作用并终止了无效的全历史推理阶段。

Comments 13 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19235 2026-08-21 cs.DL 新提交 89%

Beyond Document Retrieval: Architectural Challenges When LLM Agents Query Structured Enterprise Data

超越文档检索:LLM智能体查询结构化企业数据时的架构挑战

Sheikh Nazib Ahmed

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 该研究针对企业智能体查询结构化数据的架构挑战,划分七个维度提出设计框架,经实验验证其可消除授权违规,还给出评估协议与开放问题。

Comments 9 pages, 4 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06635 2026-08-21 cs.IR 版本更新 89%

Can LLM Annotations Replace User Clicks for Learning to Rank?

大语言模型标注能否替代用户点击用于学习排序?

Lulu Yu, Keping Bi, Jiafeng Guo, Shihao Liu, Shuaiqiang Wang, Dawei Yin, Xueqi Cheng

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本文探究LLM标注能否替代点击数据用于学习排序,经多维度对比实验发现二者各有优劣,提出两种整合二者监督信号的训练策略可提升排序性能。

Comments 12 pages, 7 figures, accepted as a Full Research Paper at CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18490 2026-08-20 cs.MA 新提交 89%

Bayesian Partner Modelling enables Adaptive Replanning for LLM Coordination

贝叶斯伙伴建模支持大语言模型协同的自适应重规划

Harsh Goel, Aditya Sai Ellendula, Vaishnav Tadiparthi, Ehsan Moradi Pari, Hossein Nourkhiz Mahjoub, Sandeep P. Chinchali

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 该研究针对LLM多智能体协作中伙伴策略变化导致的重规划问题,提出BayesBeliefAgent方法,在Overcooked环境中显著缩小信念-行动差距并减少重规划次数。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17326 2026-08-20 cs.HC 版本更新 89%

Procedural Collapse: A Structural Account of Disengagement in LLM-Assisted Writing

程序崩溃:大语言模型辅助写作中脱离的结构解释

JaeWon Kim, Katelyn X. Mei

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本文针对学生使用LLM写作时脱离的问题,提出结构层面解释,指出当前界面引发程序崩溃,给出分解式交互等设计方向以支持AI辅助写作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29894 2026-08-19 quant-ph 版本更新 89%

LLM-Guided Evolutionary Search for Algebraic T-Count Optimization

基于LLM的引导进化搜索在代数T计数优化中的应用

Daniil Fisher, Valentin Khrulkov, Mikhail Saygin, Ivan Oseledets, Stanislav Straupe

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 本文提出VarTODD方法,通过分离代数重写系统与搜索策略,利用LLM引导的进化算法优化T计数,提升量子电路编译效率。

Comments 13 pages, 5 figures, 2 tables, 2 listings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16253 2026-08-18 stat.AP 新提交 89%

Second-Order Response Laws for LLM Judges: Debiased Estimation of Prompt Instability

LLM 评判者的二阶响应定律:提示不稳定性的无偏估计

Pengbin Feng, Chunlei Meng, Daozheng Qu, Zhilin Zhang, Haoran Liu, Jiekai Wu

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 该研究针对 LLM 评判者,推导了提示不稳定性的无偏估计量,分离提示内与跨提示差异,经实验验证校正估计更准确,可单独估计提示鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07519 2026-08-18 cs.CY 版本更新 89%

From Survey Personas to LLM Agents: A Generative Agent-based Simulation of Mobility Policy Preference Dynamics

从调查画像到大语言模型智能体:基于生成式智能体的流动性政策偏好动态模拟

Ali Torkayesh, Julia Offermann, Regina Gimpel, Linda Engelmann, Katrin Arning, Martina Ziefle, Sandra Venghaus

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本研究提出基于调查的生成式智能体建模框架,将德国514名调查受访者转化为LLM智能体,模拟公众对淘汰新型内燃机汽车的政策偏好动态,以助力行为实验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18245 2026-08-18 cs.SE cs.CR 版本更新 89%

Who Tests the Testers? Systematic Enumeration and Coverage Audit of LLM Agent Tool Call Safety

谁测试测试者?LLM代理工具调用安全的系统枚举与覆盖审计

Xuan Chen, Lu Yan, Ruqi Zhang, Xiangyu Zhang

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出SafeAudit框架,通过系统生成测试用例和规则阻力指标,发现现有测试未覆盖的20%不安全行为,揭示当前安全评估的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11804 2026-08-13 eess.AS cs.SD 新提交 89%

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching

MiDashengLM-Gen:基于大语言模型驱动的自回归流匹配的统一音频场景生成

Xingwei Sun, Heinrich Dinkel, Gang Li, Jiahao Mei, Yadong Niu, Zerui Han, Yuepeng Jiang, Jiahao Zhou, Lichun Fan, Jian Luan

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 MiDashengLM-Gen是首个端到端训练的通用文本到音频生成模型,通过结合LLM与每token条件流匹配,在Seed-TTS等基准上大幅提升语音可懂度,且支持多语言场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10885 2026-08-12 cs.CV 新提交 89%

ConfTriage: A Calibration-Aware LLM Triage Framework for Pulmonary Nodule Malignancy with Selective Specialist Deferral

ConfTriage:用于肺结节恶性程度分级的校准感知大语言模型分级框架,结合选择性专家模型转诊机制

Md Rabiul Islam, Samir Abdaljalil, Erchin Serpedin, Hasan Kurban

机构 * Texas A&M University(德克萨斯农工大学) Hamad Bin Khalifa University(哈马德·本·哈利法大学)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本研究提出ConfTriage框架,以校准感知LLM为核心结合专家DL后备模型,通过肺结节属性的自然语言表述实现分级,在LIDC-IDRI数据集上取得88.22%的F1分数与0.92的AUC,可高效处理多数病例并仅转诊不确定病例,为医疗决策支持提供了新路径。

Comments 14 pages, 8 figures. Currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07635 2026-08-11 stat.AP 新提交 89%

SurroPilot: An LLM-Assisted Platform for Heterogeneous Surrogate Endpoint Evaluation in Clinical Trials

SurroPilot:用于临床试验中异质性替代终点评估的大语言模型辅助平台

Xingyu Li, Peng Wei

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 SurroPilot是集成LLM与异质性中介框架的辅助平台,可通过自然语言交互完成临床试验异质性替代终点评估全流程,降低了相关方法的应用技术门槛。

Comments Submitted for journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05227 2026-08-07 cs.IR 新提交 89%

BioMedJImpact: A Comprehensive Dataset and LLM Pipeline for AI Engagement and Scientific Impact Analysis of Biomedical Journals

BioMedJImpact:用于生物医学期刊AI参与度及科学影响力分析的综合数据集与大语言模型(LLM)流程

Ruiyu Wang, Yuzhang Xie, Xiao Hu, Carl Yang, Jiaying Lu

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 本研究构建了生物医学领域的BioMedJImpact数据集,通过三阶段LLM流程提取AI参与度,分析发现作者规模与期刊影响力正相关、AI参与度仅在2019年子集与影响因子正相关,验证了LLM流程的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏