arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2798 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2798 篇

2606.08172 2026-06-09 cs.HC cs.AI cs.CY 新提交 92%

The Governance of Human-LLM Interaction: Safety Gating, Civility Steering, and Affective Default Lock-In

人类与LLM交互的治理:安全门控、文明引导与情感默认锁定

Manuele Reani, Hongjian Zhang, Hongyu Tian

机构 * School of Management and Economics, The Chinese University of Hong Kong, Shenzhen, China(管理学院与经济学学院,香港中文大学(深圳))

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究通过确定性多智能体评估流水线,测量LLM在长程对话中的提示可引导性和风格漂移,提出区分安全门控、文明引导和情感默认锁定的治理框架,揭示提供商对交互形式的控制对多元性、自主性和民主能动性的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08146 2026-06-09 cs.AI 新提交 92%

SAGE: An LLM-driven Self Reflective Agentic Framework for Fraud Detection

SAGE: 一种LLM驱动的自我反思智能体框架用于欺诈检测

Yichen Chen, Siying Li, Yuhang Liang, Lijun Wang, Renyang Liu

机构 * National University of Singapore(新加坡国立大学) University of Chinese Academy of Sciences(中国科学院大学) China Mobile Communications Group(中国移动通信集团有限公司)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出SAGE,首个端到端LLM驱动的多智能体欺诈检测框架,通过数据诊断树和自然语言梯度优化,在五个数据集上平均F1提升40.86%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07707 2026-06-09 cs.LG 新提交 92%

Decoding Naturalistic Emotion Dynamics from the Brain: An LLM-Enhanced Regression Framework

从大脑解码自然情感动态:一种LLM增强的回归框架

Lemei Zhang, Peng Liu, Hans Dahle Kvadsheim, August Sætre Aasvær, Shuer Ye, Reza Bonyadi, Maryam Ziaei, Jon Atle Gulla

机构 * NTNU(挪威科技大学) Kavli Institute for Systems Neuroscience, NTNU(挪威科技大学卡弗里系统神经科学研究所) Microsoft(微软)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出多目标回归框架,利用LLM从自然叙事中提取连续情感特征,结合动态功能连接和机器学习算法,实现从fMRI数据中解码连续情感轨迹,并揭示可解释的情感特异性脑网络拓扑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12324 2026-08-14 cs.CY cs.AI cs.CL 新提交 91%

When AI Is Your Pastor: A Benchmark for Theological Triage and Pastoral Guidance in Large Language Models

当AI成为你的牧师:大型语言模型的神学分诊与牧灵指导基准测试

Alex Chao

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI

AI总结 本研究推出FMG-Bench基准测试,评估LLM在基督教神学分诊与牧灵指导场景的表现,发现结构化框架可提升模型表现与鲁棒性,且该基准仅为测量工具。

Comments Full paper. Code and dataset are available at https://github.com/FideAI/fmg-bench and https://huggingface.co/datasets/FideAI/fmg-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01829 2026-07-03 cs.AI cs.CL 新提交 91%

Pre-Flight: A Benchmark for Evaluating Large Language Models on Aviation Operational Knowledge

Pre-Flight: 评估大型语言模型航空运营知识的基准

Alex Brooker, Tim Hughes

机构 * Airside Labs, London, United Kingdom(Airside Labs,伦敦,英国) Mahino Research, Christchurch, New Zealand(Mahino Research,基督城,新西兰)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出Pre-Flight基准,包含300道多选题,评估LLM在航空运营知识上的表现,发现最强模型准确率82.7%,低于专家水平的95%,表明领域特定评估的必要性。

Comments 9 pages, 1 figure, 2 tables. Benchmark available in inspect_evals (UKGovernmentBEIS/inspect_evals)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31718 2026-07-01 cs.CL cs.AI 新提交 91%

Cross-lingual Relation Extraction with Large Language Models: Zero-Shot, Few-Shot, and Fine-Tuned Evaluation on Romanian

跨语言关系抽取与大语言模型:罗马尼亚语的零样本、少样本和微调评估

Dragos-Mitrut Vasile, Elena-Simona Apostol, Stefan-Adrian Toma, Adrian Paschke, Ciprian-Octavian Truica

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract)

AI总结 通过自动翻译数据集结合大语言模型推理,研究罗马尼亚语的跨语言关系抽取,评估Gemma 4 31B在零样本、少样本和QLoRA微调下的性能,并与四种编码器基线对比。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21820 2026-06-23 cs.SI cs.AI cs.CL 新提交 91%

Generating Public Health Responses using Survey-Augmented Large Language Models

使用调查增强的大语言模型生成公共卫生响应

Leonardo Marciaga, Thuyen Pham, Julia Rezvani, Alina Hyk, Chunyang Liao, Konstantinos Mitsopoulos, Raffaele Vardavas

机构 * Hawk.illinoistech.edu(伊利诺伊理工学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract)

AI总结 研究利用大语言模型生成合成调查数据,以模拟真实人群在流行病中的健康决策行为,发现合成数据能复现人口统计和信念分布,但难以捕捉因素间的协变关系,不能替代真实调查。

Comments 24 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11965 2026-08-13 cs.SE 新提交 91%

Developing LLM-based Multi-Agent Systems in Software Engineering: A Mixed-Method Experience Report

在软件工程中开发基于大语言模型(LLM)的多智能体系统:一项混合方法经验报告

Mariama Celi Serafim De Oliveira, Motunrayo Osatohanmen Ibiyo, Marco Gianrusso, Claudio Di Sipio, Davide Di Ruscio, Phuong T. Nguyen

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文通过定量和定性分析,梳理软件工程中基于LLM的MAS现有框架,发现其基本组件覆盖良好但缺高级功能,摘要任务ROUGE分数无显著差异,为相关人员选框架提供指导。

Comments The paper has been peer reviewed and accepted for publication with the Empirical Software Engineering journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04907 2026-08-06 cs.CR cs.AR 新提交 91%

LLM-Assisted Detection and Repair of Hardware Security Vulnerabilities in Verilog Designs

基于Verilog设计的大语言模型辅助硬件安全漏洞检测与修复

Ethen Santana, Gabriel Gyaase, Hao Zheng

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract,abstract_cn);language model(abstract,abstract_cn)

AI总结 本文提出利用LLM从Verilog硬件设计中识别潜在CWE漏洞的方法,经单模块Verilog数据集迭代评估,证实LLM可增强硬件安全分析,为设计阶段漏洞识别提供自动化可扩展辅助。

Comments 6 Pages, 3 figures, technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01649 2026-08-04 cs.NI 新提交 91%

LLM-Driven Automated Reward Design for Reinforcement Learning-Based Routing in LEO Satellite Networks

面向低轨(LEO)卫星网络中基于强化学习(RL)的路由的大语言模型(LLM)驱动的自动奖励设计

Walter P. Casas, Nelson L. S. da Fonseca, and Carlos A. Astudillo

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出LARGE框架结合LLM生成与迭代在环仿真,为LEO卫星网络RL路由自动设计奖励,其性能可与专家基线相当,凸显该优化方法的潜力。

Comments This paper was accepted for publication at the IEEE Global Communications Conference (GLOBECOM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28710 2026-08-03 cs.CY 新提交 91%

Structured AI Demonstrations and Student LLM Use in Engineering Mechanics: Study Design and Preliminary Results

工程力学中的结构化AI演示与学生大语言模型(LLM)使用:研究设计与初步结果

Shuang Geng, Helen Lallos-Harrell, Jiya Ashar, Thomas J. McKenna, Annwesa Dasgupta, Caleb Farny, Emma Lejeune

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本研究针对工程力学课程设计了含九次结构化AI演示的方法论框架,结合调查工具分析学生LLM使用情况,为工程教育应对LLM融入提供实证研究基础。

Comments 47 pages, 10 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02333 2026-07-03 cs.SE cs.PL 新提交 91%

Guiding Human Validation of LLM-Generated Code via Verifiable Literate Programming

通过可验证的文字编程指导用户验证LLM生成的代码

Ziqi Yuan, Wenhao Lu, Hao Wu, Dunhong Jin, Chuan Wu

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出可验证文字编程框架,通过无歧义的自然语言文档作为中间层,结合细粒度不匹配检测和验证模块,帮助用户有效验证LLM生成代码,将pass@1从28.7%-73.2%提升至65.4%-93.5%。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01980 2026-07-03 cs.SE 新提交 91%

Epic-Organized vs. Requirement-Aligned Gherkin: An Empirical Evaluation of LLM-Based Acceptance Criteria Generation

史诗组织 vs. 需求对齐的 Gherkin:基于 LLM 的验收标准生成的实证评估

Shahbaz Siddeeq, Mateen Abbasi, Jussi Rasku, Zheying Zhang, François Christophe, Tommi Mikkonen, Pekka Abrahamsson

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 研究比较史诗组织与需求对齐的 LLM 生成 Gherkin 验收标准,发现史诗组织在正确性、可执行性和完整性上更优,语义覆盖率相当。

Comments Accepted for publication at the International Conference on Software Engineering of Emerging Technologies (SEET 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00403 2026-07-02 cs.HC cs.CR cs.CY 新提交 91%

A Penny for Your Prompts: Experiments Detecting and Mitigating LLM Usage by Survey Respondents

为提示付费:检测和减轻调查受访者使用LLM的实验

Zane Xu, Nathan Malkin

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本研究通过系列实验量化调查中LLM辅助响应的普遍性,发现其频率因平台而异(Prolific低于10%,MTurk超过80%),并测试了禁用复制粘贴等缓解措施,但未能显著提升数据质量。

Comments Published at SOUPS 2026 (Symposium on Usable Privacy and Security)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12212 2026-06-24 cs.SE cs.CR 新提交 91%

Mind your key: An Empirical Study of LLM API Credential Leakage in iOS Apps

注意你的密钥:iOS应用中LLM API凭证泄露的实证研究

Pinran Gao, Lingxiang Wang, Yi Liu, Kunpeng Liu, Fan Yang, Ying Zhang

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本研究首次系统调查iOS应用中LLM API密钥泄露问题,通过动态分析框架LLMKeyLens检测444个应用,发现282个存在可被利用的凭证泄露,并识别出三种泄露模式,三个月后仅28%完成修复。

Comments 12 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21629 2026-06-23 cs.SE 新提交 91%

Assessing Language Models for Salient Class Identification

评估语言模型在显著类识别中的表现

Bo Xiong, Chaoran Cai, Kaipeng Xiong, Chong Wang, Peng Liang

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn);SLM(abstract,abstract_cn);large language model(abstract)

AI总结 研究语言模型能否直接从代码提交中识别显著类,无需特征工程或图构建,发现小模型在少样本提示下性能接近大模型,可降低成本和隐私障碍。

Comments 22 pages, 1 images, 8 tables, Manuscript submitted to a Journal (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22219 2026-06-23 physics.soc-ph 新提交 91%

Lost in Aggregation: A Multi-Scale Diagnostic Benchmark for LLM Spatial Navigation

迷失在聚合中:LLM空间导航的多尺度诊断基准

Yuhan jiang, Peng Luo, Liqiu Meng

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出多尺度诊断基准,将迷宫导航分解为局部、节点和全局三个认知层次,评估LLM在空间推理中的失败位置,发现跨尺度聚合是主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17986 2026-06-17 cs.CR 新提交 91%

ShellGames: Speculative LLM-Driven SSH Deception

ShellGames: 基于LLM的推测性SSH欺骗

Umberto Salviati, Fabio De Gaspari, Mauro Conti, Luigi Vincenzo Mancini

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对LLM在欺骗系统中缺乏持久状态、输出不一致等问题,提出ShellGames,结合思维链、记忆管理、推测执行等五种技术,在正确性、一致性、状态跟踪和鲁棒性上显著优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16778 2026-06-16 cs.HC 新提交 91%

A comparison of human and LLM-simulated participants in a writing style task

人类与LLM模拟参与者在写作风格任务中的比较

Felix Gröner, Erin K. Chiou

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本研究通过对比30名人类参与者和GPT-4o模拟参与者在写作风格偏好推断任务中的表现,发现LLM存在偏见和缺乏深度,无法准确模拟人类行为,并强调了人类因素在评估人机交互系统中的重要性。

Comments 37 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15610 2026-06-16 cs.CL astro-ph.IM cs.AI cs.LG 新提交 91%

LLM Judges Have Dark Current: A Psychometric Datasheet for LLM-as-a-Judge Evaluation

LLM 裁判具有暗电流:LLM 作为裁判评估的心理测量数据表

Hiroyasu Usami, Keisuke Hara, Ayato Tsuboi, Naohiko Matsuda

机构 * Chubu University(中部大学) Mitsubishi Heavy Industries, Ltd., Research & Innovation Center(三菱重工业株式会社研究创新中心)

专题命中 评测与基准 :LLM(title,title_cn);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出裁判数据表协议,通过真空输入、表面变异、位置偏好等指标测量 LLM 裁判的暗电流和偏差,揭示其测量特性。

Comments 22 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13140 2026-06-16 cs.SI 新提交 91%

MIDSim: Simulating Multi-Channel Information Diffusion in Social Media with LLM-Powered Multi-Agent System

MIDSim: 基于LLM多智能体系统的社交媒体多渠道信息扩散模拟

Lexi Liu, Qi Cao, Yuanhao Liu, Huawei Shen, Xueqi Cheng

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出LLM驱动的多智能体系统,联合建模社交与算法曝光流,模拟多渠道信息扩散,在三个真实数据集上优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10095 2026-06-10 cs.HC 新提交 91%

LLM-Based Visualization Evaluation: How Well Do Literacy-Stratified Personas Approximate Human Judgments?

基于LLM的可视化评估:按识字分层的人物角色在多大程度上接近人类判断?

Swaroop Panda

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出识字分层LLM评估框架(LSLE),通过构建可视化识字角色并引导LLM模拟评估,与人类数据对比,发现其在早期设计探索中有效,但在总结性评估中系统失效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08588 2026-06-09 cs.SE 新提交 91%

LLM vs. Human Unit Tests: Fault Detection on Real Python Bugs

LLM vs. 人类单元测试:对真实 Python 错误的故障检测

Phouvadeth Vathana, Prapti Bhatt, Rishi Patel, Nasir U. Eisty

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 通过对比 LLM 生成与人工编写的单元测试在真实 Python 错误上的故障检测能力,发现 LLM 结合检索增强上下文可检测 69% 的故障,远超人工测试的 17.2%,且代码覆盖率相近,表明覆盖率不足以衡量故障检测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08283 2026-06-09 q-fin.PM q-fin.TR 新提交 91%

Macro Economists in the Machine: A Multi-Agent LLM Framework for Commodity-Related ETF Portfolio Construction

机器中的宏观经济学家:用于商品相关ETF投资组合构建的多智能体LLM框架

Yiqing Wang, Dehao Dai, Ding Ma, Kerui Geng

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 研究固定信息集和规则下,LLM在商品投资组合构建中能否增加价值。三种LLM策略(鹰派、鸽派、辩论)在夏普比率上优于规则代理,鹰派和辩论代理增益显著,但辩论代理未超越最佳单一代理,其贡献在于偏差校正。

Comments 45 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20106 2026-08-21 cs.CL 新提交 91%

OenoBench: A Wine-Domain Benchmark for Knowledge-Grounded Evaluation of Large Language Models

OenoBench:用于大型语言模型知识基础评估的葡萄酒领域基准

Nikita Khudov

机构 * DipWSET(葡萄酒与烈酒教育基金会文凭) StrategAI

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(title,abstract);large language model(title);分类 cs.CL

AI总结 本研究推出葡萄酒领域基准OenoBench,构建含3266道题的语料库,评估16种LLM配置,发现不同模型准确率差异及推理模式提升等规律并发布相关资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08143 2026-08-11 cs.IR cs.CL 新提交 91%

DS@GT ARC at Touché: Large Language Models for Retrieval-Augmented Debate

DS@GT ARC参与Touché任务:用于检索增强辩论的大型语言模型

Anthony Miyaguchi, Conor Johnston

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title);language model(title);prompting(abstract)

AI总结 DS@GT ARC参与Touché 2025检索增强辩论任务,采用三家提供商的六个主流LLMs通过检索增强提示流水线,发现多LLM评估者一致性无法可靠追踪官方评估目标,在质准则上差距最大。

Comments 12 pages, 4 figures. Accepted for publication in the CLEF 2026 Best of Labs proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03983 2026-08-05 cs.PL cs.AI 新提交 91%

Can Large Language Models Recover Semantic Optimization Opportunities That Compilers Miss?

大语言模型能否恢复编译器遗漏的语义优化机会?

Hailong Jiang, Feng Yu, Emran Hossain, Jianfeng Zhu, Mengfei Ren, Qiang Guan, Chunwei Xia

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 本文探究大语言模型能否恢复编译器遗漏的语义优化机会,推出含多类案例的可执行基准SeGaBench,实验显示最强模型生成的工件可实现较高正确率与加速比,证实LLM可作为编译器的补充语义提议者。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25425 2026-07-29 cs.AI cs.CR cs.CY 新提交 91%

The Disruptive Impact of Large Language Models on Capture the Flag Competitions and the Path Toward Fair Play

大语言模型对夺旗赛的颠覆性影响及公平竞赛之路

Michael Macaulay, Harmony Bouabid, Guo Gen Ang, Sasha Shaw

机构 * WMG, University of Warwick(华威大学制造工程学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract);分类 cs.AI

AI总结 研究大语言模型对夺旗赛的影响,通过混合方法绘制人机能力边界,发现社区对AI参赛分歧源于竞赛目的不明。为此提出含分层分组、抗LLM挑战设计等的保障框架及决策工具,其适用于网络安全中以结果证能力的场景。

Comments 20 pages, 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26541 2026-06-26 cs.LG cs.CY 新提交 91%

Can Large Language Models Reliably Code Qualitative Humanitarian Data? A Benchmark Study Against Human Expert Adjudication

大型语言模型能否可靠地编码定性人道主义数据?一项针对人类专家裁决的基准研究

Jerome Marston, Tino Kreutzer, Salomé Garnier, Ella Boone, Phuong N Pham, Patrick Vinck

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.LG

AI总结 本研究通过对比46个大型语言模型与人类专家在150份高保真合成人道主义转录本上的编码表现,发现多个LLM在结构化提示和推理配置下能达到与经验丰富人类编码员相当的可靠性,但聚合可靠性指标不足以指导部署,模型在识别间接表达的需求、类别外需求及保护相关问题方面存在差异。

Comments 34 pages, 4 tables, 3 Annexes

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22797 2026-06-23 cs.AI cs.CY cs.GT econ.GN q-fin.EC 新提交 91%

Measuring Behavior Portability in Large Language Models

测量大型语言模型中的行为可移植性

Tianjia Dong, Nadav Kunievsky, James A. Evans

机构 * Knowledge Lab University of Chicago(芝加哥大学知识实验室) Data Science Institute Department of Sociology University of Chicago(芝加哥大学数据科学研究所社会学系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 提出一个形式化框架,通过拟合可解释行为模型并评估其在目标环境中的预测性能,量化LLM在不同支付等价决策环境中的行为可移植性,实验发现显著且系统的可移植性损失。

详情

展开后加载摘要…

URL PDF HTML 收藏