arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 925 信号源:cs.CL, cs.AI, cs.LG

1. 领域大模型 925 篇

2607.16708 2026-07-21 cs.SE 新提交 67%

Model-Driven Discipline for Multi-Agent LLMs: Requirement-to-Verification Generation of Traceable System Models

多智能体大语言模型的模型驱动规范:可追溯系统模型的需求到验证生成

Ran Wei, Le Zhu, Haochi Wang, Ruizhe Yang, Jiapeng Guan, Siyuan Ji, Yuchen Hu, Zhe Jiang, Xiangyang Ji

专题命中 领域大模型 :large language model(abstract);language model(abstract)

AI总结 针对软件复杂性问题,提出RADIANT方法,结合MDE与多智能体LLMs用于系统开发。能从需求模型自动生成异构模型及可追溯链接,进行变更影响分析和形式验证。评估显示可提高语法有效性和可执行性,减少开发时间并可跨领域应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14082 2026-07-16 quant-ph 新提交 67%

Building Shor's Algorithm in Lean: An Agentic Formalization of Quantum Attacks on RSA-2048 and P-256

在Lean中构建肖尔算法:对RSA - 2048和P - 256的量子攻击的智能形式化

Lei Zhang, Yusheng Zhao, Hongshun Yao, Xin Wang

专题命中 领域大模型 :large language model(abstract);language model(abstract)

AI总结 研究在Lean中对肖尔算法及其变体进行形式化,采用智能形式化方法让软件代理分析、编写代码及修复证明,建立数学基础用于分析RSA - 2048和P - 256加密设置下的量子攻击,为量子密码分析及算法设计验证助力。

Comments 21 pages, including appendix; 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13533 2026-07-16 astro-ph.IM astro-ph.SR 新提交 67%

Scientific-Intention Driven Embodied Intelligent Solar Telescope: Conceptual Design

科学意图驱动的具身智能太阳望远镜:概念设计

Lin Jiaben, Tong Liyue, Wang Hui, Shao Mingfu, Yang Chen

专题命中 领域大模型 :large language model(abstract);language model(abstract)

AI总结 本文提出科学意图驱动的具身智能太阳望远镜(SIDEST)概念系统,通过三个核心层实现三种智能科学研究闭环,构建最小原型系统验证其核心原理及技术路径可行性,以前沿AI方法重新定义望远镜。

Comments 39 pages, 14 figures

Journal ref Laser & Optoelectronics Progress, 2026, 63(8): 0839014

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09771 2026-07-14 cs.DL cs.SI physics.soc-ph 新提交 67%

The backbone of science: analysis of citation networks between papers and their sources

科学的支柱:论文与其来源之间的引用网络分析

Wonhee Jeong, Dimitri Marinelli, Satyaki Sikdar, Gaurang Singh Yadav, Santo Fortunato

专题命中 领域大模型 :large language model(abstract);language model(abstract)

AI总结 研究分析论文与其来源间的引用网络,借助大语言模型提取来源,用两种提示发现生成的骨干网络有相似特征,入度分布异质性高,多数高被引论文相同,作者引用排名稳定,完整引用网络能可靠反映论文和作者相对引用影响力。

Comments 26 pages, 8 figures, and 21 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08698 2026-07-10 cs.HC 新提交 67%

How YouTube Frames ChatGPT Use in Education: An Epistemic Network Analysis with Supporting Multimodal Metadata

YouTube如何构建教育领域中ChatGPT的使用:基于支持多模态元数据的认知网络分析

Shayla Sharmin, Mohammad Al-Ratrout, Mohammad Fahim Abrar, Roghayeh Leila Barmaki

专题命中 领域大模型 :large language model(abstract);language model(abstract)

AI总结 研究通过多模态元数据分析教育类YouTube视频中ChatGPT的使用,识别出三个话语组,发现不同组在构建方式、观众反应和平台影响力上有差异,揭示了自主AI学习中优先快速输出与促进深度参与内容的差距及相关问题。

Comments This paper has been accepted in ICMI 2026 and will be presented in October

Journal ref In Proceedings of the 28th ACM International Conference on Multimodal Interaction (ICMI '26), Napoli, Italy, October 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20995 2026-07-09 cs.CY 新提交 67%

From inference to prediction: how machine learning is reconfiguring science

从推理到预测:机器学习如何重构科学(1990-2025)

Malena Mendez Isla, Vincent Lariviere, Diego Kozlowski

专题命中 领域大模型 :large language model(abstract);language model(abstract)

AI总结 通过分析490万篇论文,揭示机器学习从物理科学向健康科学扩散,预测技术取代推理方法,引发两波认知不透明性浪潮。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05537 2026-07-08 stat.AP 新提交 67%

Prompt engineering using order-of-addition experiments: An application to generating two-level fractional factorial designs

使用加法顺序实验的提示工程:在生成二级部分因子设计中的应用

Duoduo Danny Ying, Alan R. Vazquez, Hongquan Xu

专题命中 领域大模型 :large language model(abstract);language model(abstract)

AI总结 针对大语言模型的顺序依赖问题,引入用加法顺序实验量化提示元素排序效应及确定最佳位置的方法,通过构建二级部分因子设计证明该方法可阐明顺序依赖,助力确定高质量提示配置。

Comments Main manuscript: 35 pages, 6 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01456 2026-07-03 cs.SE 新提交 67%

From Anatomy to Smells: An Empirical Study of SKILL.md in Agent Skills

从解剖到气味:Agent技能中SKILL.md的实证研究

David Boram Hong, Aaron Imani, Iftekhar Ahmed

专题命中 领域大模型 :LLM(abstract,abstract_cn)

AI总结 对238个真实Agent技能的SKILL.md文件进行定性分析,构建语义组件分类法,通过多源文献综述识别最佳实践并定义技能气味,开发自动检测器发现超过99%的文件存在气味且难以消除。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01244 2026-07-03 cs.IR cs.CY 新提交 67%

Retrieval-Augmented Generation to Support Railways Engineering Tasks: A Case Study

检索增强生成支持铁路工程任务:案例研究

Andrea Gerardo Russo, Federico Ruggeri, Ivan Tomarchio, Davide Bombini, Nicolò Donati, Gianmarco Pappacoda, Paolo Torroni, Giuseppe-Emiliano La Cara

专题命中 领域大模型 :LLM(abstract,abstract_cn)

AI总结 本文通过案例研究,展示了从设计到部署构建检索增强生成系统,用于铁路领域复杂技术法规的咨询,平衡技术能力与领域专业知识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01214 2026-07-02 cs.HC 新提交 67%

Touching and Feeling the Data: A Reusable Software Pipeline for Tactile Statistical Graphs in Accessible Education

触摸与感受数据:面向无障碍教育的触觉统计图可复用软件流水线

Lawrence Obiuwevwi, Krzysztof J. Rechowicz, Jessica M. Johnson, Erika Frydenlund, Vikas Ashok, Sachin Shetty, Sampath Jayarathna

专题命中 领域大模型 :large language model(abstract);language model(abstract)

AI总结 提出一种三层可复用软件流水线,在约1500行JavaScript中自动生成触觉统计图,支持盲人和低视力学生通过触觉交互学习数据分析,生成打印文件耗时低于250毫秒。

Journal ref IEEE IRI'2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00911 2026-07-02 cs.SE 新提交 67%

From Registry to Repository: How AI Agent Skills Are Written, Adapted, and Maintained

从注册表到仓库:AI代理技能如何编写、适配和维护

Haoyu Gao, Jai Lal Lulla, Hong Yi Lin, Sebastian Baltes, Christoph Treude, Mansooreh Zahedi

专题命中 领域大模型 :LLM(abstract,abstract_cn)

AI总结 本研究首次对AI代理技能作为工程制品进行实证分析,通过挖掘公共注册表和GitHub仓库中的技能,发现技能重用多为一次性复制,定制化主要适配本地环境,而行为契约几乎不变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00060 2026-07-02 cs.CV 新提交 67%

Synergistic Perception-Reasoning Governance: Grounding Medical MLLMs with Verifiable Anatomical Evidence

协同感知-推理治理:用可验证解剖证据为医学多模态大语言模型提供基础

Rui Hao, Qiankun Li, Junyuan Mao, Linghao Meng, Dirui Xie, Dayu Tan, Zhigang Zeng

机构 * Huazhong University of Science and Technology(华中科技大学) Imperial Global Singapore, Imperial College London(帝国理工学院新加坡全球中心) Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学) Anhui University(安徽大学)

专题命中 领域大模型 :large language model(abstract);language model(abstract)

AI总结 提出一种无需训练的证据注入框架,通过ROI引导的视觉激活调制和解剖坐标语义标记,协同校准视觉感知与文本推理,动态路由任务特定干预,有效减少医学MLLM的幻觉。

Comments Accepted by MICCAI 2026 (Early Accept, Top 9%)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21676 2026-06-23 cs.IR 新提交 67%

CRAwLeR -- Cross-Reference Aware Legal Retrieval

CRAwLeR -- 交叉引用感知的法律检索

Maciej Jalocha, William Michelsen

专题命中 领域大模型 :LLM(abstract,abstract_cn)

AI总结 针对法律文档中的交叉引用,提出CRAwLeR流水线,生成需要上下文的查询并构建数据集,实验表明约80%的查询真正需要上下文,最佳Recall@10为55%-59%。

Comments 26 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20102 2026-06-19 cs.CY cs.CR 新提交 67%

Artificial Intelligence as Game Changer in Cybersecurity: What We Learned in 2025-2026, and how this is relevant for Africa

人工智能作为网络安全游戏规则改变者:2025-2026年我们学到的,以及这对非洲的意义

Mikael Alemu Gorsky

专题命中 领域大模型 :large language model(abstract);language model(abstract)

AI总结 本文通过2025-2026年两个事件论证前沿语言模型已成为网络作战决定性工具,而非洲在模型构建、运营和获取上被完全排除,面临技能、算力和投资三重赤字,并遭受AI欺诈攻击,建议在6-12个月内通过威胁情报共享、治理采纳和伙伴关系应对。

Comments International Conference on Cybersecurity in the Era of Digital Transformation and Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19191 2026-06-18 cs.CR 新提交 67%

PhantomSkill: Malicious Code Injection in Agent Skill Ecosystems

PhantomSkill: 代理技能生态系统中的恶意代码注入

Yu-Ting Lin, Chia-Mu Yu

专题命中 领域大模型 :LLM(abstract,abstract_cn)

AI总结 提出PhantomSkill攻击框架,通过VulMask技术将恶意行为隐藏在技能的辅助资源中,利用漏洞形状的实现绕过检测,在保持良性功能的同时降低警告和恶意软件检测率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14383 2026-06-17 cs.CV 新提交 67%

IndustryBench-MIPU: Benchmarking Multi-Image Attribute Value Extraction for Industrial Products

IndustryBench-MIPU:面向工业产品的多图像属性值提取基准

Haonan Qi, Jin Cao, Yongqi Zhang, Xintong Wang, Weidong Tang, Bin Chen, Chengfu Huo, Haojun Pan, Hengyu You, Jing Li, Yingde Wang, Liang Ding

机构 * Multimodal and Industrial AI Team(多模态与工业AI团队) Taobao&Tmall, Alibaba Group(淘宝&天猫,阿里巴巴集团)

专题命中 领域大模型 :large language model(abstract);language model(abstract)

AI总结 提出首个多图像工业产品理解基准IndustryBench-MIPU,通过结构化属性提取任务评估多模态大模型在规格表、铭牌、技术图纸上的文本识别、视觉推理、领域知识和跨图像证据整合能力,发现多图像完整性是核心瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13578 2026-06-16 cs.CL cs.AI cs.LG cs.MM cs.RO 新提交 67%

LabVLA: Grounding Vision-Language-Action Models in Scientific Laboratories

LabVLA:在科学实验室中落地视觉-语言-动作模型

Baochang Ren, Xinjie Liu, Xi Chen, Yanshuo Liu, Chenxi Li, Daqi Gao, Zeqin Su, Jintao Xing, Zirui Xue, Rui Li, Xiangyu Zhao, Shuofei Qiao, Minting Pan, Wangmeng Zuo, Lei Bai, Dongzhan Zhou, Ningyu Zhang, Huajun Chen

机构 * Zhejiang University(浙江大学) Shanghai AI Laboratory(上海人工智能实验室) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 领域大模型 :pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对科学实验室中机器人执行协议面临的数据和实体瓶颈,提出模拟数据引擎RoboGenesis和两阶段训练策略LabVLA,在LabUtopia基准上取得最高平均成功率。

Comments Work in progress. Project website at https://zjunlp.github.io/LabVLA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14664 2026-06-15 cs.HC 新提交 67%

The Self-Aware Body: A User-Centered Framework for Designing Therapeutic Sonic Interactions

自我感知的身体:以用户为中心的设计治疗性声音交互框架

Prithvi Ravi Kantan, Sofia Dahl, Erika G. Spaich

专题命中 领域大模型 :large language model(abstract);language model(abstract)

AI总结 提出一个用于设计运动声音化治疗交互技术的框架,包括概念重构、设计平台和以用户为中心的方法,以促进临床采用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14474 2026-06-15 cs.IR cs.HC 新提交 67%

Verifiable User Simulation for Search and Recommendation Systems

面向搜索与推荐系统的可验证用户模拟

Chenglong Ma, Xinye Wanyan, Danula Hettiachchi, Ziqi Xu, Yongli Ren, Jeffrey Chan

专题命中 领域大模型 :LLM(abstract,abstract_cn)

AI总结 提出一个七组件可审计框架,将用户模拟器视为可验证工程制品,通过动手实验检查模拟器行为、诊断差异并检测人口偏差。

Comments Presented as a half-day tutorial at SIGIR 2026, 4 pages

Journal ref In Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11058 2026-06-10 physics.soc-ph 新提交 67%

The social consequences of AI delegation

AI委托的社会后果

Henrique Ferraz de Arruda, Yamir Moreno

专题命中 领域大模型 :large language model(abstract);language model(abstract)

AI总结 研究探讨人类是否及在何种条件下将大型语言模型作为自身决策的替代品,提出将LLMs视为功能性社会行为者的研究议程。

Comments 10 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09550 2026-06-09 cs.DB 新提交 67%

InquiTree: Evaluating AI Agents in the Scientific Inquiry Loop with Paper-Derived Research Trees

InquiTree: 在论文衍生研究树中评估科学探究循环中的AI智能体

Shaoyang Cui

专题命中 领域大模型 :LLM(abstract,abstract_cn)

AI总结 提出InquiTree诊断环境,将科学探究形式化为交互式研究树,揭示AI智能体在长周期交互中关键判断退化(认知隧道)及对训练数据外论文性能下降的局限性。

Comments 17 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07948 2026-06-09 cs.MA cs.CY 新提交 67%

EduMirror: Modeling Educational Social Dynamics with Value-driven Multi-agent Simulation

EduMirror:基于价值驱动的多智能体模拟建模教育社会动态

Jingzhe Lin, Hengbin Yu, Yongdan Zeng, Fangwei Zhong

专题命中 领域大模型 :LLM(abstract,abstract_cn)

AI总结 提出EduMirror多智能体模拟器,通过价值驱动代理和双轨测量协议,生成真实、理论一致的教育社会动态,支持假设检验和反事实干预分析。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26886 2026-07-30 cs.CV cs.AI cs.CL cs.CY 新提交 66%

Hearsay: Vision-Language Medical Diagnoses Without an Image

Hearsay:无需图像的视觉-语言医学诊断

Siddharth Vohra

机构 * Carnegie Mellon University(卡内基梅隆大学) Amazon Web Services AI Native(亚马逊网络服务AI原生部门)

专题命中 领域大模型 :language model(abstract,comments);分类 cs.CL、cs.AI

AI总结 该研究发现前沿视觉-语言模型在无图像时会基于人口统计学特征编造医学诊断,存在不同失败模式,提出需直接审计其结构化输出通道并将探针词敏感性作为核心评估维度。

Comments Peer-reviewed and presented at the 1st Workshop on Toward Trustworthy Vision-Language Models in the Wild (TrustVLM), co-located with ACM ICMR 2026, Amsterdam. Non-archival workshop. Reviews public on OpenReview. 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20331 2026-08-21 cs.CL cs.AI cs.CV 新提交 62%

G-CARL: Grounded Checklist-Aligned Reward Learning for Patient-Oriented Medical Report Interpretation

G-CARL:面向患者的医学报告解读的基于 grounded 核对清单对齐的奖励学习

Shiao Xie, Siyu Chen, Jianwei Lv, Bo Yuan, Yujin Wang, Xiandong Li

专题命中 领域大模型 :post-training(abstract);分类 cs.CL、cs.AI

AI总结 本文针对现有医学视觉-语言任务无法兼顾医学事实性与患者语境沟通的问题,提出PMRI任务及G-CARL框架,构建MMedReport基准,实验证实其解读更贴合患者需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17075 2026-08-19 cs.CL cs.AI 新提交 62%

Foundation Agents Meet Agentic Deep Research: Evidence-Grounded Clinical Code Forecasting

基础智能体与智能型深度研究结合:基于证据的临床代码预测

Junda Wang, Meysam Ghaffari, Akshat Choube, Mohsen Sharifi Renani, Hong Yu, Carlos Morato

专题命中 领域大模型 :foundation model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ICD-Deepresearch工作流,结合EHR基础模型、语言基础模型与医学搜索工具,在MIMIC-III、MIMIC-IV数据集上实现ICD编码预测,其检索证据的医生有用性评分优于对比系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16273 2026-08-18 cs.LG cs.AI 新提交 62%

Foresight-England: Development of a National-Scale Generative AI Model of Electronic Health Records for Medical Event Prediction across the COVID-19 Pandemic

Foresight-England:面向COVID-19大流行期间医疗事件预测的全国规模电子健康记录生成式AI模型的开发

Simon Ellershaw, Christopher Tomlinson, Zeljko Kraljevic, Spiros Denaxas, Harry Hemingway, Cathie Sudlow, Angela M. Wood, Anoop D. Shah, Richard Dobson

机构 * University College London(伦敦大学学院) King’s College London(伦敦国王学院) University College London Hospitals National Institute for Health Research Biomedical Research Centre(伦敦大学学院医院国家卫生研究院生物医学研究中心) Interdisciplinary Transformation University(跨学科转型大学) British Heart Foundation Data Science Centre(英国心脏基金会数据科学中心) Health Data Research UK(英国健康数据研究中心) The University of Edinburgh(爱丁堡大学) University of Cambridge(剑桥大学) Victor Phillip Dahdaleh Heart and Lung Research Institute, University of Cambridge(剑桥大学维克多·菲利普·达德赫心肺研究所) British Heart Foundation Centre of Research Excellence, University of Cambridge(剑桥大学英国心脏基金会卓越研究中心)

专题命中 领域大模型 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本研究开发了首个全国规模的电子健康记录生成式基础模型Foresight-E,在6100万患者数据上训练,可零样本预测医疗事件,为大流行期间的医疗事件预测提供了方法模板。

Comments Methodology and evaluation framework for Foresight-England. As detailed in the Project Status section, NHS England has paused access to data for the Foresight-E project, meaning quantitative results are not currently available. On behalf of the CVD-COVID-UK/COVID-IMPACT Consortium

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16269 2026-08-18 cs.CL cs.LG 新提交 62%

Domain-Agnostic Neural Topic Modeling with Contextual Token-Level Semantic Graph Representation

基于上下文词级语义图表示的领域无关神经主题模型

Seung-Won Seo, Won Ik Cho, Yongmin Yoo

机构 * TelePIX AI Center(TelePIX人工智能中心) Samsung Electronics(三星电子) School of Computing & Frontier AI Research Centre Macquarie University(麦考瑞大学计算与前沿人工智能研究中心)

专题命中 领域大模型 :language model(abstract);分类 cs.CL、cs.LG

AI总结 该研究提出领域无关框架DARTopic,通过构建词级语义图并联合训练GNN编码器与主题推理模块,在多领域基准测试中优于基线且效率更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04472 2026-08-06 cs.CV cs.AI cs.CL 新提交 62%

EndoVLM: An Endoscopy Vision-Language Pre-training Model via Anatomy-Guided Sparsity and Progressive Alignment

EndoVLM:一种通过解剖学引导的稀疏性与渐进式对齐实现的内窥镜视觉-语言预训练模型

Zhenyu Yi, Jianwei Xu, Yue Hu, Zhongwei Qiu, Sijing Li, Liang Huang, Bin Lv, Ling Zhang, Yingda Xia

机构 * DAMO Academy, Alibaba Group(阿里巴巴达摩院) The First Affiliated Hospital of Zhejiang Chinese Medical University(浙江中医药大学附属第一医院) Shanghai Jiao Tong University(上海交通大学) Hupan Lab(湖畔实验室) Zhejiang University(浙江大学)

专题命中 领域大模型 :foundation model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出了EndoVLM这一内窥镜视觉-语言预训练模型,通过解剖学引导的稀疏池化、渐进式语义感知对齐等技术,在34.8万例内窥镜检查数据上预训练,其性能优于现有基础模型且具备零样本泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04193 2026-08-06 cs.CL cs.AI 新提交 62%

Patients-like-me: A Variational LM--GNN Framework for Explainable Clinical Prediction

Patients-like-me:用于可解释临床预测的变分LM-GNN框架

Xinyu Wang, Yixuan Li, Hanwei Wu, Qincheng Lu, Chi-Kuang Yeh, Xiao-Wen Chang, Ziyang Song

机构 * McGill University(麦吉尔大学) Université de Montréal(蒙特利尔大学) Georgia State University(佐治亚州立大学) Ohio University(俄亥俄大学)

专题命中 领域大模型 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出Patients-like-me(PLM)这一LM-GNN统一框架,结合局部患者语义与全局队列结构,在MIMIC-III、MIMIC-IV上优于现有方法,可提供可解释的参考患者归因,且计算开销适度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02621 2026-08-05 cs.CL cs.AI 新提交 62%

Knowing the Form, Not the Function: Automatically Auditing Answer--Authority Decoupling in Legal Benchmarks

知晓形式,而非功能:自动审计法律基准中答案与权威的脱钩问题

Hsien-Jyh Liao

机构 * Ministry of Justice, Taiwan(台湾法务部)

专题命中 领域大模型 :prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文针对法律基准中答案与权威脱钩问题,联合审计四款LLMs在台湾律师考试题上的表现,发现答案与引用行为可独立变化,提出答案与权威联合评估的方法。

Comments 9 pages, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏