arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2848 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2848 篇

2606.30790 2026-07-01 cs.CL cs.AI 新提交 85%

Indi-RomCoM: Code-Mixed Benchmark for Evaluating LLMs on Romanized Indic-English Instructions

Indi-RomCoM:评估LLM在罗马化印度语-英语混合指令上的基准测试

Avisha Das, Mihir Parmar, Mohana Ramnath, Pulkit Verma

机构 * Shiv Nadar University Chennai(金奈希夫·纳达尔大学) Google Cloud AI Research(谷歌云人工智能研究) IIT Madras(印度理工学院马德拉斯分校)

专题命中 评测与基准 :LLM(title_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出Indi-RomCoM基准,用于评估大语言模型在罗马化印度语-英语混合指令上的表现,涵盖7个任务、4种语言和3种混合强度,发现模型性能随混合密度增加而下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24950 2026-06-25 cs.LG cs.AI 新提交 85%

MacroLens: A Multi-Task Benchmark for Contextual Financial Reasoning under Macroeconomic Scenarios

MacroLens:宏观经济情景下的多任务上下文金融推理基准

Patara Trirat, Jin Myung Kwak, Jay Heo, Heejun Lee, Sung Ju Hwang

机构 * KAIST(韩国科学技术院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 针对金融决策中价格、基本面、宏观和文本四信号联合评估的缺失,构建了涵盖4426只美股、七个任务、1130个宏观事件的基准,评估19种方法,揭示上下文特征的重要性。

Comments 25 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24523 2026-06-24 cs.CL cs.AI 新提交 85%

Poster: Exploring the Limits of Audio-Based Detection of Turkish Phone Call Scams

海报:探索基于音频的土耳其电话诈骗检测的极限

Arda Eren, Micheal Cheung, Youqian Zhang, Grace Ngai, Eugene Yujun Fu

机构 * The Hong Kong Polytechnic University(香港理工大学) The Education University of Hong Kong(香港教育大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对土耳其语电话诈骗,构建首个多模态数据集(100对音频-文本),评估7个LLM在三种输入条件下的检测性能,发现基于文本的输入优于直接音频处理。

Comments Poster paper accepted at 47th IEEE Security & Privacy 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20683 2026-06-23 cs.AI cs.CL 新提交 85%

From Question Answering to Task Completion: A Survey on Agent System and Harness Design

从问答到任务完成:智能体系统与执行框架设计综述

Jianyuan Guo, Zhiwei Hao, Chengcheng Wang, Cheng Fan, Tingzhang Luo, Hongguang Li, Ying Gao, Hefei Mei, Jiankun Peng, Rongjian Xu, Minjing Dong, Han Wu, Mengyu Zheng, Kai Han, Shiqi Wang, Chang Xu, Yunhe Wang

机构 * City University of Hong Kong(香港城市大学) University of Sydney(悉尼大学) Peking University(北京大学) TokenRhythm Technologies(TokenRhythm 科技公司)

专题命中 评测与基准 :LLM(summary_cn,abstract);foundation model(abstract);分类 cs.CL、cs.AI

AI总结 本文从模型-执行框架视角综述LLM智能体,分析模型瓶颈与执行框架设计,提出六组件分解法,并探讨任务完成、效率与可靠性的影响因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23676 2026-06-23 cs.LG cs.AI math.OC stat.ML 新提交 85%

Open Problem: Is AdamW Effective Under Heavy-Tailed Noise?

开放问题:AdamW 在重尾噪声下是否有效?

Dingzhi Yu, Hongyi Tao, Yuanyu Wan, Luo Luo, Lijun Zhang

机构 * Nanjing University(南京大学) Zhejiang University(浙江大学) Fudan University(复旦大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出开放问题:AdamW 在重尾噪声下能否收敛?通过加权度量基准和走廊下界机制,揭示分母记忆可能隐藏大梯度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18636 2026-06-18 cs.CL cs.AI 新提交 85%

PEC-Home: Interpretation of Progressively Elliptical Commands in Smart Homes

PEC-Home:智能家居中渐进式省略命令的解释

Yingyu Shan, Zeming Liu, Silin Li, Boao Qian, Jiashu Yao, Yuhang Guo, Haifeng Wang

机构 * Beijing Institute of Technology(北京理工大学) Beihang University(北京航空航天大学) Baidu Inc.(百度公司)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对智能家居中用户因共享上下文而使用渐进式省略命令导致的指代和意图歧义问题,提出首个模拟家庭数据集PEC-Home,实验表明现有LLM助手难以准确执行省略命令。

Comments Accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10064 2026-06-10 cs.LG cs.AI 新提交 85%

Bittensor Agent Arenas as a Trajectory Primitive: Distilling a Shopping Agent from ShoppingBench Subnet Traces

Bittensor 智能体竞技场作为轨迹基元:从 ShoppingBench 子网轨迹中蒸馏购物智能体

Shardul Bansal, Seth Schilbe, Jarrod Barnes

机构 * ORO AI Dynamical Systems(动力系统)

专题命中 评测与基准 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);post-training(abstract);分类 cs.AI、cs.LG

AI总结 针对小模型后训练缺乏多轮轨迹数据的问题,利用 Bittensor 子网 SN15 的竞技机制生成激励对齐的轨迹,通过结构质量过滤提取智能体轨迹,后训练 Qwen3-4B 模型在 ShoppingBench 上达到 42.7% ASR,接近合成数据基线。

Comments 10 pages, 4 figures, Data and Models available at: https://huggingface.co/collections/oro-ai/shoppingbench-sn15-trajectory-primitive

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07520 2026-06-09 cs.CL cs.LG 新提交 85%

TinyJudge: Unverifiable Constraint Alignment via Lightweight Specialist Ensembles

TinyJudge: 通过轻量级专家集成实现不可验证约束对齐

Yirong Zeng, Yufei Liu, Xiao Ding, Yutai Hou, Yuxian Wang, Wu Ning, Haonan Song, Dandan Tu, Qixun Zhang, Yuxiang He, Bibo Cai, Ting Liu

机构 * Harbin Institute of Technology SCIR Lab(哈尔滨工业大学SCIR实验室) Peking University(北京大学) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 针对LLM遵循不可验证约束时奖励黑客和计算开销大的问题,提出TinyJudge框架,利用多个小型语言模型集成提供奖励,在五个基准上平均性能提升约10%,奖励精度提升12%,训练速度提升3倍。

Comments ACL 2026 Main Conference;15 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18671 2026-08-20 cs.CV 新提交 85%

Vision-Language Models for Egocentric Video: From Hand-Object Interaction to Embodied AI

用于第一人称视角视频的视觉-语言模型:从手-物交互到具身智能

Mohammad Zamani, Fatemeh Ziaeetabar

机构 * University of Tehran(德黑兰大学)

专题命中 评测与基准 :language model(title,abstract);foundation model(abstract);prompting(abstract)

AI总结 本综述梳理了用于第一人称视角视频理解的视觉-语言模型的发展,分析其挑战、研究方向与局限,明确了可部署具身智能的关键优先方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03874 2026-08-05 cs.AI cs.CL cs.LG 新提交 85%

ContinualSkillBench: Can LLM Agents Truly Evolve Their Capabilities?

ContinualSkillBench:大语言模型智能体真的能发展其能力吗?

Tianyi Guan, Yiding Wang, Haotong Yang, Siyuan Cao, Shirui Liu, Yi Hu, Jiaqi Li, Muhan Zhang

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出动态评估框架ContinualSkillBench,发现大语言模型智能体顺序执行可提升任务性能,上下文学习与显式技能维护效果相当,弱模型易积累零散技能,当前机制仍难整合经验为稳健可迁移技能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00895 2026-08-04 cs.CR 新提交 85%

Multi-LLM Consensus Framework for Evaluating Banking-Sector NIDS Dataset Coverage of MITRE ATT&CK Techniques

用于评估银行领域NIDS数据集对MITRE ATT&CK技术覆盖度的多大型语言模型(Multi-LLM)共识框架

Sanjida Khanom, Sadia Afrin Khan, Adrita Rahman Tory, Md. Ahsan Habib, Khondokar Fida Hasan

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 该研究提出多大型语言模型共识框架,评估NIDS基准数据集对银行领域MITRE ATT&CK技术的覆盖度,发现UNSW-NB15覆盖得分最高、CIC-DDoS2019盲区大,为行业化NIDS评估奠定基础并推动银行原生数据集研发。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28801 2026-08-03 cs.CL cs.AI cs.LG 新提交 85%

Benchmarks Are Not Monolithic: Sample-Level Auditing and Orchestration for LLM Evaluation

基准并非单一整体:面向大语言模型评估的样本级审计与编排

Philipp D. Siedler, Jordan Sassoon

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究提出样本级审计的元评估框架,标注五大基准的内部异质性,可编排复合基准子集实现模型能力针对性评估,为基准重组提供原则性方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27421 2026-07-31 cs.CL cs.AI cs.LG 新提交 85%

Selecting Open-Weight Language Models for Zero-Shot Intent Classification: A Systematic Evaluation of 41 Models

选择用于零样本意图分类的开放权重语言模型:41种模型的系统评估

Parishruthi Ganesh, Gerry Dozier, Cheryl Seals

专题命中 评测与基准 :language model(title,abstract);instruction tuning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究通过系统评估41种开放权重语言模型,为意图分类场景下选择符合计算、延迟等约束的模型提供了实用指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24854 2026-07-29 cs.AR cs.PL 新提交 85%

VClare: Resolving Imperfect Specifications in LLM-Based Verilog Generation

VClare:解决基于大语言模型的Verilog生成中的不完美规范

Zhuorui Zhao, Bing Li, Yu Li, Zheyu Yan, Ulf Schlichtmann

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究基于大语言模型的Verilog生成中不完美规范问题,提出VClare框架,通过规范级和仿真级两种修复范式修复缺陷,利用新基准数据集实验,单模块任务使设计通过率提高12.7%,多模块任务提高13.7%,提升了大语言模型在硬件设计中的应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23505 2026-07-28 cs.NE 新提交 85%

Benchmarking Zero-Shot LLM-Generated Parent Selection in Genetic Programming for Symbolic Regression

用于符号回归的遗传编程中零样本大语言模型生成的亲本选择基准测试

Hengzhe Zhang, Qi Chen, Bing Xue, Wolfgang Banzhaf, Mengjie Zhang

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究符号回归遗传编程中零样本大语言模型生成亲本选择算子,在标准框架内对八个模型进行基准测试,比较不同模型生成算子在多个回归基准上的表现,发现Claude Sonnet~4.6和Gemini~3.1 Pro表现出色,证明零样本合成是可行方法。

Comments Accepted at PPSN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23308 2026-07-28 cs.SE 新提交 85%

Towards LLM-assisted High-Quality Property Generation for Solidity Smart Contracts

迈向用于Solidity智能合约的大语言模型辅助的高质量属性生成

Muhammad Wahid, Shahzaib Khan, Mashhood Ali, Muhammad Hassan, Muhammad Naiman Jalil, Affan Rauf

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究利用大语言模型为Solidity智能合约生成高质量属性,通过变异测试衡量属性质量,评估多种提示技术,发现Gemini Pro 1.5结合提示链平均变异得分高,个别合约表现突出,显示大语言模型在属性生成上有潜力达专家水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18144 2026-07-21 cs.LG cs.AI cs.CL 新提交 85%

Do Language Models Dream of Binding Molecules? Benchmarking LLMs under Spatial Constraints

语言模型能否设计出结合分子?在空间约束下对语言模型进行基准测试

Thomas MacDougall, Maksim Kuznetsov, Roman Schutski, Rim Shayakhmetov, Maxim Malkov, Vladimir Aladinskiy, Alex Aliper, Alex Zhavoronkov

专题命中 评测与基准 :language model(title);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 研究探讨通用语言模型在3D分子设计中应对复杂空间约束的能力,引入3D - Fit评估策略,发现语言模型虽落后于先进方法,但有潜力同时处理多种空间约束。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14493 2026-07-17 cs.CR 新提交 85%

Context Contamination in LLM Analysis of Network Security Logs: Poison with Passive Prompt Injection and Mitigation Evaluation

网络安全日志的大语言模型分析中的上下文污染:通过被动提示注入进行中毒攻击及缓解评估

Rabimba Karanjai, Yang Lu, Hemanth Hegadehalli Madhavarao, Lei Xu, Weidong Shi

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究网络安全日志大语言模型分析中的上下文污染问题(被动提示注入漏洞),提出LogInject框架评估威胁,通过实验得出攻击成功率等数据,引入上下文拼接技术,评估分层防御效果,揭示需深度防御架构和人工监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11517 2026-07-14 cs.CR 新提交 85%

Graph-Based Structural Evaluation of LLM-Translated Adversary Emulation Procedures

基于图的大语言模型翻译的对手模拟程序结构评估

Ahmed M. Elmisery

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究大语言模型翻译对手模拟程序的评估问题,核心方法是基于图的结构评估(GBSE),将程序建模为有向属性图并计算归一化图编辑距离,主要贡献是应用于跨平台计划评估,揭示技术差异,框架含多种工具和规则且结果可重现验证。

Comments This technical contribution supports the MITRE white paper titled: Evaluating LLMs for Impact-Faithful Translation of Adversary Behavior Across Operating Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09524 2026-07-13 cs.SE 新提交 85%

Balancing Usefulness and Naturalness: An LLM-based Curation Pipeline for Code Review Comments

平衡有用性和自然性:基于大语言模型的代码审查评论整理管道

Oussama Ben Sghaier, Martin Weyssow, Houari Sahraoui

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究针对现有代码审查数据集质量问题限制大语言模型在代码审查任务中效用的情况,提出两种整理管道。一种用大语言模型重述评论生成CuREV数据集,另一种以高质量示例为指导增强评论真实性和多样性,提升了代码审查数据集质量和下游任务效果。

Comments arXiv admin note: substantial text overlap with arXiv:2502.03425

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06039 2026-07-08 cs.SE 新提交 85%

Automating Quality Assessment with NLP of LLM-Generated Defeaters

利用自然语言处理对大语言模型生成的反驳进行质量评估自动化

Tihomir Rohlinger, Daniel Ratiu, Stefan Wagner

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究针对大语言模型生成的反驳质量评估依赖人工且主观的问题,提出结合保证案例图结构特征、语义嵌入和元分类器的自动化评估方法,经案例研究验证,该方法能减少主观差异,为保证案例审查提供决策支持。

Comments 10 pages, 2 figures. Author preprint version of a paper published at ICSRS 2025

Journal ref 2025 9th International Conference on System Reliability and Safety (ICSRS), Turin, Italy, 2025, pp. 101 110

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04374 2026-07-07 eess.SY cs.SY 新提交 85%

An End-to-End Explainable AI Framework with Automated LLM-Based Natural Language Explanation Generation for Energy Systems

一种用于能源系统的基于大语言模型自动生成自然语言解释的端到端可解释人工智能框架

Venkata Sesha Sai Raj Nanduri, Akthar Hussain, Van-Hai Bui

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 提出端到端可解释人工智能框架,结合预测、解释生成、评估并转化为自然语言文本。用XAI算法生成局部和全局解释,经评估后转化为结构化输入给大语言模型,在能源系统数据集测试,提升黑箱模型可解释性。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04092 2026-07-07 cs.SE 新提交 85%

SEDCoT: Enhancing LLM-Based COBOL Code Translation via Symbolic Execution and Delta Debugging

SEDCoT:通过符号执行和增量调试增强基于大语言模型的COBOL代码翻译

Phillip Entin, Wenchao Gu, Alexander Knapp, Chunyang Chen

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 针对COBOL代码翻译难题,提出SEDCoT框架。先利用大语言模型初译,再结合符号执行与大语言模型指导生成测试套件修复语义差异,最后用增量调试最小化失败测试,提升翻译性能与可读性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04058 2026-07-07 cs.SE cs.PL 新提交 85%

Kaizen: Metamorphic Fuzzing and Differential Testing for LLM-Translated HPC Applications

Kaizen:用于大语言模型翻译的高性能计算应用的变质模糊测试和差分测试

Oscar Ludwig, Ninad Anklesaria, Zheming Jin, Swaroop Pophale, Kausar Moshood, Christian J. DeVore, Brandon Gill, Cassius Villareal, Keita Teranishi, Manish Motwani

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究大语言模型驱动的高性能计算应用代码翻译的正确性评估,提出用变质模糊测试和差分测试框架Kaizen,经源码变异、语法输入模糊等生成等价程序,暴露语义差异,评估揭示了编译成功与正确性的关系。

Comments Manuscript under-review at the ACM Transactions on Software Engineering and Methodology (TOSEM) journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03014 2026-07-07 cs.SE 新提交 85%

Detection of LLM-assisted Code Plagiarism Using k-gram Software Birthmarks

使用k-gram软件特征检测大语言模型辅助的代码抄袭

Nikolay Fedorov, Akito Monden, Hiroki Inayoshi, Haruaki Tamada, Masateru Tsunoda

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究大语言模型辅助下代码抄袭问题,用基于Java操作码唯一k-gram的软件特征,结合三个当代大语言模型及五个相似度度量进行检测,证明其对检测此类抄袭有效。

Comments 11 pages, 4 figures, submitted to the 8th World Symposium on Software Engineering (WSSE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22537 2026-06-26 cs.CV 新提交 85%

NegAS: Negative Label Guided Attention and Scoring for Out-of-Distribution Object Detection with Vision-Language Models

NegAS: 基于负标签引导的注意力与评分用于视觉语言模型的分布外目标检测

Yingjie Zhang, Shuai Li, Peng Wang

机构 * Northwestern Polytechnical University(西北工业大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 提出NegAS框架,利用负标签引导注意力(NegA)和基于sigmoid的OOD评分函数(NegS),解决VLM检测器中OOD区域利用不足和评分不兼容问题,显著提升OOD检测性能。

Comments Accept to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25760 2026-06-25 cs.LG cs.AI cs.CL cs.CV 新提交 85%

Uncertainty Quantification for Computer-Use Agents: A Benchmark across Vision-Language Models and GUI Grounding Datasets

计算机使用代理的不确定性量化:跨视觉语言模型和GUI基础数据集的基准测试

Divake Kumar, Sina Tayebati, Devashri Naik, Amanda Sofie Rios, Nilesh Ahuja, Omesh Tickoo, Ranganath Krishnan, Amit Ranjan Trivedi

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Intel Labs(英特尔实验室) Capital One AI Labs(Capital One AI实验室)

专题命中 评测与基准 :language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出跨机制基准Argus,评估27种后验不确定性量化方法在4个VLM代理和4个数据集上的表现,发现UQ排名在固定模型内跨数据集稳定,但跨模型类别和接口时下降,隐藏状态和密度方法最稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07822 2026-06-19 cs.CL cs.AI cs.LG 新提交 85%

The ACUTE Protocol: Operationalizing Language Model Activations for Better Calibration, Utility, and Trust

ACUTE协议:操作语言模型激活以实现更好的校准、效用和信任

Nishant Subramani, Palash Goyal, Yiwen Song, Mani Malek, Yuan Xue, Tomas Pfister, Hamid Palangi

机构 * Carnegie Mellon University(卡内基梅隆大学) Google(谷歌) Scale AI

专题命中 评测与基准 :language model(title,abstract);LLM(abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出ACUTE协议,通过操作语言模型激活来估计置信度,平衡校准与信息性,在多项选择问答、工具调用和科学文档摘要等任务上优于强基线,提升校准、效用和可信度。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08362 2026-06-09 cs.IR 新提交 85%

EmpiriGraph-Psy: A Dataset and LLM Pipeline for Extracting Empirical Relation Graphs from Psychology Abstracts

EmpiriGraph-Psy:从心理学摘要中提取经验关系图的数据集与LLM流水线

Danqin Zhao, Yicun Liu, Xingwei Tan, Thomas T. Hills

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 提出变量中心经验图提取任务,构建含210篇心理学摘要的基准数据集EmpiriGraph-Psy,并设计分阶段流水线,最佳配置宏F1达0.74,发现调节关系和概念层次最难提取。

Comments 17 pages, 5 figures. Code available at https://github.com/foxxis-dq828/EmpiriGraph-Psy

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08239 2026-08-11 cs.LG cs.CL 新提交 84%

The Replay Gap: Static Evaluation of Model Switching in LLM Agents Scores the Wrong World

重放差距:大语言模型智能体中模型切换的静态评估评估的是错误的世界

Ashritha Gonuguntla

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.LG;language model(comments)

AI总结 该研究发现大语言模型智能体的模型切换静态评估基于错误假设,通过分支展开实验证明模型交换会导致轨迹分歧,重放评估无法准确预测结果,发布了相关工具与轨迹。

Comments 8 pages, 3 figures. Accepted at the Conference on Language Modeling 2026. Code: https://github.com/AshrithaG/replay-gap Data: https://huggingface.co/datasets/ashritha0907/replay-gap-trajectories

详情

展开后加载摘要…

URL PDF HTML 收藏