arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11618 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2798 篇

2608.15980 2026-08-18 cs.CL cs.LG 新提交 82%

Whose Gold? Annotator-Pool Disagreement Is Large at the Item Level, and Hidden by Small Leaderboards

谁的“金标准”?标注者群体在条目层面分歧巨大,却被小型排行榜掩盖

Anik Jha

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.LG

AI总结 该研究发现标注者群体在条目层面分歧巨大,小型模型排行榜的一致性是假象,量化了其脆弱性,证明某数据集的标注者无差异假设错误,LLM评判器更贴合大众标注者群体。

Comments Submitted to the HAIC workshop at NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14606 2026-08-18 cs.CY cs.AI cs.CL stat.AP 新提交 82%

Plausible but Not Valid: A Psychometric Audit of LLMs as Synthetic Survey Respondents

看似合理但并非有效:对大型语言模型(LLMs)作为合成调查受访者的心理计量学审查

Mantas Lukauskas, Viktorija Šarkauskaitė

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过心理计量学分析发现,虽LLMs可复现人类调查关系的定性方向,但其心理计量学相似性不及高斯copula基线,且存在默许偏移、预测效度下降等问题,无法作为人类调查数据的直接替代品。

Comments 50 pages, 9 figures. Under review. Code and data will be released upon publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12670 2026-08-14 cs.AI cs.LG 新提交 82%

Designing AI Pipelines for Decision-Ready ITSM Intelligence

面向决策就绪型ITSM智能的AI流水线设计

Archan Dutta, Yash Dharmadhikari, Marat Valiullin, Rahul Guha, Alexander Liss

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 该研究遵循设计科学原则设计了结合LLM标准化、HDBSCAN聚类等的AI流水线,将ITSM工单数据转化为多级决策支持内容,经评估其四项决策指标平均得分超4.0,验证了其作为以人为中心IS问题的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12329 2026-08-14 cs.CL cs.AI cs.HC 新提交 82%

AnchorSIPS: A Synthetic Dataset and Evaluation Resource for Evidence-Supported Psychosis-Risk Symptom Measurement

AnchorSIPS:用于证据支持的精神病风险症状测量的合成数据集与评估资源

Guilherme C. Oliveira, Stephanie Fong, Zimu Wang, Clarice Lee, Xiangyu Zhao, Duy Khoa Pham, Duong Nhu, Yiwen Jiang, Jiahe Liu, Zhongxing Xu, Dwarikanath Mahapatra, Dominic Dwyer, Zongyuan Ge

机构 * Monash University(莫纳什大学) Orygen(奥瑞金) The University of Melbourne(墨尔本大学) Swinburne University of Technology(斯威本科技大学) University of Liverpool(利物浦大学) Khalifa University(哈利法大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 本文提出AnchorSIPS合成数据集,基于Mini-SIPS访谈构建含1万次结构化精神病风险访谈,解决临床数据隐私问题,用于研究证据提取等,实验发现LLM基线存在细节提取不足问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09254 2026-08-11 cs.AI cs.CL 新提交 82%

Business Truth, not SQL Accuracy: A Rule-Gated 7B Analytics Agent Outperforms a Direct-Prompted 32B Baseline

业务真值,而非SQL准确率:规则门控的7B分析智能体优于直接提示的32B基线

Morris Lee

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 该研究针对LLM分析智能体的评估缺陷,提出WarehouseReliabilityBench基准,开发规则门控的7B智能体QueryProof,其业务真值率优于直接提示的32B基线,且成本显著降低,假成功比例大幅下降。

Comments 20 pages, 7 figures, 11 tables. Benchmark, code, run records, pre-registration and one-command reproduction: https://github.com/k-w-lee/query_proof

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08975 2026-08-11 cs.CL cs.AI 新提交 82%

How Can Rhetoric Reward-Hack AI Reviewers? Dissecting Rhetorical Sensitivity in AI-Based Peer Review

如何对AI审稿人进行修辞奖励黑客攻击?剖析基于AI的同行评审中的修辞敏感性

Ming Li, Chenguang Wang, Xirui Li, Xinyue Zeng, Dianqi Li, Peng Shi, Dawei Zhou, Tianyi Zhou

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究针对基于AI的同行评审,构建受控语料库测试修辞选择对AI审稿判断的影响,明确修辞敏感性的层级结构及工作流程效果,为开发鲁棒评估系统提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07827 2026-08-11 cs.LG cs.CL 新提交 82%

From token probabilities to calibrated confidence: An empirical study of mathematical question answering

从token概率到校准置信度:数学问答的实证研究

Avery Ma, Lorne Schell, Vin Bhaskara, Leila Pishdad

机构 * RBC Borealis(加拿大皇家银行博雷利斯(RBC Borealis))

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 该研究针对数学问答任务,探究token概率能否用于生成校准置信度,对比单遍与多遍估计器,评估多种校准方法,发现序列聚合token概率可提升置信度质量,事后校准能降低域内误差但迁移性存在非对称问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07449 2026-08-10 cs.AI cs.CL 新提交 82%

SkillProx: Self-Evolving Agent Skills via Proximal Textual Gradient Descent

SkillProx:基于近端文本梯度下降的自进化智能体技能

Mingxuan Zheng, Yujin Zhou, Chuxue Cao, Boqin Yin, Yuyao Zhang, Jiapeng Sun, Shuaishuai Gong, Sirui Han, Yike Guo

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 SkillProx是结合闭环诊断进化与近端优化的自进化智能体技能框架,可提升LLM智能体在分布内外基准的平均准确率3.0个百分点,且两种核心组件具有互补效果。

Comments 23 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06884 2026-08-10 cs.CL cs.AI cs.IR 新提交 82%

Georeferencing Non-Gazetteered Place Names using Biological Specimen Records

利用生物标本记录对非 gazetteer 地名进行地理配准

Aneesha Fernando, Surangika Ranathunga, Kristin Stock, Raj Prasanna, Christopher B. Jones

机构 * School of Mathematical and Computational Sciences, Massey University(梅西大学数学与计算科学学院) Joint Centre for Disaster Research, Massey University(梅西大学灾害研究联合中心) School of Computer Science and Informatics, Cardiff University(卡迪夫大学计算机科学与信息学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 本研究利用新西兰 Allan Herbarium 的生物标本记录识别非 gazetteer 地名(NGP),通过提取反转空间关系推导位置约束,对比确定性、概率性、LLM 方法的空间推理性能,发现概率推理精度最优,传统建模在高空间精度场景仍具优势。

Comments Accepted for publication in the proceedings of the Conference on Spatial Information Theory (COSIT) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06366 2026-08-07 cs.AI cs.LG 新提交 82%

Tracing the Heart: An Evidence-Linked Pipeline for Heart-Failure Feature Engineering

追踪核心:一种用于心力衰竭特征工程的证据关联管道

Soorya Ram Shimgekar, Michelle Hu, Dorisa Shehi, Daniel Kang, Roy Ka-Wei Lee, Koustuv Saha, Christian Poellabauer, Christopher Lee, Sajeev Singh, Piyum Zonooz, Navin Kumar, Zeeshan Ahmed, Priyadarshini Kachroo

机构 * Nimblemind(宁敏德(音译)) Singapore University of Technology and Design(新加坡科技设计大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Florida International University(佛罗里达国际大学) University of California Los Angeles(加利福尼亚大学洛杉矶分校) Rutgers University Newark(罗格斯大学纽瓦克分校) Rutgers Institute for Health Health Care Policy and Aging Research(罗格斯大学健康、医疗保健政策与老龄化研究所) Robert Wood Johnson Medical School(罗伯特·伍德·约翰逊医学院) Rutgers Health(罗格斯医疗)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对心力衰竭EHR特征工程瓶颈,开发了nMAS管道,经500条虚拟记录验证,可提升HFrEF和HFpEF表型分析的AUROC,为自动化可审核特征工程提供了可行方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06329 2026-08-07 cs.CL cs.AI 新提交 82%

Benchmarking the Benchmarks: Evaluating Benchmarks for Conversational Agents

基准的基准:对话智能体的基准评估

Noam Koren, Roy Bar-Haim, Abigail Goldsteen

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 该研究针对对话智能体基准质量评估不足的问题,提出基于LLM评判员的无参考评估框架,可区分基准质量等级,适用于合成与人工整理的基准,验证了其有效性与实用性。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05228 2026-08-07 cs.AI cs.CL 新提交 82%

TriQua: Reconciling Granularity and Context in Factuality Evaluation

TriQua:在事实性评估中协调粒度与上下文

Jin Liu, Steffen Thoma, Achim Rettinger

机构 * FZI Research Center for Information Technology(FZI信息技术研究中心) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Trier University(特里尔大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 TriQua框架解决LLM事实性评估的粒度与上下文权衡问题,提出自适应事实建模方式及TriQuaScore,在事实验证任务中表现优于现有框架且与人工评分高度一致。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05266 2026-08-07 cs.AI cond-mat.mtrl-sci cs.LG 新提交 82%

Agentic self-driving microscopy benchmarks support qualification but do not necessarily generalize to unseen tasks

智能体自动驾驶显微镜基准测试支持性能验证,但不一定能泛化到未见任务

Nathan S Johnson, Ian Abshire

机构 * Carl Zeiss Research Microscopy Solutions(卡尔蔡司研究显微镜解决方案)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究开发基准框架评估显微镜智能体架构等因素的性能,发现其虽可用于验证比较,但现有基准无法预测智能体在未见显微镜任务上的表现。

Comments 20 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04565 2026-08-06 cs.CR cs.AI cs.CL 新提交 82%

Breadcrumbing Search Agents

面包屑式搜索智能体

Xuebin Li, Hanqing Zhao, Siyuan Liang, Kejiang Chen, Weiming Zhang, Dacheng Tao, Nenghai Yu

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 该研究针对LLM搜索智能体的安全问题,提出ACH和TGSE策略,通过操纵搜索结果形成连贯证据链,大幅提升攻击成功率。

Comments 38 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04317 2026-08-06 cs.CR cs.AI cs.LG cs.MA 新提交 82%

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)

三叉戟:如何突破深度强化学习网络防御(智能体式)

Ryozo Masukawa, Ian Bryant, Armita Kazeminajafabadi, Sanggeon Yun, Hyunwoo Oh, SungHeon Jeong, Nathaniel D. Bastian, Mahdi Imani, Mohsen Imani

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 研究针对DRL网络防御对自适应威胁鲁棒性不足的问题,提出Trident智能体式LLM红队框架,通过含三类组件的设计,发现现有防御存在根本性脆弱性,大幅降低蓝方防御性能并揭示新兴行为。

Comments code: https://anonymous.4open.science/r/Trident-A934

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03794 2026-08-05 cs.DB cs.AI cs.CL 新提交 82%

Evaluating LLMs in Database Scenarios: A Lifecycle Benchmark for Assessing Their Potential in Core Database Tasks

评估数据库场景下的大语言模型:用于评估其在核心数据库任务中潜力的生命周期基准

Shunfan Zheng, Dongsheng Shi, Yue Li, Xin Yi, Linlin Wang, Gerard de Melo

专题命中 评测与基准 :LLM(summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对现有LLM数据库评估基准仅聚焦Text-to-SQL任务的缺陷,推出覆盖数据库全生命周期的DBLifeBench基准,还提出Progressive-Text2SQL任务,发现专用Text-to-SQL模型在非编码阶段存在灾难性遗忘,为全栈数据库智能构建奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02615 2026-08-05 cs.CL cs.AI 新提交 82%

OncoTriad-QA: A Patient-Level Radiology-Pathology-Genomics Benchmark for Pan-Cancer Reasoning

OncoTriad-QA:用于泛癌推理的患者级放射学-病理学-基因组学基准

Ahnaf Munir, Dannong Wang, Michael W. McDonald, Mubarak Shah, Pegah Khosravi, Yu Tian

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出OncoTriad-QA多模态癌症问答基准及OncoVLM模型,实验显示OncoVLM经微调后在泛癌问答任务上优于现有模型,该基准可用于相关模型的训练与评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02612 2026-08-05 cs.CL cs.LG cs.NE 新提交 82%

BBOWP-Bench: Evaluating LLMs on Black-Box Optimization Word Problems

BBOWP-Bench:评估大型语言模型在黑盒优化文字问题上的表现

Yutaro Yamada, Kei Hiroshima, Nozomu Yoshinari, Kento Uchida, Shinichi Shirakawa

机构 * Yokohama National University(横滨国立大学)

专题命中 评测与基准 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 本文提出BBOWP问题设定并构建BBOWP-Bench基准,评估发现现有LLMs可根据评估预算选合适算法,但搜索空间设计仍存不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02611 2026-08-05 cs.DC cs.AI cs.LG cs.SE 新提交 82%

KernelBrain: Coarse-to-Fine, Budget-Aware Search for Agentic GPU Kernel Optimization

KernelBrain:面向智能体的GPU内核优化的粗到细、预算感知搜索

Shuai Che, Gang Peng

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 KernelBrain是结合LLM引导变异等技术的GPU内核优化智能体,可提升内核质量与搜索效率,在Triton内核任务中获多倍加速且缩短优化时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01794 2026-08-04 cs.CV cs.AI cs.CL 新提交 82%

Illuminating Visual Identity in Universal Multimodal Embeddings

揭示通用多模态嵌入中的视觉身份

Jiawei Cao, Junyi Feng, Jiashen Hua, Ziheng Huang, Bing Deng, Kaijie Wu, Chaochen Gu, Jieping Ye

机构 * Shanghai Jiao Tong University(上海交通大学) Alibaba Group(阿里巴巴集团)

专题命中 评测与基准 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 该研究针对通用多模态嵌入缺乏视觉身份判别能力的问题,提出视觉身份判别统一形式化,构建MVEB基准,设计身份感知采样的学习框架,提升了UMEs的身份判别能力。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01423 2026-08-04 cs.AI cs.GT cs.LG 新提交 82%

Scoring Rules! Statistical and Strategic Alignment for Text Evaluation Metrics

评分规则!文本评估指标的统计对齐与策略对齐

Shengwei Xu, Yuxuan Lu, Yifan Wu, Jason Hartline, Grant Schoenebeck

机构 * University of Michigan(密歇根大学) Peking University(北京大学) Microsoft Research(微软研究院) Northwestern University(西北大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 该研究针对文本评估指标,提出统计与策略对齐概念及三项测试原则,开发基于互信息的指标设计框架,发现 LLM-as-a-Judge 相关性高但易操纵,新指标鲁棒性强且相关性具竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00005 2026-08-04 cs.CL cs.AI 新提交 82%

RubricReviewer: From Direct Critique to Objective and Comprehensive Rubric-Driven Peer Review

RubricReviewer:从直接批评到客观全面的基于评分规则的同行评审

Shuyu Guo, Wenxiang Hu, Yuyue Zhao, Yougang Lyu, Xiaohui Yan

机构 * Shandong University(山东大学) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 RubricReviewer是一种基于评分规则驱动的框架,通过将评分规则生成为中间步骤,并结合Scout与Aligner模型,生成更全面、具判别性且抗攻击的评审意见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28634 2026-08-03 cs.CL cs.LG 新提交 82%

Can LLMs Really Understand Item Difficulty Levels? Implications for Automated Item Generation Using LLMs

大语言模型真的能理解题目难度等级吗?对使用大语言模型进行自动题目生成的启示

Xinyi Wang, Hong Jiao, Ming Li, Sydney Peters, Hanna Choi, Tianyi Zhou, Qingshu Xu

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究探究LLMs预测题目难度等级的表现,发现GPT-4.1准确率最高但仍低于ConvBERT,LLMs难标注难题,生成特定难度题目需谨慎。

Comments 43 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28190 2026-07-31 cs.CL cs.AI 新提交 82%

The MADRS Pipeline: Supporting Depression Assessment in Clinical Trials

MADRS 流程:支持临床试验中的抑郁评估

Mila Fodor, Katalin Ócsai, Francesco Periti, Rien Sonck, Alex Boudreau

机构 * Clario, part of Thermo Fisher Scientific(赛默飞世尔科技旗下Clario)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 本研究开发了一种 LLM 流程,可将临床试验的结构化音频访谈转换为文本,映射至 MADRS 10 项症状条目并评估严重程度,与专家评级整体相关性达 0.867,为抑郁评估提供可解释支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26060 2026-07-30 cs.CL cs.AI 新提交 82%

Large-Scale ChatBot Validation Through Customer Digital Twin Simulations

基于客户数字孪生模拟的大规模聊天机器人验证

Cristovao Iglesias, Devesh Batra, Alankar Atreya, Stefan Wagner, Robert Hankache, Patrick Sinclair, Giulio Pelosio, Michael McMillan, Greig A. Cowan, Raad Khraishi

机构 * leading UK bank(英国领先银行)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于合成客户智能体(SCA)数字孪生的两部分验证方法,用于解决银行等领域LLM聊天机器人的大规模安全验证问题,已成功应用于英国某头部银行的客户聊天机器人验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22951 2026-07-28 stat.ML cs.AI cs.LG 新提交 82%

Modeling Memory-Dependent Reliability of LLMs: A Hidden Markov Model

对大语言模型的记忆相关可靠性建模:一种隐马尔可夫模型

Robab Aghazadeh Chakherlou, Siddartha Khastgir, Peter Popov, Xingyu Zhao

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型可靠性评估,传统方法有局限。通过放宽独立任务结果假设,引入隐马尔可夫模型扩展分层贝叶斯框架,捕捉顺序依赖性,经实验证明忽略此依赖性会使可靠性估计过度自信。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12215 2026-07-15 cs.CL cs.LG cs.MA 新提交 82%

Fine-Tuned Multi-Agent Framework for Detecting OCEAN in Life Narratives

用于在生活叙事中检测大五人格的微调多智能体框架

Rasiq Hussain, Darshil Italiya, Joshua Oltmanns, Mehak Gupta

机构 * Southern Methodist University(南卫理公会大学) Washington University in St. Louis(圣路易斯华盛顿大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 研究旨在从文本中准确评估人格,提出微调多智能体框架,通过掩码语言建模和心理测量监督让子智能体针对特质采用不同视角,评判大语言模型生成预测,经实验验证该方法可扩展且可解释,突出多智能体推理优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03447 2026-07-07 cs.IR cs.AI cs.CL 新提交 82%

TRIAGE: Trustworthy Retrieval Instrumentation And Graph Evaluation

TRIAGE:可信检索工具与图评估

Axel TahmasebiMoradi, Lucas Schott, Martin Royer

机构 * IRT-SystemX(SystemX研究院)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 研究基于LLM驱动自动构建的知识图谱评估问题,引入TRIAGE框架,通过特定阶段指标对知识图谱构建与使用各阶段评估,可定位失败环节并给出改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01934 2026-07-03 cs.CL cs.AI cs.DB 新提交 82%

AIriskEval-edu: New Dataset for Risk Assessment in AI-mediated K-12 Educational Explanations

AIriskEval-edu: 用于AI辅助K-12教育解释风险评估的新数据集

Javier Irigoyen, Roberto Daza, Francisco Jurado, Julian Fierrez, Ruben Tolosana, Alvaro Ortigosa, Enrique Blas, Aythami Morales

机构 * Cátedra ENIA UAM-VERIDAS en IA Responsable(ENIA UAM-VERIDAS负责任人工智能教席) NextGenerationEU PRTR(下一代欧盟复苏计划) MICIU/FEDER(西班牙科学、创新与大学部/欧洲区域发展基金) MICIU/AEI(西班牙科学、创新与大学部/国家研究机构) Comunidad de Madrid(马德里自治区) MINECO/FEDER(西班牙经济与竞争力部/欧洲区域发展基金)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 提出AIriskEval-edu-db2数据集,包含1639条解释及结构化可解释性标注,用于训练基于LLM的审计员评估K-12教学内容中的教学风险,涵盖五个维度。

Comments 6 pages, 2 figures. Accepted at the IEEE International Carnahan Conference on Security Technology (ICCST 2026), October 14, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00009 2026-07-02 cs.CL cs.AI 新提交 82%

Controllable Narrative Rendering for Enhanced Assisted Writing

可控叙事渲染以增强辅助写作

Mingzhe Lu, Yanbing Liu, Jiayue Wu, Jiarui Zhang, Qihao Wang, Yue Hu, Yunpeng Li, Yangyan Xu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) HiThink Research(海天瑞声)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型在创意写作中安全编辑与无控制情节扩展的二元失败问题,提出基于叙事学故事/话语区分的Loom框架,通过三层流水线和意图中心符号链实现叙事意图与渲染密度的精确控制,在保持事实完整性的同时提升描述强度。

详情

展开后加载摘要…

URL PDF HTML 收藏