arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-27 至 2026-08-27 共收录 91 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 91 篇

2604.07054 2026-08-27 cs.CL 版本更新 92%

Sell More, Play Less: Benchmarking LLM Realistic Selling Skill

多卖少玩:LLM真实销售技能基准测试

Xuanbo Su, Wenhao Hu, Le Zhan, Yuting Xie, Kailin Lyu, Kaijie Chen, Ziwei Li, Yeqiang Wang, Haibo Su, Yunzhang Chen, Ling Huang

机构 * SF Express(顺丰速运)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 本文提出SalesLLM基准测试,通过30,074个剧本配置和1,805个多轮场景评估大语言模型的销售能力,采用自动评估流程和用户模型CustomerLM提升模拟真实性,实验显示LLM在销售任务上的表现差异显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19299 2026-08-27 cs.AI 版本更新 92%

Air Traffic Control Using Large Language Models: Prompt Engineering, Architecture, and Evaluation

使用大语言模型的空中交通管制:提示工程、架构与评估

Mahyar Ghazanfari, Matthias Casanova, Jordan Kam, Alex Zongo, Peng Wei, Torsten Darrell, Alexandre Bayen

机构 * The George Washington University(乔治华盛顿大学) California Institute of Technology(加州理工学院) University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 该研究针对ATC仍以人工为主的问题,设计5种提示结构并在9种LLMs上实验,发现简洁提示表现最佳,注入正确历史可修复脚本严格提示的错误,明确了LLM辅助ATC的路径与局限。

Comments 39 pages, 12 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02855 2026-08-27 cs.CL cs.CY 版本更新 92%

IDEAlign: Comparing Ideas of Large Language Models to Domain Expert

IDEAlign:将大语言模型的想法与领域专家进行比较

Hyunji Nam, Lucia Langlois, James Malamut, Mei Tan, Dorottya Demszky

机构 * Stanford University(斯坦福大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本研究提出IDEAlign方法,通过“挑出异类”任务评估LLM标注与专家标注的想法层面相似性,发现LLM作为评判者表现最佳但仍不及专家,为开放式LLM标注评估提供了可复用的基准测试协议。

Comments EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05788 2026-08-27 cs.LG cs.AI cs.CL 版本更新 92%

Emergent Abilities in Large Language Models: A Survey

大语言模型中的涌现能力:一项综述

Leonardo Berti, Flavio Giorgi, Gjergji Kasneci

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本综述全面梳理大语言模型(LLMs)及大推理模型(LRMs)的涌现能力,分析其定义、出现条件,同时指出其潜在有害行为,强调需完善评估框架与监管监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25920 2026-08-27 cs.AI cs.SE 新提交 92%

Repair or Resample? Rethinking Failure Debugging in LLM Multi-Agent Systems

修复还是重采样?重新思考LLM多智能体系统中的故障调试

Zhongwen Luan, Xiaoyu Zhang, Ming Hu, Yue Yang, Jiongchi Yu, Xiaohong Chen

机构 * East China Normal University(华东师范大学) Nanyang Technological University(南洋理工大学) Singapore Management University(新加坡管理大学) Xi’an University of Architecture and Technology(西安建筑科技大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究针对LLM多智能体系统的故障调试,提出SymTrace评估框架与SymFail数据集,发现现有无指导重运行方法不可靠,提出的症状驱动干预方法可显著提升故障修复率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25869 2026-08-27 cs.CL 新提交 92%

Anchoring Bias in LLM-as-a-Judge Systems: Prior Scores Compromise Evaluation Independence

LLM作为评判者系统中的锚定偏差:先验分数损害评估独立性

Ante Kapetanovic, Kemal Altwlkany, Andro Mercep, Tomislav Duricic, Emanuel Lacic

机构 * Infobip(英福比普(Infobip))

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究发现LLM-as-a-Judge系统存在锚定偏差,先验分数作为元数据会系统性偏移LLM的评估结果,且现有缓解措施效果有限,需针对性设计评估方案。

Comments 10 pages, full research paper, to appear in proceedings of the 35th ACM International Conference on Information and Knowledge Management (CIKM '26), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19872 2026-08-27 cs.AI 版本更新 91%

Simulated Self-Assessment in Large Language Models: A Psychometric Approach to AI Self-Efficacy

大语言模型的模拟自我评估:一种心理测量方法用于AI自我效能

Daniel I Jackson, Emma L Jensen, Syed-Amad Hussain, Emre Sezgin

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract)

AI总结 本文通过心理测量方法评估大语言模型的自我效能,发现模型自我评估与实际表现不一致,且不同任务表现差异显著。

Comments 30 pages,7 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25939 2026-08-27 cs.SE 新提交 91%

XREPOTEST: Benchmarking Multilingual Repository-Level Unit Test Generation for Large Language Models

XREPOTEST:面向大语言模型的多语言仓库级单元测试生成基准测试

Dung Le Quang, Dong Cao Van, Nam Le Hai, Linh Ngo Van, Anh M. T. Bui, Phuong T. Nguyen

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn)

AI总结 本文提出XREPOTEST多语言仓库级单元测试生成基准,针对5种少用语言,结合多上下文策略,用14种LLM实验发现独立与仓库级性能差距,为推进现实场景单元测试生成提供支撑。

Comments Accepted to EMNLP Main 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25894 2026-08-27 cs.CL 新提交 91%

From Passive Response to Proactive Correction: Enhancing LLM Robustness Against Input Fact Perturbations

从被动响应到主动修正:增强大语言模型(LLM)对输入事实扰动的鲁棒性

Ping Wang, Xiangguo Sun, Bingbing Xu, Guocong Li, Xiaofeng Meng

机构 * Renmin University of China(中国人民大学) Southeast University(东南大学) Zhejiang University(浙江大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对LLM易受输入事实误导产生错误响应的问题,提出三阶段框架DEDUCE,结合新数据集与指标,在多基准上提升了Qwen、LLaMA等系列模型的鲁棒性与错误修正能力。

Comments Accepted to the Main Conference of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25824 2026-08-27 cs.CL 新提交 91%

Localize-Then-Decide Guarantees for LLM Judgments

LLM判断的“先定位后决策”保证

Xinyu Li, Yi Zhou, Guanqun Cao, Zeyu Fu, Tianjin Huang, Gaojie Jin

机构 * University of Exeter(埃克塞特大学) Cardiff University(卡迪夫大学) University of the West of England(西英格兰大学) University of Macau(澳门大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对LLM作为评估者时候选响应增多导致置信度假设失效的问题,提出“先定位后决策”框架,结合共形预测与校准规则,提升保证成功率与覆盖率。

Comments Accepted to Findings of the Association for Computational Linguistics: EMNLP 2026. Code: this https URL (https://github.com/llm2409/Localize-Then-Decide)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25291 2026-08-27 cs.LG cs.AI 新提交 90%

InsightSR: Refining Symbolic Regression Search Spaces via Parallel Semantic and Structural LLM Guidance

InsightSR:通过并行语义与结构大语言模型引导优化符号回归搜索空间

Yating Ling, Wenjing Cun, Zhitang Chen

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 InsightSR是嵌入PySR遗传编程引擎的框架,通过LLM的语义与结构引导优化符号回归搜索空间,在多个基准测试中性能优于现有方法且泛化能力强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25937 2026-08-27 cs.AI cs.MA 新提交 90%

Candidate supply and answer selection shape the value of LLM judging in multi-agent systems

候选供给与答案选择塑造多智能体系统中大语言模型(LLM)评判的价值

Jia-Hao Ji, Sijie Li, Jiabei Cheng, Zixi She, Jin-Tai Yu, Zhiyuan Yuan

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 该研究针对多智能体系统中LLM评判的价值,通过分析多组基准数据集,发现结合答案频率与LLM评判可提升答案准确率,为设计多智能体架构提供了诊断基础。

Comments 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25727 2026-08-27 cs.LG cs.CR 新提交 90%

Are LLM-Enhanced GNNs Privacy-Safe?

增强型大型语言模型的图神经网络是否具备隐私安全性?

Longzhu He, Zelang Wen, Chaozhuo Li, Sen Su

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文通过5阶段统一框架评估LLM增强型GNNs的隐私风险,发现其隐私脆弱性高于浅层文本基线,差分隐私可部分缓解风险但会导致效用下降,凸显了该领域的隐私-效用权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25217 2026-08-27 cs.AI eess.SY 新提交 90%

LLM-Driven, Datasheet-Aware Automated Hardware Compatibility Verification for Early-Stage, Pre-Schematic Embedded System Design

面向早期原理图前嵌入式系统设计的、由大语言模型(LLM)驱动且支持数据手册感知的自动化硬件兼容性验证

Haotian Qiao, Robert P. Dick

机构 * University of Michigan(密歇根大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 该研究提出一种LLM驱动的支持数据手册感知的自动化硬件兼容性验证框架,在早期嵌入式系统设计中实现97.5%的验证准确率,较“上传并查询”工作流减少8.6倍输入上下文大小,验证了模块化任务分解等方法的益处。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01975 2026-08-27 cs.AI cs.SE 版本更新 90%

Algorithmic algorithm development with LLMs: A Case Study on LLM-Usage for Contraction Order Optimization in Tensor Networks

基于LLM的算法开发:以张量网络收缩顺序优化中LLM使用为例

Fabian Hoppe, Melven Röhrig-Zöllner, Philipp Knechtges

机构 * German Aerospace Center (DLR), Institute of Software Technology, department High-Performance Computing(德国航空航天中心(DLR)软件技术研究所高性能计算部门)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 通过OpenEvolve对张量网络收缩顺序优化的案例研究,探讨了基于LLM的算法开发,重点分析了LLM选择、评估指标和测试实例等设计因素,强调了验证引导的进化编码代理的潜力以及人类科学家在评估、验证和解释方面的重要性与挑战。

Comments Submitted to the proceedings of the deRSE26 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25574 2026-08-27 cs.CL 新提交 89%

Generative vs. Encoder Large Language Models for ASR Evaluation: A Comparative Study

用于ASR评估的生成式与编码器大型语言模型:一项比较研究

Thibault Bañeras-Roux, Shashi Kumar, Driss Khalil, Sergio Burdisso, Petr Motlicek, Shiran Liu, Mickael Rouvier, Jane Wottawa, Richard Dufour

机构 * Idiap Research Institute(伊迪亚普研究所) Avignon Université(阿维尼翁大学) Le Mans Université(勒芒大学) Nantes Université(南特大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

AI总结 该研究对比生成式与编码器大型语言模型在ASR评估中的应用,发现合理配置的BERTScore、SemDist与人类判断相关性强,生成式LLMs可提升评估可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25500 2026-08-27 cs.AI cs.CL 新提交 88%

CaSKG: Counterfactual-Causal Skill Graphs for Scalable Agent Skill Retrieval

CaSKG:用于可扩展智能体技能检索的反事实因果技能图

Zhiyuan Li, Linyuan Gao, Xuechun Ding, Hongwei Chen, Yuan Wu, Yi Chang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Ant Group(蚂蚁集团)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究提出CaSKG框架,通过构建并校准反事实因果技能图实现可扩展智能体技能检索,在6种LLM骨干模型的两个基准测试中均取得最高任务得分,显著优于Graph-of-Skills。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25325 2026-08-27 cs.AI cs.CL 新提交 88%

FinRiskAtlas: Decision-Aligned Evaluation of Large Language Models for Financial Risk Review

FinRiskAtlas:面向金融风险审查的决策对齐大语言模型评估

Suyang Zhong, Jingzhe Zhu, Qi Xu, Liyao Sun, Yin Wang, Qingqing Sun, Shuai Chen, Tianyi Zhang

机构 * Ant International(蚂蚁集团) Xiamen University(厦门大学) Shanghai University(上海大学) Tongji University(同济大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究推出面向金融风险审查的中文基准FinRiskAtlas,从操作执行与证据状态控制两维度评估金融大语言模型,发现通用金融能力评分无法完全反映模型在专业工作流程中的可靠性,需采用决策对齐的评估单元。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24920 2026-08-27 cs.CL cs.AI cs.HC 新提交 88%

Semantic Variability of Replies Across LLMs: Implications for Designing Conversation-Based Assessment

不同大语言模型(LLM)生成回复的语义变异性:对基于对话的评估设计的启示

Jiangang Hao

机构 * ETS Research Institute(ETS研究院) Princeton(普林斯顿大学)

专题命中 评测与基准 :LLM(title_cn,summary_cn);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本研究探究不同LLM生成回复的语义变异性,发现模型选择与对话上下文会影响回复相似度及与人类回复的对齐度,指出仅靠提示词和上下文无法保证跨LLM的回复一致性,需构建相关基础设施与设计策略。

Comments 9 pages, 4 figures, two tables. Accepted to the AI in Measurement and Education Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24934 2026-08-27 cs.CV cs.AI 新提交 88%

Fusing Perceptual Vision Experts with Multimodal Large Language Models for Explainable Plant Disease Diagnosis: From Benchmark Imagery to Real-World Robotic Field Validation

融合感知视觉专家与多模态大语言模型的可解释植物病害诊断:从基准图像到真实世界机器人现场验证

Ranjan Sapkota, Konstantinos I. Roumeliotis, Pengyao Xie, Nikolaos D. Tselikas, Lirong Xiang, Manoj Karkee

机构 * Cornell University(康奈尔大学) University of the Peloponnese(伯罗奔尼撒大学) Agricultural University of Athens(雅典农业大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 该研究提出H²MAF框架,结合EfficientNet-B3、ConvNeXt-Tiny与Gemma、Qwen等MLLM,在PlantDoc及Cornell机器人田间数据集上实现高准确率可解释植物病害诊断,验证了MLLM仲裁的应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08512 2026-08-27 cs.AI 版本更新 88%

Time Present and Time Past: Benchmarking Large Language Models on Temporally Evolving Document Understanding

当下与过往时间:针对时间演进的文档理解的大语言模型基准测试

Mahbub E Sobhani, Md. Faiyaz Abdullah Sayeedi, Fahmid Hasan Chowdhury, Md Adnan Arefeen, Farig Sadeque, Md. Faizul Bari, Swakkhar Shatabda

机构 * BRAC University(BRAC大学) United International University(联合国际大学) North South University(北南大学) Spectrum Software & Consulting Ltd.(斯佩克特软件咨询有限公司)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本研究针对时间演进的文档理解构建了TIDE基准,评估9种LLMs在版本解析任务上的表现,发现模型在检测错误版本时表现较差,倾向于选择参数化答案而非权威文本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16063 2026-08-27 cs.HC cs.AI 版本更新 88%

Automated Healthcare Thematic Analysis using Multi-Agent Large Language Model: Algorithm Development and Evaluation

一个多智能体大语言模型框架用于自动化定性分析

Qidi Xu, Nuzha Amjad, Grace Giles, Alexa Cumming, De'angelo Hermesky, Alexander Wen, Min Ji Kwak, Yejin Kim

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出CoTI框架,通过多智能体协作实现自动化定性分析,提升主题识别效率,但指出过度依赖AI可能影响研究者独立思考。

Comments 45 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25905 2026-08-27 cs.SE 新提交 88%

Answer Is Cheap, Show Me the Evidence! Augmenting Automated Vulnerability Assessment with Evidence

答案很廉价,给我看证据!用证据增强自动化漏洞评估

Shengyi Pan, Zelong Zheng, Jiayuan Zhou, Xing Hu, Xin Xia, Shanping Li

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 研究针对现有自动化漏洞评估方法缺乏证据支持的问题,提出EAVA框架,通过LLM智能体和两阶段训练流程实现更优性能,且提供的证据对安全专家实用。

Comments accepted by ISSTA 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25089 2026-08-27 cs.CL 新提交 87%

Apples to Apples? Towards Comparable Crosslingual Language Model Evaluation

公平可比?面向可比较的跨语言语言模型评估

Xiulin Yang, Ethan Gotlieb Wilcox, Catherine Arnett

机构 * Georgetown University(乔治城大学) EleutherAI

专题命中 评测与基准 :language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.CL

AI总结 该研究针对跨语言语言模型评估的可比性挑战,通过受控单语言模型和多语言LLM验证,发现常用归一化指标存在跨语言偏差,提出语义等价序列的句子级负对数似然更适合跨语言比较。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24946 2026-08-27 cs.LG 新提交 87%

MacroAgent: Regularity-Aware Macro Legalization with LLM-Agent-Designed Contour Algorithms

MacroAgent:结合大语言模型智能体设计轮廓算法的感知规则性宏合法化方法

Jiaxi Jiang, Xufeng Yao, Yuxuan Zhao, Yuntao Lu, Peiyu Liao, Zuodong Zhang, Yibo Lin, Bei Yu

机构 * The Chinese University of Hong Kong(香港中文大学) Peking University(北京大学)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 MacroAgent是结合LLM智能体设计轮廓算法的四阶段宏合法化框架,在TILOS、Chipyard等基准及Cadence Innovus工具上,实现布局规则性、布线长度等指标的显著提升与更好鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08636 2026-08-27 cs.CL 版本更新 87%

InternBootcamp: Boosting LLM Reasoning with Verifiable Task Scaling

InternBootcamp 技术报告:通过可验证的任务扩展提升大语言模型推理能力

Peiji Li, Jiasheng Ye, Yongkang Chen, Linyang Li, Yichuan Ma, Zijie Yu, Ganqu Cui, Haozhan Li, Jiacheng Chen, Chengqi Lyu, Wenwei Zhang, Qipeng Guo, Dahua Lin, Bowen Zhou, Kai Chen

机构 * Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出InternBootcamp框架,通过可验证的任务扩展方法提升大语言模型的推理能力,为基于强化学习的模型优化、合成数据生成和模型评估提供了基础设施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25005 2026-08-27 cs.CL cs.LG 新提交 87%

The Imperfective Paradox Is Not Necessarily in Large Language Models: A Benchmark Failure Before a Model Failure

进行体悖论不一定存在于大型语言模型中:模型失效前的基准失效

Kaiqiao Han, Yizhou Sun

机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 评测与基准 :large language model(title);language model(title);prompting(abstract);分类 cs.CL、cs.LG

AI总结 该研究发现进行体悖论相关的基准失效,构建词汇匹配最小对并评估多步推理,揭示模型的充分性偏差等失效模式,表明部分大模型体分类性能可媲美人类标注者。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25952 2026-08-27 cs.CY cs.MA 新提交 87%

Spatial-Knowledge-Graph-Grounded LLM Agents for Neighborhood Livability Evaluation

基于空间知识图谱的大语言模型智能体用于社区宜居性评估

Haiyan Hao

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 该研究提出结合空间知识图谱与大语言模型智能体的框架,通过生成修订家庭日程等评估社区宜居性,发现设施可用性不代表便利可达,为关联空间机会与居民体验提供可审计方法。

Comments 31 pages, 4 figures, prototype framework

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25880 2026-08-27 cs.SE cs.CR 新提交 87%

Beyond the Editing Canvas: Evidence Divergence in OOXML-to-LLM Ingestion

超越编辑画布:OOXML导入大语言模型过程中的证据分歧

Side Liu, Jiangpeng Liu, Jinwen Xin, Guojun Peng, Jiang Ming

专题命中 评测与基准 :LLM(title,summary_cn)

AI总结 本文发现OOXML导入LLM流程存在证据分叉,同一份OOXML文件在Office与LLM中呈现不同视图,21种分叉经测试,多数接口会返回Office未显示的陷阱,开源项目默认导入路径集中于受影响提取器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20138 2026-08-27 cs.AI cs.CL cs.HC cs.LG 版本更新 87%

Learning to Prompt: Improving Student Engagement with Adaptive LLM-based High-School Tutoring

学习提示:基于自适应LLM的高中辅导提升学生参与度

Po-Chin Chang, Nicholas Hogan, Aske Plaat, Michiel T. van der Meer

机构 * Leiden University(莱顿大学) FutureWhiz

专题命中 评测与基准 :LLM(title,title_cn);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出一种基于14个教学特征的主题感知提示路由模型,通过模拟训练和在线A/B测试,在高中辅导中实现自适应策略切换,提高教学效率并减少交互轮次。

Comments Accepted to EMNLP 2026 (Industry Track)

详情

展开后加载摘要…

URL PDF HTML 收藏