arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-27 至 2026-08-27 共收录 408 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 91 篇

2608.25574 2026-08-27 cs.CL 新提交 89%

Generative vs. Encoder Large Language Models for ASR Evaluation: A Comparative Study

用于ASR评估的生成式与编码器大型语言模型:一项比较研究

Thibault Bañeras-Roux, Shashi Kumar, Driss Khalil, Sergio Burdisso, Petr Motlicek, Shiran Liu, Mickael Rouvier, Jane Wottawa, Richard Dufour

机构 * Idiap Research Institute(伊迪亚普研究所) Avignon Université(阿维尼翁大学) Le Mans Université(勒芒大学) Nantes Université(南特大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

AI总结 该研究对比生成式与编码器大型语言模型在ASR评估中的应用,发现合理配置的BERTScore、SemDist与人类判断相关性强,生成式LLMs可提升评估可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25500 2026-08-27 cs.AI cs.CL 新提交 88%

CaSKG: Counterfactual-Causal Skill Graphs for Scalable Agent Skill Retrieval

CaSKG:用于可扩展智能体技能检索的反事实因果技能图

Zhiyuan Li, Linyuan Gao, Xuechun Ding, Hongwei Chen, Yuan Wu, Yi Chang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Ant Group(蚂蚁集团)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究提出CaSKG框架,通过构建并校准反事实因果技能图实现可扩展智能体技能检索,在6种LLM骨干模型的两个基准测试中均取得最高任务得分,显著优于Graph-of-Skills。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25325 2026-08-27 cs.AI cs.CL 新提交 88%

FinRiskAtlas: Decision-Aligned Evaluation of Large Language Models for Financial Risk Review

FinRiskAtlas:面向金融风险审查的决策对齐大语言模型评估

Suyang Zhong, Jingzhe Zhu, Qi Xu, Liyao Sun, Yin Wang, Qingqing Sun, Shuai Chen, Tianyi Zhang

机构 * Ant International(蚂蚁集团) Xiamen University(厦门大学) Shanghai University(上海大学) Tongji University(同济大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究推出面向金融风险审查的中文基准FinRiskAtlas,从操作执行与证据状态控制两维度评估金融大语言模型,发现通用金融能力评分无法完全反映模型在专业工作流程中的可靠性,需采用决策对齐的评估单元。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24920 2026-08-27 cs.CL cs.AI cs.HC 新提交 88%

Semantic Variability of Replies Across LLMs: Implications for Designing Conversation-Based Assessment

不同大语言模型(LLM)生成回复的语义变异性:对基于对话的评估设计的启示

Jiangang Hao

机构 * ETS Research Institute(ETS研究院) Princeton(普林斯顿大学)

专题命中 评测与基准 :LLM(title_cn,summary_cn);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本研究探究不同LLM生成回复的语义变异性,发现模型选择与对话上下文会影响回复相似度及与人类回复的对齐度,指出仅靠提示词和上下文无法保证跨LLM的回复一致性,需构建相关基础设施与设计策略。

Comments 9 pages, 4 figures, two tables. Accepted to the AI in Measurement and Education Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24934 2026-08-27 cs.CV cs.AI 新提交 88%

Fusing Perceptual Vision Experts with Multimodal Large Language Models for Explainable Plant Disease Diagnosis: From Benchmark Imagery to Real-World Robotic Field Validation

融合感知视觉专家与多模态大语言模型的可解释植物病害诊断:从基准图像到真实世界机器人现场验证

Ranjan Sapkota, Konstantinos I. Roumeliotis, Pengyao Xie, Nikolaos D. Tselikas, Lirong Xiang, Manoj Karkee

机构 * Cornell University(康奈尔大学) University of the Peloponnese(伯罗奔尼撒大学) Agricultural University of Athens(雅典农业大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 该研究提出H²MAF框架,结合EfficientNet-B3、ConvNeXt-Tiny与Gemma、Qwen等MLLM,在PlantDoc及Cornell机器人田间数据集上实现高准确率可解释植物病害诊断,验证了MLLM仲裁的应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08512 2026-08-27 cs.AI 版本更新 88%

Time Present and Time Past: Benchmarking Large Language Models on Temporally Evolving Document Understanding

当下与过往时间:针对时间演进的文档理解的大语言模型基准测试

Mahbub E Sobhani, Md. Faiyaz Abdullah Sayeedi, Fahmid Hasan Chowdhury, Md Adnan Arefeen, Farig Sadeque, Md. Faizul Bari, Swakkhar Shatabda

机构 * BRAC University(BRAC大学) United International University(联合国际大学) North South University(北南大学) Spectrum Software & Consulting Ltd.(斯佩克特软件咨询有限公司)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本研究针对时间演进的文档理解构建了TIDE基准,评估9种LLMs在版本解析任务上的表现,发现模型在检测错误版本时表现较差,倾向于选择参数化答案而非权威文本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16063 2026-08-27 cs.HC cs.AI 版本更新 88%

Automated Healthcare Thematic Analysis using Multi-Agent Large Language Model: Algorithm Development and Evaluation

一个多智能体大语言模型框架用于自动化定性分析

Qidi Xu, Nuzha Amjad, Grace Giles, Alexa Cumming, De'angelo Hermesky, Alexander Wen, Min Ji Kwak, Yejin Kim

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出CoTI框架,通过多智能体协作实现自动化定性分析,提升主题识别效率,但指出过度依赖AI可能影响研究者独立思考。

Comments 45 pages, 5 figures

Journal ref Published at JMIR in 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25905 2026-08-27 cs.SE 新提交 88%

Answer Is Cheap, Show Me the Evidence! Augmenting Automated Vulnerability Assessment with Evidence

答案很廉价,给我看证据!用证据增强自动化漏洞评估

Shengyi Pan, Zelong Zheng, Jiayuan Zhou, Xing Hu, Xin Xia, Shanping Li

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 研究针对现有自动化漏洞评估方法缺乏证据支持的问题,提出EAVA框架,通过LLM智能体和两阶段训练流程实现更优性能,且提供的证据对安全专家实用。

Comments accepted by ISSTA 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25089 2026-08-27 cs.CL 新提交 87%

Apples to Apples? Towards Comparable Crosslingual Language Model Evaluation

公平可比?面向可比较的跨语言语言模型评估

Xiulin Yang, Ethan Gotlieb Wilcox, Catherine Arnett

机构 * Georgetown University(乔治城大学) EleutherAI

专题命中 评测与基准 :language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.CL

AI总结 该研究针对跨语言语言模型评估的可比性挑战,通过受控单语言模型和多语言LLM验证,发现常用归一化指标存在跨语言偏差,提出语义等价序列的句子级负对数似然更适合跨语言比较。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24946 2026-08-27 cs.LG 新提交 87%

MacroAgent: Regularity-Aware Macro Legalization with LLM-Agent-Designed Contour Algorithms

MacroAgent:结合大语言模型智能体设计轮廓算法的感知规则性宏合法化方法

Jiaxi Jiang, Xufeng Yao, Yuxuan Zhao, Yuntao Lu, Peiyu Liao, Zuodong Zhang, Yibo Lin, Bei Yu

机构 * The Chinese University of Hong Kong(香港中文大学) Peking University(北京大学)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 MacroAgent是结合LLM智能体设计轮廓算法的四阶段宏合法化框架,在TILOS、Chipyard等基准及Cadence Innovus工具上,实现布局规则性、布线长度等指标的显著提升与更好鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08636 2026-08-27 cs.CL 版本更新 87%

InternBootcamp: Boosting LLM Reasoning with Verifiable Task Scaling

InternBootcamp 技术报告:通过可验证的任务扩展提升大语言模型推理能力

Peiji Li, Jiasheng Ye, Yongkang Chen, Linyang Li, Yichuan Ma, Zijie Yu, Ganqu Cui, Haozhan Li, Jiacheng Chen, Chengqi Lyu, Wenwei Zhang, Qipeng Guo, Dahua Lin, Bowen Zhou, Kai Chen

机构 * Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出InternBootcamp框架,通过可验证的任务扩展方法提升大语言模型的推理能力,为基于强化学习的模型优化、合成数据生成和模型评估提供了基础设施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25005 2026-08-27 cs.CL cs.LG 新提交 87%

The Imperfective Paradox Is Not Necessarily in Large Language Models: A Benchmark Failure Before a Model Failure

进行体悖论不一定存在于大型语言模型中:模型失效前的基准失效

Kaiqiao Han, Yizhou Sun

机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 评测与基准 :large language model(title);language model(title);prompting(abstract);分类 cs.CL、cs.LG

AI总结 该研究发现进行体悖论相关的基准失效,构建词汇匹配最小对并评估多步推理,揭示模型的充分性偏差等失效模式,表明部分大模型体分类性能可媲美人类标注者。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25952 2026-08-27 cs.CY cs.MA 新提交 87%

Spatial-Knowledge-Graph-Grounded LLM Agents for Neighborhood Livability Evaluation

基于空间知识图谱的大语言模型智能体用于社区宜居性评估

Haiyan Hao

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 该研究提出结合空间知识图谱与大语言模型智能体的框架,通过生成修订家庭日程等评估社区宜居性,发现设施可用性不代表便利可达,为关联空间机会与居民体验提供可审计方法。

Comments 31 pages, 4 figures, prototype framework

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25880 2026-08-27 cs.SE cs.CR 新提交 87%

Beyond the Editing Canvas: Evidence Divergence in OOXML-to-LLM Ingestion

超越编辑画布:OOXML导入大语言模型过程中的证据分歧

Side Liu, Jiangpeng Liu, Jinwen Xin, Guojun Peng, Jiang Ming

专题命中 评测与基准 :LLM(title,summary_cn)

AI总结 本文发现OOXML导入LLM流程存在证据分叉,同一份OOXML文件在Office与LLM中呈现不同视图,21种分叉经测试,多数接口会返回Office未显示的陷阱,开源项目默认导入路径集中于受影响提取器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20138 2026-08-27 cs.AI cs.CL cs.HC cs.LG 版本更新 87%

Learning to Prompt: Improving Student Engagement with Adaptive LLM-based High-School Tutoring

学习提示:基于自适应LLM的高中辅导提升学生参与度

Po-Chin Chang, Nicholas Hogan, Aske Plaat, Michiel T. van der Meer

机构 * Leiden University(莱顿大学) FutureWhiz

专题命中 评测与基准 :LLM(title,title_cn);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出一种基于14个教学特征的主题感知提示路由模型,通过模拟训练和在线A/B测试,在高中辅导中实现自适应策略切换,提高教学效率并减少交互轮次。

Comments Accepted to EMNLP 2026 (Industry Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11375 2026-08-27 cs.CL cs.AI cs.LG 版本更新 87%

When Probing Accuracy Saturates, Fragility Resolves: A Complementary Metric for LLM Pre-Training Analysis

当探测精度饱和时,脆弱性揭示问题:LLM预训练分析的互补度量

Orion Reblitz-Richardson

机构 * Distiller Labs

专题命中 评测与基准 :LLM(title,title_cn);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对线性探测在预训练中精度快速饱和的问题,提出脆弱性度量,通过激活噪声水平衡量探测鲁棒性,揭示精度无法捕捉的表示结构演化。

Comments 25 pages, 6 figures. Code and datasets at https://github.com/deepsteer/deepsteer. v2: Adds an activation-scale (RMS-normalization) control, the v1 post-saturation critical-noise decline is withdrawn as a scale artifact; the layer-depth gradient is largely activation scale, with the residual not claimed as a genuine gradient. Finding 2 and the abstract are scoped

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25180 2026-08-27 cs.CY cs.AI cs.HC 新提交 86%

Self-Explanation Tutor for Active Study of CS1 Worked Examples

面向CS1例题主动学习的自解释导师

Arun-Balajiee Lekshmi-Narayanan, Mohammad Hassany, Kamil Akhuseyinoglu, Rully Hendrawan, Peter Brusilovsky

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究构建了面向入门编程的自解释导师ESSE,证实基于LLM的评估可支撑该导师,且其反馈能提升学生学习例题的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24898 2026-08-27 cs.HC cs.AI 新提交 86%

MCP-Driven Accessibility Tree Standardization for AI-Powered Screen Reader Agents

基于MCP的AI驱动屏幕阅读器智能体的可访问性树标准化

Vishnu Ramineni, Nitin Saksena, Akash Kumar Agarwal, Darshan Mohan Bidkar, Balakrishna Pothineni, Durgaraman Maruthavanan, Lokesh Butra, Siva Kumar Chintham

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出基于MCP的统一可访问性层架构,解决LLM智能体跨平台可访问性感知的集成复杂性问题,为可访问AI智能体提供语义信息基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01666 2026-08-27 cs.CL cs.AI 版本更新 86%

Style Wins, Substance Loses: A Diagnosis of LLM-as-Judge in Idea Generation

风格取胜,实质落败:对作为创意生成评判者的大语言模型(LLM)的诊断

Fengxian Ji, Yuke Li, Jingpu Yang, Juanfan Wu, Fan Zhang, Zhexuan Cui, Yu Xie, Min Peng, Qianqian Xie, Xiuying Chen, Zhuohan Xie

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 本研究针对大语言模型作为创意评判者的风格偏差问题,提出SciStyleBench基准及配套的SciStyleExtractor模块,实验验证该模块可有效降低风格偏差、提升实质区分度,为科学创意评估提供了系统性解决方案。

Comments First three authors are co-first authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24976 2026-08-27 cs.DL 新提交 86%

A Comparative Evaluation of Digitization Pipelines for Historiographical Sources

史学资料数字化处理管道的对比评估

Marina Gómez Rey, Patricia Callejo, Mario Muñoz-Organero, Carlos Alario-Hoyos

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本研究对比评估了13种PDF转文本提取管道,发现Marker直接提取性能最优,LLM后校正无系统性改进,端到端解析是异构历史藏品的可靠方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25717 2026-08-27 cs.CL cs.AI 新提交 85%

When RAG Fails to Equalize: Geo-bias in Factual Question Answering over Public Companies

当检索增强生成(RAG)无法实现均衡:上市公司事实问答中的地理偏差

Abhinav Havaldar, Enrico Santus

机构 * Bloomberg(彭博公司)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对上市公司事实问答场景,构建含约2000家公司的基准,评估六个LLM在四种条件下的表现,发现RAG无法消除地理偏差,更大模型也无法消除结构性影响,挑战了RAG作为通用纠正手段的观点。

Comments 10 pages, COLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24899 2026-08-27 cs.HC cs.AI cs.CY 新提交 84%

aipsy-judge: A Specialized, Psychologist-Corrected Local Judge for the Psychological Safety of Conversational AI

aipsy-judge:一种针对对话式AI心理安全性的、经心理学家校正的专用本地评判器

Michael Keeman, Anastasia Keeman

专题命中 评测与基准 :LLM(summary_cn,abstract);post-training(abstract);分类 cs.AI

AI总结 本研究发现LLM作为评判器评估对话式AI心理安全性存在缺陷,提出经心理学家校正的本地模型aipsy-judge-1.0,其危机检测等性能优于前沿模型,且评分更忠实、数据可本地留存。

Comments 24 pages, 3 figures, 6 tables. Model available at https://huggingface.co/keidolabs/aipsy-judge-1.0 (Apache-2.0)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00991 2026-08-27 cs.AI cs.CL 版本更新 84%

SCHEDBench: A Benchmark for Evaluating LLM Constraint Faithfulness in Natural-Language Combinatorial Scheduling

SCHEDBench:评估大语言模型在自然语言组合调度中约束忠实度的基准

Shrenil Shaun Sharma, Avi Sharma

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 SCHEDBench基准针对13个LLMs的测试表明,模型对同一调度问题的语义等价表述缺乏不变性,约束重排序引发的敏感性最为突出。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25085 2026-08-27 cs.CL 新提交 84%

MTDiag: A Multi-Turn Diagnostic Dataset Towards Clinically Meaningful LLM Evaluation

MTDiag:面向临床有意义的大语言模型评估的多轮诊断数据集

Pia Chouayfati, Alexander M. Fichtl, Miriam Anschütz, George Doumat, Georg Groh

机构 * Technical University of Munich(慕尼黑工业大学) UT Southwestern(西南大学(德克萨斯州))

专题命中 评测与基准 :LLM(title,journal_ref);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究针对现有医学大语言模型评估基准无法反映临床多轮交互诊断能力的问题,构建了多轮诊断数据集MTDiag,并提出临床知识导向的多轮鉴别诊断评估指标。

Comments 20 pages, published in the SIGDIAL 2026 conference proceedings, see https://aclanthology.org/2026.sigdial-1.58/

Journal ref Chouayfati, Pia, et al. "MTDiag: A Multi-Turn Diagnostic Dataset Towards Clinically Meaningful LLM Evaluation." Proceedings of the 27th Annual Meeting of the Special Interest Group on Discourse and Dialogue. 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25377 2026-08-27 cs.CY cs.HC 新提交 83%

CompanionHarm: A Multi-Turn Benchmark for Detecting Harms in Real-World AI Companion Conversations

CompanionHarm:用于检测现实世界AI伴侣对话中危害的多轮基准数据集

Renwen Zhang, Han Meng, Jian Chai, Yuntao Lin, Yi-Chieh Lee

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本研究推出CompanionHarm基准数据集,含2111段用户与Replika的多轮对话,标注了13类危害,评估7个LLM发现多轮上下文检测危害更优,为相关研究提供基础。

Comments 10 pages, this dataset is publicly available at https://github.com/HanMeng2004/CompanionHarm

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25548 2026-08-27 cs.LG q-bio.QM 新提交 83%

Interpreting Protein Language Model Embeddings via Orthogonal Projection for Protein Fitness Prediction

通过正交投影解释蛋白质语言模型嵌入以用于蛋白质适应性预测

Paulo Yanez Sarmiento, Pia Francesca Rissom, Manuel Pfeuffer, Marco Simnacher, Jordan F. Safer, Sumaiya Iqbal, Henrike O. Heyne, Nadja Klein, Bernhard Y. Renard

机构 * Hasso Plattner Institute, University of Potsdam(波茨坦大学哈索·普拉特纳研究所) Broad Institute of MIT and Harvard(麻省理工学院及哈佛大学布罗德研究所) Humboldt University of Berlin(柏林洪堡大学) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)

专题命中 评测与基准 :language model(title,abstract);分类 cs.LG

AI总结 本研究提出通过正交投影技术去除蛋白质语言模型嵌入中的可解释生化特征效应,证明其编码与生化特性相关的模式并量化其对蛋白质适应性预测的贡献,该方法可迁移至其他问题场景。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23663 2026-08-27 cs.SE cs.AI 版本更新 83%

Confidently Wrong, Silently So: Auditing Undetectable Failures of a Deployed On-Device Language Model

自信地出错,悄无声息:对已部署的端侧语言模型不可检测故障的审计

Shashwat Pandey, Satwik Pandey, Suresh Raghu

专题命中 评测与基准 :language model(title,abstract);foundation model(abstract);分类 cs.AI

AI总结 本研究对已部署的端侧语言模型开展可靠性审计,发现其存在任务非对称校准误差等不可检测故障,提出模型无关审计协议等基础设施,黑盒一致性包装器可有效恢复其可靠性。

Comments 8 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25460 2026-08-27 cs.AI cs.LG 新提交 82%

Training Alignment Auditors via Reinforcement Learning

通过强化学习训练对齐审计员

Paul Rosu, Rowan Wang

机构 * Anthropic

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 本研究用强化学习训练LLM审计员,通过成对奖励等优化提升审计质量与真实性,误报率低于1%,且审计能力可跨框架泛化。

Comments 82 pages, 15 figures. Code, prompts, and evaluation data are available at https://github.com/paulrosu11/training-auditing-agents-public

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25236 2026-08-27 cs.CY cs.AI cs.CL 新提交 82%

Rare Diseases, Common Dilemmas: LLMs Prioritize Equal Resource Distribution over Patient Benefit in Decision-Making

罕见病,共同困境:大语言模型在决策中优先考虑资源均等分配而非患者获益

Minda Zhao, Xu Han, Rishabh Goel, Maya Dagan, Noa Dagan, Adithya Madduri, Payal Chandak, Shilpa Nadimpalli Kobren, Isaac S. Kohane

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究构建含208个罕见病临床情景的基准,发现11种先进LLMs在决策中优先资源均等分配而非患者获益,且存在权威框架效应,揭示LLMs决策支持系统会忽略精细伦理考量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14572 2026-08-27 cs.IR cs.AI cs.CL cs.MA 版本更新 82%

Corpus2Skill: Distilling Enterprise Knowledge into Navigable Agent Skills for QA and RAG

不要检索,导航:将企业知识转化为可导航的代理技能用于问答和RAG

Yiqun Sun, Pengfei Wei, Lawrence B. Hsieh

机构 * Magellan Technology Research Institute(马格纳技术研究 institute)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 本文提出Corpus2Skill,通过将文档库转化为层次化技能目录,使LLM代理在服务时能导航该目录,提升问答质量和 grounding,但指出导航并非所有场景下的最佳替代方案。

Comments Accepted to EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏