arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32411 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32411 篇

2607.22949 2026-07-28 cs.IR 新提交 87%

Beyond Exact Match: How Evaluation Methodology Dominates Model Choice in LLM-Based Product Attribute Extraction

超越精确匹配:评估方法如何在基于大语言模型的产品属性提取中主导模型选择

Ayush Dwivedi, Ashvi Soni

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究基于大语言模型的产品属性提取中评估方法的影响,通过在MAVE基准上对比两种模型的四种提示策略,用精确和模糊匹配评估预测并审计标签,发现评估方法产生的方差远超模型和提示策略选择,且基准有一定噪声率,得出评估方法和数据质量主导模型选择等结论。

Comments 9 pages, 3 figures, 8 tables. Preprint under review. Code available at https://github.com/a-dwivedi/llm-product-attribute-extraction

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06160 2026-01-30 cs.CL cs.AI cs.CY cs.LG cs.SI 87%

Navigating the Rabbit Hole: Emergent Biases in LLM-Generated Attack Narratives Targeting Mental Health Groups

穿越兔子洞:LLM生成的攻击叙事中对心理健康群体的新兴偏见

Rijul Magu, Arka Dutta, Sean Kim, Ashiqur R. KhudaBukhsh, Munmun De Choudhury

专题命中 评测与基准 :LLM(title,abstract);language model(abstract,journal_ref);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了LLM生成的攻击叙事中对心理健康群体的偏见问题,提出评估框架和污名分析,揭示了LLM在加剧有害话语方面的结构性倾向。

Journal ref Second Conference on Language Modeling (COLM 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27296 2026-08-28 cs.AI cs.LG 新提交 87%

LLMs Can Design Near-Optimal OR Algorithms

大型语言模型(LLMs)可设计近最优的运筹学(OR)算法

Jackie Baek

机构 * Stern School of Business, New York University(纽约大学斯特恩商学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文探究大型语言模型能否为库存控制等明确定义的运筹学问题设计算法,发现最强模型gpt-5.6-sol的算法性能可匹配或优于现有最佳方法,前沿LLM可成为算法设计的重要经验基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26674 2026-08-28 cs.CL cs.AI 新提交 87%

Do LLMs Understand Personality? Rethinking Persona Fidelity Evaluation through Structured Behavioral Inference

大语言模型是否理解人格?通过结构化行为推理重新思考人格保真度评估

Mengfan Li, Zesheng Wei, Xuanhua Shi, Yang Deng

机构 * Singapore Management University(新加坡管理大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对现有LLM人格评估范式的局限,提出基于SFL的PRISM框架,将人格保真度评估转化为结构化逆推理任务,实验显示其评估结果更准确稳定。

Comments Accepted by EMNLP 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26154 2026-08-28 cs.CL cs.AI 新提交 87%

Evaluating AI Generated Summaries for Cancer Patients

评估面向癌症患者的AI生成摘要

Muhammad Aurangzeb Ahmad, Kim Shyu, Leon Oliver, Fergus Sleight, Paul Landau

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究采用双重评估框架,结合人类专家与LLM-as-a-judge,评估癌症患者护理应用中AI生成摘要的质量,发现其存在遗漏和轻微不准确问题,以此优化相关设计与防护措施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18161 2026-08-28 cs.CL cs.AI 版本更新 87%

How LLMs Distort Our Written Language

大语言模型如何扭曲我们的书面语言

Marwa Abdulhai, Isadora White, Yanming Wan, Ibrahim Qureshi, Joel Z. Leibo, Max Kleiman-Weiner, Natasha Jaques

机构 * UC Berkeley(加州大学伯克利分校) UC San Diego(加州大学圣地亚哥分校) University of Washington(华盛顿大学) Zaytuna College(扎亚图纳学院) Google DeepMind(谷歌DeepMind)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究揭示大语言模型不仅改变写作语气,还持续改变写作本意,通过用户研究和数据集分析发现,即使在专家反馈下,LLM仍会显著改变文本语义,影响科学机构和文化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25005 2026-08-27 cs.CL cs.LG 新提交 87%

The Imperfective Paradox Is Not Necessarily in Large Language Models: A Benchmark Failure Before a Model Failure

进行体悖论不一定存在于大型语言模型中:模型失效前的基准失效

Kaiqiao Han, Yizhou Sun

机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 评测与基准 :large language model(title);language model(title);prompting(abstract);分类 cs.CL、cs.LG

AI总结 该研究发现进行体悖论相关的基准失效,构建词汇匹配最小对并评估多步推理,揭示模型的充分性偏差等失效模式,表明部分大模型体分类性能可媲美人类标注者。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03058 2026-08-25 cs.CL cs.AI cs.CY 版本更新 87%

Verbalizing LLMs' assumptions to explain and control sycophancy

使LLM的假设 verbal化以解释和控制谄媚行为

Myra Cheng, Isabel Sieh, Humishka Zope, Sunny Yu, Lujain Ibrahim, Aryaman Arora, Jared Moore, Desmond Ong, Dan Jurafsky, Diyi Yang

机构 * Stanford University(斯坦福大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 评测与基准 :LLM(title_cn,summary_cn);分类 cs.CL、cs.AI

AI总结 本文提出Verbalized Assumptions框架,通过揭示LLM对用户的错误假设来解释和控制其谄媚行为,发现LLM在面对用户提问时倾向于提供验证而非客观信息,进而提出可解释的细粒度控制方法。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.14879 2026-08-25 cs.CL cs.AI 版本更新 87%

Evaluating the Efficacy of LLMs to Emulate Realistic Human Personalities

评估大语言模型(LLMs)模拟真实人类人格的效能

Lawrence J. Klinkert, Stephanie Buongiorno, Corey Clark

专题命中 评测与基准 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn);LLM(abstract);prompting(abstract)

AI总结 本研究以超5万份人类人格调查数据为基准,对比前沿与本地LLMs,发现部分前沿模型可100%对齐人类人格,为游戏开发者提供了测试LLMs模拟人类人格的方法。

Comments 11 pages, 4 figures, 3 tables. Published in Proceedings of AIIDE 2024

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence and Interactive Digital Entertainment 20(1) (2024) 65-75

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21095 2026-08-24 cs.SE cs.AI cs.CL cs.CR cs.IR 新提交 87%

Trustworthy RAG: An Evaluation Agent for Detecting Misinformation and Knowledge Poisoning in Generative AI Systems

可信检索增强生成:用于检测生成式人工智能系统中错误信息和知识投毒的评估智能体

Balkrishna Giri, Md Toufique Hasan, Jussi Rasku, Muhammad Waseem, Pekka Abrahamsson

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 该研究针对RAG系统的安全-可靠性鸿沟,提出结合NLI验证、五信号投毒检测器及可信指数的评估智能体,在TruthfulQA等数据集上实现高检测性能,可阻止RAG系统的不安全指令注入。

Comments 7 pages, 1 figure. Accepted for publication in the Main Research Track of the Twenty-First International Conference on Software Engineering Advances (ICSEA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23522 2026-08-21 cs.CL cs.AI 版本更新 87%

Qworld: Question-Specific Evaluation Criteria for LLMs

Qworld: 为LLMs设计的问题特定评估标准

Shanghua Gao, Yuchang Su, Pengwei Sui, Curtis Ginder, Marinka Zitnik

机构 * Department of Biomedical Informatics, Harvard Medical School(哈佛医学院生物医学信息学系) Department of Medicine, Brigham and Women’s Hospital(布里洛妇产科医院医学部) Kempner Institute for the Study of Natural and Artificial Intelligence, Harvard University(哈佛大学自然与人工智能研究 institute) Broad Institute of MIT and Harvard(MIT 和哈佛大学Broad研究所) Harvard Data Science Initiative(哈佛大学数据科学计划)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 Qworld通过递归扩展树生成问题特定评估标准,覆盖89%专家标准并产生79%新标准,揭示LLM在长期影响、公平性等维度的能力差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18289 2026-08-20 cs.AI cs.CR cs.IR cs.LG 新提交 87%

Evaluating Structured Information Extraction with Open Models in a High Risk Public Sector Application

在高风险公共部门应用中使用开源模型评估结构化信息提取

Elias Schubert, Felix Bießmann

机构 * Berlin University of Applied Sciences(柏林应用科学大学) Einstein Center Digital Future(爱因斯坦数字未来中心)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究针对欧盟AI法案高风险公共部门应用场景,构建基准评估开源OCR、LLM、VLM在学生申请处理任务的性能,发现零样本下多数模型表现差,输入结构保留是关键因素。

Comments Accepted at Workshop on Systems Over Models: What Actually Works in Industry (SOMI-2026) at ECML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26643 2026-08-20 cs.AI cs.LG 版本更新 87%

Rethinking Self-Evolution: A Constrained Exploration-Exploitation Process for Mitigating Skill Overfitting

重新思考自进化:缓解技能过拟合的约束探索-利用过程

Hongqiang Lin, Chao Liu, Xiaofan Bai, Xuan Jin, Yuhong Li, Nenggan Zheng, Xipeng Cao

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对LLM智能体技能过拟合问题,提出SkillBoost三阶段框架,在23种模型-基准配置上达SOTA性能,优化后技能可跨智能体复用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17810 2026-08-19 cs.CL cs.AI cs.HC 新提交 87%

Interpretable Humans, Alien LLMs: Expert Analysis of Latent Structures in Assessment Responses

可解释的人类,陌生的大语言模型:对评估响应中潜在结构的专家分析

Alona Strugatski, Licol Zeinfeld, Jason Cooper, Shelley Rap, Gil Schwarts, Giora Alexandron

机构 * Weizmann Institute of Science(魏茨曼科学研究所)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究结合探索性因子分析与学科专家盲审,发现6个LLMs的评估响应潜在因子与人类认知结构的可解释性存在显著差异,多数LLM因子无法被人类专家解读,揭示其机制与人类推理不同。

Comments Accepted for publication at AIME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10875 2026-08-18 cs.CL cs.AI 版本更新 87%

VibeLifeBench: Can Your Life Agent Be Proactive and Persistent in a Living World?

VibeLifeBench:你的生命智能体能在真实生活环境中保持主动与持续性吗?

Xiaohongshu Dots Studio, Evolvent AI

机构 * Xiaohongshu Dots Studio(小红书Dots工作室) Evolvent AI(Evolvent AI公司)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出VibeLifeBench基准,评估7个前沿LLM智能体在200项长周期日常生活任务中的表现,发现其主动与持续性不足,将开源相关任务、环境与评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08118 2026-08-14 cs.AI cs.LG 87%

MirrorBench: A Benchmark to Evaluate Conversational User-Proxy Agents for Human-Likeness

MirrorBench: 一个评估对话用户代理人类化能力的基准测试

Ashutosh Hathidara, Julien Yu, Vaishali Senthil, Sebastian Schreiber, Anil Babu Ankisettipalli

机构 * SAP Labs(SAP实验室)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出MirrorBench基准测试,用于评估对话用户代理的人类化能力,通过结合多种词汇多样性指标和LLM评估指标,揭示用户代理与真实人类用户之间的系统性差距。

Comments KDD 2026 (Dataset & Benchmark Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09930 2026-08-11 cs.SD cs.AI cs.CL 新提交 87%

Beyond Naturalness: Probing Automated Text-To-Speech Evaluators on Linguistically Grounded Dimensions

超越自然性:基于语言维度探究自动文本转语音评估器

Oluwanifemi Bamgbose, Simon Rosen, Jash Shah, Lindsay Devon Brin, Hoang H Nguyen, Anke Koelzer, Rachel Hansen, Tara Bogavelli, Fanny Riols

机构 * ServiceNow(ServiceNow公司)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究构建了首个TTS维度级元评估基准,测试发现MOS预测器聚焦声学信号质量,Audio-LLM评估器检测能力具选择性且依赖提示,两类方法均难捕捉语言结构化语音错误,相关资源已公开。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05889 2026-08-07 cs.DL cs.AI cs.CL cs.CY 新提交 87%

The em-dash em-beds in Congress: A population-level rise in em-dash frequency in U.S. congressional press releases at the dawn of the large-language-model era, 2021-2025

长破折号嵌入国会:大语言模型时代初期(2021-2025)美国国会新闻稿中长破折号频率的全人口水平上升

Przemysław Czuma

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究分析2021-2025年美国国会新闻稿,发现无空格长破折号频率在2025年翻倍,证实LLM辅助写作的扩散,长破折号可作为全人口水平的相关标记。

Comments Preregistered study (OSF: 10.17605/OSF.IO/U5NEY); deviations from the registered plan, including a formal validation-gate breach, are disclosed in Section 4.6. Companion study: arXiv:2606.29540. 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14967 2026-08-07 cs.SE cs.AI cs.LG 版本更新 87%

MermaidSeqBench: An Evaluation Benchmark for NL-to-Mermaid Sequence Diagram Generation

MermaidSeqBench: 一种用于自然语言到Mermaid序列图生成的评估基准

Basel Shbita, Farhan Ahmed, Chad DeLuca

机构 * IBM Research(IBM研究院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出MermaidSeqBench,通过混合方法构建132个样本,评估LLM生成Mermaid序列图的能力,揭示模型间显著能力差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04519 2026-08-06 cs.AI cs.CL 新提交 87%

Leak-Resistant Unlearning: A New Benchmark for Evaluating Multi-Hop Reasoning Consistency and Recovery Robustness

防泄露遗忘:评估多跳推理一致性与恢复鲁棒性的新基准

Haoting Qian, Qingjie Zhang, Zhicong Huang, Cheng Hong, Han Qiu

机构 * Tsinghua University(清华大学) Ant Group(蚂蚁集团)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出新基准unlearning评估LLM遗忘的鲁棒性,实验发现现有遗忘方法易受多跳推理路径和恢复攻击影响,还探究了遗忘质量、鲁棒性与模型效用的权衡。

Comments 19 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29539 2026-08-03 cs.CL cs.AI 新提交 87%

ARB: A Matched Authorship-Rewriting Benchmark Dataset for AI-Text Detector Evaluation

ARB:用于AI文本检测器评估的匹配作者改写基准数据集

Gaetano Perrone, Simon Pietro Romano

机构 * University of Napoli Federico II(那不勒斯费德里科二世大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出用于AI文本检测器评估的ARB基准数据集,对比五种检测器在传统基准与人类被LLM改写场景下的性能,发现传统基准测得的性能无法迁移至改写人类文本场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28631 2026-08-03 cs.AI cs.CL 新提交 87%

Can AI Evaluate AI Scientists? A Benchmarking Study of Autonomous Research Generation Systems Using Automated Multi-Model Review

AI能否评估AI科学家?基于自动化多模型评审的自主研究生成系统基准研究

Vaibhava Lakshmi Ravideshik, Mayank Kejriwal

机构 * Technion(以色列理工学院) Sakana AI FARS

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对AI科学家系统的评估难题,提出基于多模型LLM的自动化评审基准,发现FARS基准论文表现最优,Gemini与Claude评估一致性强,GPT-5.4标准不同,建立了首个定量基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27595 2026-07-31 cs.CL cs.AI cs.DL 新提交 87%

Beyond Similarity: Grounded Agentic Extraction and Expert-Adjudicated Evaluation of Intertextuality in Classical Chinese Histories

超越相似性:中国古典史书互文性的智能体式提取与专家裁决评估

Zhaoji Wang, Wanyu Si, Jun Wang

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究将细粒度互文性提取设为LLM智能体任务,构建专家裁决的古典史书互文基准,验证12种LLM性能,扩展至二十四史揭示引文的总体稳定与个案漂移规律并发布相关资源。

Comments 9 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26791 2026-07-30 cs.CR cs.AI cs.CL 新提交 87%

SecRespond: Benchmarking AI Agents for Real-World Post-Compromise Incident Response

SecRespond:面向真实入侵后事件响应的AI智能体基准测试集

Lehan Wang, Boli Chen, Ruixue Ding, Pengjun Xie, Jinwei Huang, Zhendong Liu, Shuo Wang, Tao Lei, Xin Ouyang, Xiaomeng Li

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究人员推出首个入侵后事件响应AI智能体基准测试集SecRespond,评估23种前沿LLM在10个靶场的表现,发现现有智能体难以及时发现隐蔽入侵并制定全面修复计划,存在根本瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26066 2026-07-30 cs.CL cs.AI cs.DL 新提交 87%

Do Methods Support the Claims? Intra-Paper Verification for Peer Review

方法是否支持其主张?用于同行评审的论文内部验证

Ranjitha Shivaprasad Ballakuraya, Arash Mahyari, Ashok Srinivasan

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对现有 LLM 评审系统忽视论文内部主张与方法学证据不匹配的问题,提出 intra-paper claim verification 框架,经实验验证其生成的评审意见与人类评审关注点高度契合。

Comments 9 pages, 8 figures. Source code, prompts, evaluation materials, and supporting data available at https://github.com/Ranjitha2493/intra-paper-claim-method-verification

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10400 2026-07-28 cs.LG cs.AI math.OC stat.ML 版本更新 87%

Designing Service Systems from Textual Evidence

从文本证据设计服务系统

Ruicheng Ao, Hongyu Chen, Siyang Gao, Hanwei Li, David Simchi-Levi

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出PP-LUCB算法,通过结合LLM代理评分与逆倾向加权残差,有效解决服务系统配置选择中的偏见问题,实现高置信度与低成本审计的平衡。

Comments This submission is withdrawn because it duplicates arXiv:2601.21471 by the same authors. The expanded manuscript was submitted as a new entry instead of as a replacement, so the same paper is now indexed twice. No results, proofs, or data are retracted. The current version is maintained as a replacement of arXiv:2601.21471, which readers should cite

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20465 2026-07-24 cs.LG cs.CL 新提交 87%

DataPrep-Bench: Benchmarking LLMs as Training Data Preparators

数据准备基准:评估作为训练数据准备者的大语言模型

Hao Liang, Qifeng Cai, Yibo Lin, Jianzhuo Du, Qifeng Xia, Sizhe Qiu, Linzhuang Sun, Meiyi Qiang, Zhaoyang Han, Xiaochen Ma, Bohan Zeng, Ruichuan An, Conghui He, Wentao Zhang

机构 * Peking University(北京大学) Institute for Advanced Algorithms Research(先进算法研究院) OriginHub Technology(源创科技)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 研究LLMs作为训练数据准备者的表现,引入DataPrep - Bench统一基准,涵盖数据构建与质量评估,在多领域和模型上评估,发布相关智能体和评估器,为衡量LLM驱动数据准备能力提供框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19355 2026-07-23 cs.AI cs.CL cs.CY 新提交 87%

Information Discernment in Large Language Models

大语言模型中的信息辨别

Joshua Ashkinaze, Laura Kurek, Alina Faisal, Tongyuan Miao, Mariam Joseph, Ceren Budak, Eric Gilbert

机构 * University of Michigan(密歇根大学)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型在与外部知识源结合时的信息辨别问题,提出Learn2Discern框架及基准,通过用户研究和大量模型试验发现模型在来源和真相辨别上存在问题,识别出简单干预措施,发布数据集和调查作为测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16011 2026-07-21 cs.SE cs.AI cs.CL 版本更新 87%

FormulaCode: Evaluating Agentic Optimization on Large Codebases

FormulaCode: 评估在大规模代码库上进行代理优化

Atharva Sehgal, James Hou, Akanksha Sarkar, Ishaan Mantripragada, Swarat Chaudhuri, Jennifer J. Sun, Yisong Yue

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) California Institute of Technology(加州理工学院) Cornell University(康奈尔大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 FormulaCode是一个评估大型真实代码库上代理优化能力的基准,包含957个从科学Python仓库挖掘出的性能瓶颈,配以专家撰写的补丁和平均264.6个社区维护的性能工作负载,揭示了前沿LLM代理在多目标优化上的重大挑战。

Comments ICML Camera Ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13602 2026-07-16 cs.CL cs.LG stat.ML 新提交 87%

Analogical Deep Research: Retrieving and Integrating Historical Analogies for Foresight Analysis

类比深度研究:检索和整合历史类比以进行前瞻性分析

Yongqiang Chen, Guangyi Chen, Yuewen Sun, Kun Zhang

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 该研究提出类比深度研究(ADR)任务及ADR-bench,发现LLM智能体找类比能力差。基于理论分析提出ADR原则,构建因果类比研究者(CANA)框架,提升历史类比生成效果,超越现有智能体,案例研究证实其利用历史类比的有效性。

Comments Ongoing project

详情

展开后加载摘要…

URL PDF HTML 收藏