arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 3048 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 3048 篇

2608.14855 2026-08-18 cs.CL 新提交 74%

What to Forget in Unlearning? Forget Set Curation for Language Models

模型遗忘中该遗忘什么?面向语言模型的遗忘集筛选

Animesh Jha, Arpandeep Khatua, Youssef Allouah, Sanmi Koyejo

机构 * Stanford University(斯坦福大学)

专题命中 评测与基准 :language model(title);分类 cs.CL

AI总结 针对语言模型遗忘中遗忘集筛选缺失的问题,提出CleanSlate基准,发现不同遗忘集筛选器存在抑制效果弱或附带损伤的缺陷,表明遗忘集选择会影响遗忘效果与附带损伤。

Comments Presented at MemFM @ ICML 2026 and FoGen @ ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12097 2026-08-13 cs.AI 新提交 74%

Graph-Structured Rubrics: Compiling Rubrics into Typed Evaluation Graphs for LLM Judges

图结构评分标准:将评分标准编译为用于大语言模型评判器的类型化评估图

Xi Chen, Jie Mu, Mo Xuan, Qun Shao

机构 * Ant Group(蚂蚁集团)

专题命中 评测与基准 :LLM(title);分类 cs.AI

AI总结 本研究提出图结构评分标准(GSR),将评分标准编译为类型化评估图,在GPT-OSS-120B上较Prometheus式评分提升了精确分数一致性,且在成对评估中取得更高准确率。

Comments 11 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09412 2026-08-11 cs.AI 新提交 74%

KVDiagnosis: A Diagnostic Benchmark for KV-Cache Compression in Long-Context Language Models

KVDiagnosis:长上下文语言模型中KV缓存压缩的诊断基准

Chen Qiu, Ziwu Liu, Chao Fei, Guozhong Li, Panos Kalnis

机构 * KAUST(阿卜杜拉国王科技大学)

专题命中 评测与基准 :language model(title);分类 cs.AI

AI总结 本文提出KVDiagnosis,即长上下文语言模型KV缓存压缩的诊断基准,通过分类方法、设计评估流程、建立记录格式,在Qwen3-8B上验证其可有效区分压缩成败,代码与数据公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09187 2026-08-11 cs.CL 新提交 74%

Failure-Aware Long-Form Translation: Design and Implementation of a Recoverable LLM Translation System

故障感知的长文本翻译:可恢复大语言模型翻译系统的设计与实现

Yanlin Yu

专题命中 评测与基准 :LLM(title);分类 cs.CL

AI总结 针对长文本翻译API返回不可用结果的问题,设计实现了带恢复协议的可恢复大语言模型翻译系统,该系统通过延迟发布、验证输出等方式保障翻译可用性,经测试符合多项规则要求。

Comments 9 pages, 2 figures. A sanitized reference implementation is included as ancillary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05026 2026-08-06 cs.HC cs.AI 新提交 74%

ArtAnno: Annotating Implicit Semantics in Artworks through LLM Agent-Driven Bidirectional Human-AI Augmentation

ArtAnno:通过大语言模型智能体驱动的双向人机增强对艺术品的隐式语义进行标注

Xiaoyan Gu, Yifang Wang, Wenqing Zheng, Haozhong Liu, Yixia Zheng, Peiyi Jiang, Wenjie Ning, Wei Zhang, Wei Chen

专题命中 评测与基准 :LLM(title);分类 cs.AI

AI总结 本研究针对艺术品隐式语义标注效率低的问题,提出双向人机增强框架并实现ArtAnno系统,经评估可提升标注效率、实现知识积累并减少标注员的信息处理工作量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04885 2026-08-06 cs.CV cs.CL 新提交 74%

Evaluating the Diagnostic Robustness of Vision-Language Models Under Visual and Textual Perturbations

评估视觉-语言模型在视觉和文本扰动下的诊断鲁棒性

Ali Khoramfar, Mohammad Javad Dousti, Alireza Mohamadian, Heshaam Faili

机构 * University of Tehran(德黑兰大学) Tehran University of Medical Sciences(德黑兰医科大学) Advanced Diagnostic and Interventional Radiology Research Center (ADIR)(高级诊断与介入放射学研究中心(ADIR))

专题命中 评测与基准 :language model(title);分类 cs.CL

AI总结 本研究通过脑部MRI数据集评估四类视觉-语言模型在视觉、文本扰动下的诊断鲁棒性,发现其存在预测翻转、文本选择偏差、诊断过度承诺等问题,指出需采用稳定性指标评估其临床应用可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27360 2026-07-31 cs.AI 新提交 74%

SkillMentor: LLM Agent Self-Evolution via Learning Blind-Spot Diagnosis

SkillMentor:基于盲点诊断的大语言模型智能体自我进化

Xiaoyi Bao, Yuanzhen Xie, Yunzhi Tan, Jinghang Gu, Zhongqing Wang, Chu-Ren Huang, Bo Hu, Zang Li

机构 * The Hong Kong Polytechnic University(香港理工大学) Platform and Content Group, Tencent(腾讯平台与内容事业群) Soochow University(苏州大学)

专题命中 评测与基准 :LLM(title);分类 cs.AI

AI总结 本文提出SkillMentor,将盲点诊断作为独立于执行的可学习智能体能力,通过强化学习训练导师策略,在AppWorld和BFCLv3上使执行器性能平均提升44.2%,实现无需更新执行器的智能体自我进化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25152 2026-07-29 cs.AI 新提交 74%

When Do Agent Loops Mistake Stagnation for Progress? Self-Evaluation Bias and Externally Grounded Verification in Long-Running Autonomous LLM Agent Loops

智能体循环何时会将停滞误认为进步?长期运行的自主语言模型智能体循环中的自我评估偏差与外部基础验证

Hyundoo Park, Byungho Choi

专题命中 评测与基准 :LLM(title);分类 cs.AI

AI总结 研究长期运行的自主智能体循环中自我评估偏差导致的“进步幻觉”问题,通过构建测试平台,控制评估者信息通道类型,发现自我报告无意义,带内评判者也有偏差,指出开放式目标需带外评估,强调评估者依据对结果的重要性。

Comments 23 pages. Preregistered pilot measurement study. Also deposited on Zenodo (concept DOI 10.5281/zenodo.21594735)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24314 2026-07-28 cs.LG 新提交 74%

MEGA-CL: A Molecular Foundation Model for Generalizable ADMET Prediction through Graph External Attention and Contrastive Learning

MEGA-CL:通过图外部注意力和对比学习实现可泛化ADMET预测的分子基础模型

Tinghui Jin, Kedu Jin, Ying Li, Guanghui Ren, Jingzhi Xue, Shiyu Zhou, Xiaoli Dai, Li-bin Wei, Xijing Chen, Di Zhao, Jinfeng Liu

专题命中 评测与基准 :foundation model(title);分类 cs.LG

AI总结 该研究针对小分子ADMET预测难题,提出MEGA-CL框架,集成自监督对比学习等技术,能同时建模局部与全局关系并减轻过平滑。它在多数据集和任务中优于基线模型,在回归任务及外部验证中表现出色,还通过实验验证了其在药物研发中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22671 2026-07-28 cs.AI 新提交 74%

AIR-BENCH Live: An Evolving Safety Benchmark for Foundation Models

AIR-BENCH Live:基础模型不断演进的安全基准测试

Rohan Naphade, Minzhou Pan, Bo Li

机构 * Virtue AI(美德人工智能公司) Carnegie Mellon University(卡内基梅隆大学) Northeastern University(东北大学) University of Chicago(芝加哥大学) University of Illinois, Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :foundation model(title);分类 cs.AI

AI总结 研究针对基础模型安全基准测试随模型和法规发展而不足的问题,提出AIR-BENCH Live,通过自动化更新管道和多智能体算法更新提示,扩展了基准测试风险数量,评估模型发现安全范围广等结果,使其能随领域发展。

Comments 11 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21656 2026-07-27 cs.SE cs.AI 新提交 74%

Cross-Model LLM Code Review: Should you use Claude to review Codex or vice versa?

跨模型大语言模型代码审查:应该用Claude审查Codex还是相反?

Zuodong Xiang, Yike Zhang, YueMing Zhang, Hailu Xu

机构 * University of California, Davis(加州大学戴维斯分校) Johns Hopkins University(约翰霍普金斯大学) California State University, Long Beach(长滩加州州立大学)

专题命中 评测与基准 :LLM(title);分类 cs.AI

AI总结 研究开发者同时使用Claude和Codex进行代码审查的成本、时间及配对顺序问题,通过对116个任务的六种条件实验发现,Claude审查Codex草稿效果好,反向则不佳,有用的配对是不对称的,应Claude审查Codex。

Comments This paper had been accepted by Agentic SE @ KDD'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21635 2026-07-27 cs.LG 新提交 74%

Toward User-Conditioned Evaluation of Personal LLM Agents under Temporal Interventions

面向时间干预下个人语言模型代理的用户条件评估

Pin Qian, Su Wang, Yihang Chen, Qiaolin Yu, Xiaoyuan Wang, Zhitong Guo, Zhicheng Wang, Junxian You

机构 * Carnegie Mellon University(卡内基梅隆大学) Georgia Institute of Technology(佐治亚理工学院) Cornell University(康奈尔大学) University of Glasgow(格拉斯哥大学)

专题命中 评测与基准 :LLM(title);分类 cs.LG

AI总结 研究个人语言模型代理在时间干预下的用户条件评估,提出需在不同用户条件状态下重放时间干预并测量故障传播的协议,形式化四个条件,审查发现无满足条件的公开协议,进而提出最小基准设计和候选报告指标。

Comments 9 pages, 2 figures, and 8 tables. Accepted for oral presentation at the ACM SIGKDD KDD 2026 Workshop on Personal Intelligence in the Agentic AI Era (PILA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21292 2026-07-24 cs.AI cs.SY eess.SY 新提交 74%

An LLM-Driven Workflow for Automated Process Control Strategy Generation and Tuning from Dynamic Process Models

一种由大语言模型驱动的工作流程,用于从动态过程模型自动生成和调整过程控制策略

Ari Luna Rueda, Eike Cramer, Klaus Hellgardt, Mehmet Mercangöz

机构 * Imperial College London(帝国理工学院) University College London(伦敦大学学院)

专题命中 评测与基准 :LLM(title);分类 cs.AI

AI总结 该研究提出由大语言模型驱动的工作流程,用于从动态过程模型自动生成和调整控制策略,将设计任务分解为多步骤,经执行验证和修复,在气体预热器基准测试中生成控制结构与环境,贝叶斯优化降低闭环性能目标约26.5%,证明方法可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16050 2026-07-20 cs.LG 新提交 74%

DELUGE: Towards Continental-Scale Daily Pluvial Flood Damage Prediction via Interpretable Conditioning on Foundation Model Embeddings

DELUGE:通过基础模型嵌入的可解释条件实现大陆尺度每日暴雨洪水灾害预测

Yuya Kawakami, Daniel Cayan, Dongyu Liu, Kwan-Liu Ma, Tom Corringham

机构 * University of California, Davis(加利福尼亚大学戴维斯分校)

专题命中 评测与基准 :foundation model(title);分类 cs.LG

AI总结 研究针对美国暴雨洪水难预测及现有方法局限问题,提出DELUGE多模态深度学习框架,通过对特定单元格建模,利用参数模块结合基础模型嵌入实现可解释预测,在PR - AUC指标上优于基线,且该条件设定方案可用于其他地理空间预测任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14541 2026-07-17 cs.AI 新提交 74%

Are LLM-Generated GPU Kernels Production-Ready? A Trace-Driven Benchmark and Optimization Agent

大语言模型生成的GPU内核能否用于生产?基于追踪的基准测试与优化代理

Lingyun Yang, Yuxiao Wang, Shenghao Liang, Linfeng Yang, Daocheng Ying, Chunbo You, Rui Zhang, Luping Wang, Yinghao Yu, Guodong Yang, Liping Zhang

机构 * Alibaba Group(阿里巴巴集团)

专题命中 评测与基准 :LLM(title);分类 cs.AI

AI总结 研究大语言模型生成GPU内核用于生产的可行性,提出Atrex-Bench基准测试,发现现有模型表现不佳。为此发布Atrex-Kernel-Agent优化代理,结合多种技术,经案例研究能将回退转换为匹配或超越生产基线的内核。

Comments Both artifacts are released as open source: Atrex-Bench (https://github.com/alibaba/atrex-bench) and Atrex-Kernel-Agent (https://github.com/alibaba/atrex-kernel-agent)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12338 2026-07-15 cs.AI 新提交 74%

How Many Tasks Are Enough for Agent Benchmark Decisions? A Replay Analysis of Public LLM Agent Benchmarks

多少任务足以做出智能体基准决策?对公共大语言模型智能体基准的重放分析

Wei-Jung Huang

专题命中 评测与基准 :LLM(title);分类 cs.AI

AI总结 研究智能体基准测试中多少任务足以做决策,通过重放公共任务级记录,提出部分预算需满足支持完整基准决策、覆盖任务组及控制未解决比较比例等条件,还指出部分评估报告应包含的内容。

Comments KDD 2026 Workshop Agentic AI Evaluation and Trustworthiness

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19491 2026-06-19 cs.LG stat.ML 新提交 74%

Algebraic Dead Directions in LayerNorm Transformers: A Forward-Pass-Only Diagnostic at LLM Scale

LayerNorm Transformer 中的代数死方向:一种仅需前向传播的大语言模型规模诊断方法

Tejas Pradeep Shirodkar, P. J. Narayanan

机构 * IIIT, Hyderabad(海得拉巴国际信息技术学院)

专题命中 评测与基准 :LLM(title);分类 cs.LG

AI总结 本文发现 LayerNorm 的逆尺度方向是后最终归一化中心激活协方差矩阵的精确代数核,可仅从参数中读取死方向,无需前向或后向传播,并在 14 个预训练模型上验证了其有效性。

Comments 34 pages, 7 figures, 6 tables. Empirical companion to arXiv:2606.05957

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17564 2026-06-17 cs.CV cs.AI 新提交 74%

Geometric Consistency Protocol for Foundation Model Features in Multi-View Satellite Imagery

多视图卫星图像中基础模型特征的几何一致性协议

Qiyan Luo, Jie Yang, Yingdong Pi, Lekang Wen, Mi Wang

机构 * Hubei Province Key Research and Development Program(湖北省重点研发计划) LIESMARS Special Research Funding(测绘遥感信息工程国家重点实验室专项研究基金) National Science Fund for Distinguished Young Scholars(国家杰出青年科学基金)

专题命中 评测与基准 :foundation model(title);分类 cs.AI

AI总结 针对卫星多视图重建中传统2D全局匹配的误导性,提出基于有理函数模型(RFM)的几何忠实评估协议,通过RPC投影3D一致性度量和几何约束密集匹配代理,揭示语义一致性与几何定位的解耦,并证明在RPC一致评估下2D骨干网络仍具竞争力。

Comments The manuscript is accepted as Oral Presentation in IEEE International Geoscience and Remote Sensing Symposium(IGARSS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07623 2026-06-09 cs.LG cs.LO 新提交 74%

Finite Certificates for In-Context Determinacy and a Threshold Theory of Emergence in Language Models

上下文确定性有限证书与语言模型中涌现的阈值理论

Faruk Alpay, Hamdi Alakkad

机构 * Bahcesehir University(巴切谢希尔大学)

专题命中 评测与基准 :language model(title);分类 cs.LG

AI总结 提出用有限语义证书验证上下文条件语言模型行为,证明有限域线性任务族中确定性准则,并证明阈值涌现的反幻象定理,将阈值度量与语义置信度分离。

Comments 40 pages; ancillary files provided

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25934 2026-08-27 cs.AI cs.LG 新提交 73%

How Robust Are Automated Fact-Checking Systems? A Cross-Benchmark Evaluation

自动事实核查系统的鲁棒性如何?跨基准评估

Aida Usmanova, Zangir Iklassov, Markus Leippold, Ricardo Usbeck

机构 * Leuphana University of Lüneburg(吕讷堡勒芬纳大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学) University of Zurich(苏黎世大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本研究对九种模型在四个跨领域数据集上开展自动事实核查系统的跨基准评估,发现系统性能依赖领域与指标,检索是主要瓶颈,并发布资源支持可复现研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25854 2026-08-27 cs.CL cs.LG 新提交 73%

Key Point Analysis Needs Structure Recovery: Task Definition, Dataset Diagnosis, and a Structure-Aware Benchmark

关键点分析需要结构恢复:任务定义、数据集诊断及结构感知基准

Zhiqiang Shi, Oana Cocarascu

机构 * King’s College London(伦敦国王学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 该研究定义关键点分析(KPA)为结构化预测问题,诊断现有KPA基准缺陷,构建人机协同标注的结构感知基准并发布相关资源,为KPA研究提供支持

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25741 2026-08-27 cs.LG cs.CL 新提交 73%

Why Does Graph Learning Fail to Fully Benefit from a Text Teacher?

为何图学习无法充分受益于文本教师?

Fumiaki Kimino (1), Ryoma Sato (1 and 2) ((1) SOKENDAI, (2) National Institute of Informatics)

机构 * SOKENDAI(总研究大学院大学) National Institute of Informatics(情报学研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 该研究针对结合自监督GNN与交替优化语言模型的多模态图学习模型未充分提升性能的问题,分析了六个关键影响因素并通过分阶段实验验证。

Comments 21 pages, 1 figure, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25569 2026-08-27 cs.CL cs.AI 新提交 73%

Controllable Affective Generation via Latent Vector Steering

基于潜在向量调控的可控情感生成

Xixian Yong, Siyuan Chang, Yingying Zhang, Xian Wu, Xiao Zhou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) Tencent Jarvis Lab(腾讯Jarvis实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型对齐后情感响应平淡的问题,提出轻量框架EmoVec,通过调控潜在向量实现可控情感生成,实验验证其能提升情感显著性且保留语义等特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25158 2026-08-27 cs.AI cs.CR cs.LG cs.SE 新提交 73%

FuzzingBrain-Bench V1: Evaluating Open-Ended Bug Discovery by LLMs

FuzzingBrain-Bench V1:评估大语言模型的开放式漏洞发现能力

Ze Sheng, Aleksandar Kezic, Zhicheng Chen, Jeff Huang

机构 * Texas A&M University(得克萨斯农工大学) University of Novi Sad(诺威萨大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出FuzzingBrain-Bench V1基准,评估Claude系列大模型的开源软件漏洞发现能力,其中Claude Opus 4.8表现最佳,在77项挑战中60项触发崩溃,得196分。

Comments 21 pages, 12 figures, 7 tables. Ze Sheng and Aleksandar Kezic contributed equally. Benchmark corpus and harnesses: this https URL (https://github.com/fuzzingbrain/FuzzingBrain-Bench) Counts verified against the built PDF and sources: 21 pages, 12 figure environments, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24977 2026-08-27 cs.CR cs.CL cs.LG 新提交 73%

Retrieved But Not Reliable: A Survey on Attacks, and Defenses in Retrieval-Augmented Generation

可检索但不可靠:检索增强生成中的攻击与防御研究综述

Minh Tran, Cuong Dang, Tuc Nguyen, Khanh-Tung Tran, Minh Huynh Nguyen, Trinh Chau, Kien Le, Do Xuan Long, Jiahao Zhang, Hoang D. Nguyen, Thanh Le, Suhang Wang

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本综述针对检索增强生成(RAG)的安全与鲁棒性问题,形式化其各阶段威胁模型,分类攻击目标并梳理各阶段防御及评估方法,为该领域提供统一研究框架。

Comments 24 pages, 6 figures. Accepted to Findings of the Association for Computational Linguistics: EMNLP 2026. Peer-reviewed through ACL Rolling Review (ARR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24937 2026-08-27 cs.LG cs.AI 新提交 73%

Multi-Modal Anomaly Detection: A Survey

多模态异常检测:一项综述

Xudong Mou, Zexin Wu, Chuan Luo, Shiru Chen, Xudong Liu, Chunming Hu, Renyu Yang

机构 * School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) School of Software, Beihang University(北京航空航天大学软件学院) Shandong Inspur Intelligent Production Technology Co., Ltd(山东浪潮智能生产技术有限公司)

专题命中 评测与基准 :foundation model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 该综述从假设驱动视角梳理多模态异常检测(MMAD),划分两种互补方法范式,探讨基础模型对MMAD的重塑,汇总基准与评估协议并指出未来方向。

Comments Accepted for publication in IEEE Transactions on Big Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24753 2026-08-26 cs.CL cs.AI 新提交 73%

The RAT: A Unified Bayesian Model for RAG Evaluation

RAT:一种用于RAG评估的统一贝叶斯模型

Pius von Däniken, Felix Matthias Saaro, Mark Cieliebak, Jan Deriu

机构 * Centre for Artificial Intelligence(人工智能中心) ZHAW School of Engineering(苏黎世应用科技大学工程学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 针对RAG系统评估的不足,提出RAT统一贝叶斯框架,联合建模多维度指标,通过27种配置验证其能揭示系统差异,还分析了注释分配并扩展模型以结合人工与自动评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24735 2026-08-26 cs.AI cs.CL cs.SY eess.SY 新提交 73%

Meta$^n$: Recursive Self-Improvement through Emergent Depth

Metaⁿ:通过涌现深度实现递归自我改进

Zae Myung Kim, Young-Jun Lee, Seungyeon Jwa, Dongyeop Kang

机构 * University of Minnesota(明尼苏达大学) Seoul National University(首尔大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 Metaⁿ将元操作固定后对输入递归,使各层从更高视角推理,在8个基准族上优于现有自我改进智能体,是ARC-AGI-2上唯一得分超0的模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23848 2026-08-26 cs.AI cs.LG 新提交 73%

Exploit More, Explore Smarter for Budget-Constrained Agentic Search

面向预算受限的智能体搜索:更充分利用,更智能探索

Haoyang Fang, Bernie Wang

机构 * Amazon AGI(亚马逊AGI)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 针对预算受限的智能体搜索场景,提出ExTS树搜索策略,结合三种机制优化树搜索,在多项任务上实现性能提升,还提供了问题结构差异的诊断方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23252 2026-08-25 cs.LG cs.CL cs.IR 新提交 73%

The Laws of Context Allocation: Causal Measurement and Closed-Loop Orchestration in Generative Search

上下文分配定律:生成式搜索中的因果测量与闭环编排

Peiyang Liu, Xi Wang, Di Liang, Wei Ye

机构 * National Engineering Research Center for Software Engineering, Peking University(北京大学国家软件工程研究中心) Peking University(北京大学) Tencent(腾讯)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 该研究针对RAG的证据利用测量与上下文预算分配瓶颈,提出因果留一法探针与闭环次模调度器,实现组合召回率提升16.7-20.5个百分点,确立顺序反馈驱动编排为生成式搜索的范式。

详情

展开后加载摘要…

URL PDF HTML 收藏