arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-24 至 2026-08-24 共收录 94 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 7 篇

2608.21265 2026-08-24 cs.CL 新提交 90%

Memory Augmentation Unlocks Efficient Chain-of-Thought Reasoning

记忆增强解锁高效思维链推理

Simeng Zhang, Yilong Chen, Wenyuan Zhang, Zhenyu Zhang, Yao Chen, Junyuan Shang, Tingwen Liu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) Baidu Inc.(百度公司) Tencent Inc.(腾讯公司)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract,abstract_cn);分类 cs.CL

AI总结 该研究提出无需训练的记忆增强压缩框架,构建可复用推理记忆提升思维草稿压缩效果,在多任务上获显著准确率提升并加速推理,兼容多种压缩机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20362 2026-08-24 cs.CL cs.LG 新提交 84%

Multilingual Verifier Bias in RLVR: Benchmark, Rollout Diagnosis, and the Cross-Lingual Selection Bottleneck

RLVR中的多语言验证器偏差:基准、推理诊断与跨语言选择瓶颈

Chenyu Zhou, Qiliang Jiang, Xu Zhou

机构 * School of Engineering, Institute of Science Tokyo(科学东京大学工程学院) College of Control Science and Engineering, Zhejiang University(浙江大学控制科学与工程学院) Department of Electrical and Computer Engineering, National University of Singapore(新加坡国立大学电气与计算机工程学院)

专题命中 数学推理 :verifier(title,abstract);reasoning(abstract);分类 cs.CL、cs.LG

AI总结 研究发现多语言RLVR中存在验证器偏差,引入审计协议定位到最终答案接口的机制,提出跨语言选择瓶颈,rule-GRPO可提升可信准确率。

Comments 16 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09052 2026-08-24 cs.LG cs.AI cs.CL cs.GT stat.ML 版本更新 82%

INFUSER: Influence-Guided Self-Evolution Improves Reasoning

INFUSER: 影响力引导的自我进化提升推理能力

Siyu Chen, Miao Lu, Beining Wu, Heejune Sheen, Fengzhuo Zhang, Shuangning Li, Zhiyuan Li, Jose Blanchet, Tianhao Wang, Zhuoran Yang

机构 * Yale University(耶鲁大学) Stanford University(斯坦福大学) University of Chicago(芝加哥大学) Toyota Technological Institute at Chicago(芝加哥丰田技术研究所) University of California, San Diego(圣地亚哥大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出INFUSER框架,通过生成器与求解器的协同进化,利用影响力分数和DuGRPO优化,从文档池中自适应生成训练数据,显著提升模型推理性能。

Comments 67 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20717 2026-08-24 cs.AI 新提交 79%

DirEAG: Dirichlet Evidence Aggregation for Calibrating Verbalized Confidence in Mathematical Reasoning

DirEAG:用于校准数学推理中口头表述置信度的Dirichlet证据聚合方法

Haorui Xu, Yuzhou Zhu, Liyuan Gao

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 针对大语言模型数学推理中口头表述置信度难以校准的问题,提出DirEAG方法,将置信度观测值转换为校准软证据,在多个数据集和模型上验证其校准效果优于现有方法。

Comments 16 pages, 3 figures. Code is available at this https URL (https://github.com/horacehsugithub/DirEAG). Accepted by PRICAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10903 2026-08-24 cs.CL 版本更新 79%

Beyond Gold Standards: Epistemic Ensemble of LLM Judges for Formal Mathematical Reasoning

超越黄金标准:用于形式化数学推理的LLM评判者的认知集成

Lan Zhang, Marco Valentino, Jordan Meadows, Andre Freitas

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本研究提出基于LLM评判者的认知与形式化基础集成(EFG),用于系统自动评估形式化数学推理中的语句自动形式化任务,实验证实其比粗粒度模型更具适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13517 2026-08-24 cs.CL cs.AI 版本更新 74%

DFM Mimir v1: An Open HRM Delivering Frontier Performance at 1B Parameters Using Only Permissible Post-Training Data

DFM Mimir v1:仅使用许可的后训练数据,在10亿参数规模下实现前沿性能的开放HRM模型

Peter Schneider-Kamp, Jacob Nielsen, Gianluca Barmina, Kenneth Enevoldsen, Lukas Galke Poech

专题命中 数学推理 :reasoning(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 研究人员因大模型开发依赖非许可数据受阻,本文提出仅用许可后训练数据训练的10亿参数HRM模型Mimir v1,其在多基准测试中性能优于同规模HRM-Text 1B,可与更大前沿模型媲美,且在丹麦语任务达新SOTA,已发布于Hugging Face Hub

Comments Technical Report, 20 Pages, 1 Model, Hierarchical Reasoning Model, v2: added memorization audits

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20519 2026-08-24 physics.med-ph cs.AI 新提交 57%

An integrated diffusion-weighted imaging processing and interpretation platform for MR-guided radiotherapy

用于磁共振引导放疗的扩散加权成像处理与解释一体化平台

Yunxiang Li, Yan Dai, Yen-Peng Liao, Jie Deng, Jill B De Vis, You Zhang

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究开发了一体化网络平台,整合MR-Linac的DWI后处理与可追溯的RAG临床解释,经专家评分验证其在胶质母细胞瘤病例中具有高临床实用性。

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 1 篇

2608.20348 2026-08-24 cs.CL cs.AI 新提交 76%

Inhibitory Attention for Clinical Long-Context Reasoning: Characterizing and Mitigating Lost-in-the-Middle Effects in EHR Processing

用于临床长上下文推理的抑制注意力:电子病历处理中中间信息丢失效应的表征与缓解

Sanjay Basu

机构 * University of California San Francisco(加利福尼亚大学旧金山分校) Waymark(韦马克公司)

专题命中 代码与定理证明 :reasoning(title);分类 cs.CL、cs.AI

AI总结 该研究针对电子病历处理中的临床中间信息丢失问题,提出查询条件化临床抑制方法,经实验验证其在中间位置指令及整体任务上的表现均优于多种基线检索与重排序方法。

Comments 29 pages, 5 figures. Code: this https URL (https://github.com/sanjaybasu/inhibitory-attention-ehr)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 2 篇

2608.01347 2026-08-24 cs.CL 版本更新 79%

Prompt-Induced Waste in Coding Agents: Reasoning, Effort, Harness Design, and End-to-End Cost

提示词诱导的大推理模型浪费:一项预注册的双框架编码智能体基准测试

Sarel Weinberger, Amir Hozez

机构 * PointFive

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL

AI总结 该研究通过预注册基准测试发现,提示词措辞和智能体框架会大幅影响大推理编码智能体的成本,部分提示指令可成倍增加推理成本却不提升任务成功率,框架选择的成本差异更显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27204 2026-08-24 cs.CR cs.SE 版本更新 78%

MalSkills: Detecting Malicious Skills in the Agentic Supply Chain via Neuro-symbolic Reasoning

我的爱,华生。通过神经符号推理跨异构工件检测恶意技能

Shenao Wang, Junjie He, Yanjie Zhao, Yayi Wang, Kan Yu, Haoyu Wang

专题命中 逻辑推理 :reasoning(title,abstract)

AI总结 本文提出MalSkills框架,通过符号解析与LLM语义分析提取异构工件中的安全敏感操作,构建技能依赖图并进行神经符号推理,实现恶意技能检测,实验表明其在F1得分上优于现有方法。

Comments Accepted by ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 26 篇

2608.20359 2026-08-24 cs.CL 新提交 92%

Self-Speculation for Faster Reasoning Models

用于更快推理模型的自推测技术

Ravisri Valluri, Tung Nguyen, Aditya Grover

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract,abstract_cn);CoT(abstract,abstract_cn);planning(abstract)

AI总结 该研究针对LLM推理延迟问题,提出无需训练的SSR自推测解码方法,结合思维链与后缀解码,在Qwen3.5、Gemma-4等模型上实现总生成延迟最高24.1%的相对提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20670 2026-08-24 cs.AI cs.CL 新提交 84%

Why2Speak: Faithful Reasoning for Abstaining Action Policies

Why2Speak:弃权(不执行)策略的忠实推理

Shreya Mendi, Brinnae Bent

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对智能体需在行动与弃权间选择的问题,以多方对话干预为场景,对比多种策略,发现能力与可审计性的权衡,分析现有方法缺陷并提供监督评估的控制方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21180 2026-08-24 eess.IV cs.CV 新提交 82%

Toward Vision Language Model-based Assessment of Clinical Quality and Usability of LGE-MR Images for Cardiac Ablation Planning

面向基于视觉语言模型的LGE-MR图像临床质量与可用性评估以用于心脏消融规划

Bipasha Kundu, Abhishek Chaturvedi, Axel W. E. Wismueller, Richard Simon, Cristian A. Linte

专题命中 规划推理 :planning(title,abstract);reasoning(abstract)

AI总结 本研究提出两阶段VLM框架用于左心房LGE-MRI的临床导向图像质量评估,在60个图像切片-文本对数据集上,InternVL2的标准级准确率最高,DeepSeek实现完美临床可用性一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21186 2026-08-24 cs.LG 新提交 79%

A Neurosymbolic Approach for Constructing Planning Domain Models from Clinical Narratives

一种从临床叙事构建规划领域模型的神经符号方法

Ranveer Singh, Saurabh Mathur, Michael Skinner, Prasad Tadepalli, Kristian Kersting, Sriraam Natarajan

专题命中 规划推理 :planning(title,abstract);分类 cs.LG

AI总结 针对临床叙事难以构建外科手术概率规划模型的问题,提出神经符号框架NSPIN,结合预训练LLM从2660份阑尾切除术记录生成的模型可泛化且符合临床实践。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21157 2026-08-24 cs.DC cs.AI 新提交 79%

HIERA: Workload-Aware Planning Across Implementation Spaces for GPU Kernel Optimization

HIERA:面向GPU内核优化的跨实现空间工作负载感知规划

Jinghao Wang, Qiqi Gu, Chenpeng Wu, Jianguo Yao, Haibing Guan, Xijun Li

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 HIERA是一种跨实现空间的GPU内核优化分层规划框架,在KernelBench实验中优于无训练方法,还在科学计算模板算子上实现1.53倍加速,无需额外训练即可接近CUDA-L1性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20564 2026-08-24 cs.AI 新提交 79%

Consilience: Conformally Calibrated Communication Control for Hidden-Profile Multi-Agent Reasoning

Consilience:用于隐式多智能体推理的保形校准通信控制

Abhijith Babu, Ramneet Kaur, Vishal Pramanik, Olivera Kotevska, Nathaniel D. Bastian, Susmit Jha, Sunny Raj, Yanzhao Wu, Sumit Kumar Jha, Anirban Roy

机构 * Knight Foundation School of Computing and Information Sciences, Florida International University(佛罗里达国际大学奈特基金会计算与信息科学学院) SRI International(SRI国际公司) University of Florida(佛罗里达大学) Oak Ridge National Laboratory(橡树岭国家实验室) Army Cyber Institute, United States Military Academy(美国军事学院陆军网络研究所) Oakland University(奥克兰大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出Consilience框架,通过轮次保形校准程序保证多智能体通信控制的可靠性,在HiddenBench任务上提升了决策准确性与通信效率,优于现有协议甚至全信息基线。

Comments 39 pages, 2 figures, 9 tables. Includes appendix with full proof of Proposition 1, expanded results, ablations, and complete prompt templates

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20405 2026-08-24 cs.CL 新提交 79%

ARGUS: Theory-of-Mind Guided Argument Generation with Strategy-Aware Planning and Knowledge Grounding

ARGUS:基于心理理论(Theory-of-Mind)的论证生成,结合策略感知规划与知识接地

Zhe Hu

机构 * InspireOmni AI The Hong Kong Polytechnic University(香港理工大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.CL

AI总结 该研究提出基于智能体的Argus框架,结合心理理论推理、策略感知规划等,在三个基准上优于基线,可有效改变抗拒受众立场。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11821 2026-08-24 cs.LG 版本更新 79%

Reinforcing Multi-Turn Reasoning in LLM Agents via Fine-Grained Reward Structure and Credit Assignment

通过细粒度奖励结构与信用分配增强大语言模型智能体的多轮推理能力

Quan Wei, Siliang Zeng, Chenliang Li, Zhongruo Wang, William Brown, Oana Frunza, Wei Deng, Anderson Schneider, Yuriy Nevmyvaka, Yang Katie Zhao, Alfredo Garcia, Mingyi Hong

机构 * University of Minnesota(明尼苏达大学) Texas A&M University(德克萨斯A&M大学) Prime Intellect Morgan Stanley(摩根大通)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.LG

AI总结 本文针对LLM智能体多轮推理的信用分配问题,提出适配三类奖励结构的GRPO与PPO算法,实验证实密集每轮奖励结构优于稀疏奖励,PPO在搜索任务上表现最优。

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14313 2026-08-24 cs.LG cs.AI 版本更新 73%

AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning

你的强化学习奖励函数是你的最佳搜索PRM:统一强化学习与基于搜索的文本生成

Can Jin, Yang Zhou, Qixin Zhang, Hongwu Peng, Di Zhang, Zihan Dong, Marco Pavone, Ligong Han, Zhang-Wei Hong, Tong Che, Dimitris N. Metaxas

机构 * Rutgers University(新泽西州立大学) Nanyang Technological University(南洋理工大学) University of Connecticut(康涅狄格大学) Fudan University(复旦大学) NVIDIA Research(NVIDIA研究) Red Hat AI Innovation(红帽AI创新) MIT-IBM Watson AI Lab(MIT-IBM沃森AI实验室) Massachusetts Institute of Technology(麻省理工学院)

专题命中 规划推理 :reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AIRL-S,通过强化学习与搜索技术的统一,利用奖励函数直接学习动态PRM,提升推理链扩展和跨任务泛化能力,实验显示性能提升9%并优于基线PRM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20631 2026-08-24 cs.AI 新提交 70%

Weighted Memory Tree: Remembering What Matters for Long-Horizon LLM Agents

加权记忆树:为长视野大语言模型智能体记住重要信息

Quang Dao, Purvi Kathalkar, Kenneth Eaton

机构 * Rose-Hulman Institute of Technology(罗斯-霍曼理工学院) Georgia Institute of Technology(佐治亚理工学院) Georgia Tech Research Institute(佐治亚理工学院研究院)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 提出加权记忆树(WMT)分层记忆系统,在GAIA-Text数据集上使LLM智能体准确率平均提升9.97个百分点、令牌用量减32.8%,可抑制低效用内容与不可靠信息传播。

Comments 16 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20379 2026-08-24 cs.AI 新提交 70%

A Survey on Foundations and Frontiers of Multimodal Agentic Frameworks: Techniques and Applications

多模态智能体框架的基础与前沿:技术及应用综述

Neel Mokaria, Rishie Raj, Dheeraj Baiju, Xiaoqian Shen, Shraman Pramanick, Kevin Qinghong Lin, Arda Senocak, Mike Zheng Shou, Philip Torr, Mohamed Elhoseiny, Yapeng Tian, Ruohan Gao, Salman Khan, Sayan Nag, Sanjoy Chowdhury, Dinesh Manocha

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本综述针对多模态在智能体框架核心模块的作用展开系统分析,梳理了其架构整合方式、应用领域及效率权衡,为通用智能系统研究指明方向。

Comments Accepted at TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13988 2026-08-24 cs.AI 版本更新 70%

Recognizing Artificial Minds: A Philosophical Defense of AI Cognition

识别人工心智:对AI认知的哲学辩护

Herman Cappelen, Josh Dever

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 该研究为“全猪论题”辩护,主张LLMs是具备认知状态的成熟智能体,反驳相关质疑并推测其可能拥有人类概念体系外的内容。

Comments Pre-publication draft. Forthcoming as Open Access from Oxford University Press. Please cite the OUP version when available. Note title change: previously, "Going Whole Hog: A Philosophical Defence of AI Cognition"

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20953 2026-08-24 cs.CL cs.AI cs.LG cs.PF 新提交 67%

Quantization-Aware Healing: A Practical Recipe for Recovering Compressed, 4-Bit LLMs

量化感知修复:恢复压缩4位大语言模型的实用方案

Bakbergen Ryskulov, Iker García-Ferrero, David Montero, David Jansen, Ali Hashemi, Jezabel R. Garcia, Antonio Tiene, Román Orús

机构 * Multiverse Computing(多元宇宙计算公司)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对压缩4位大模型部署时性能下降问题,提出量化感知修复方案,直接从原始未压缩模型蒸馏4位学生模型,在多基准测试中表现优于量化感知训练,且部署便捷。

Comments Patent Application Number: 26382838.6 / P202602102EP

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20661 2026-08-24 cs.AI cs.CE cs.CL cs.IR 新提交 62%

Auditable by Construction: An Ontology-Driven Framework for Trustworthy LLM Analytics in Enterprise Finance

可审计性原生:面向企业金融领域可信大语言模型分析的本体驱动框架

Sergiy Lunyakin

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 本文针对企业金融大语言模型应用的信任问题,提出知识驱动分析框架KDAF,结合本体与CARP技术,在FinanceBench评估中,其可审计性优于基线方法,表明可审计性是该框架的核心优势。

Comments 20 pages, 1 figure, 4 tables, 1 algorithm. Artifact deposit with configurations, ontology schema, prompts, audit reports and reconstruction scripts: this https URL (https://doi.org/10.5281/zenodo.22022068)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20392 2026-08-24 cs.CL cs.AI 新提交 62%

Evaluation-as-Search: Adaptive Discovery of Grounding Failures in Meeting Assistants

评估即搜索:会议助手接地故障的自适应发现

Sami Khairy, Yasaman Hosseinkashi, Vishak Gopal, Ross Cutler

机构 * Microsoft(微软公司)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出EaS方法构建MeetingProbe基准,发现会议助手故障多源于话语语用挑战,其自适应搜索比随机探测的故障发现率高2.5倍,且公开了该基准以支持可复现评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20830 2026-08-24 cs.CY cs.LG 新提交 61%

Fine-tuning LLMs for Tourist Trajectory Prediction using Field Experiment Data

利用实地实验数据微调大型语言模型(LLMs)进行游客轨迹预测

Tatsuya Amano, Hirozumi Yamaguchi

专题命中 规划推理 :reasoning(abstract);分类 cs.LG;planning(comments)

AI总结 该研究利用日本和歌山城公园的566条轨迹微调Llama-3.1-8B,实现49.1%的下一个兴趣点准确率,在样本不足场景泛化性强,为旅游轨迹预测提供了高保真行为模型及反事实分析基础。

Comments 5 pages, 4 figures. Accepted at the 2nd Workshop on AI for Urban Planning (AI4UP) at AAAI-26, Singapore, January 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21027 2026-08-24 cs.AI 新提交 57%

Don't Solve, Just Compare: Tiny Advisors for Runtime Intervention in LLM Agents

无需解决,仅需比较:用于LLM智能体运行时干预的微型顾问

Yanze Jiang, Mingxuan Li, Yuhao Wang, Shengfang Zhai, Jiaheng Zhang

机构 * National University of Singapore(新加坡国立大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究针对LLM智能体运行时干预需求,提出仅比较框架COTA,经多任务多执行器评估,其性能优于基线,可在辅助模型能力弱于执行器时实现有效干预。

Comments 21 pages, 1 figure, Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20966 2026-08-24 cs.CR cs.AI 新提交 57%

Structured but Fragile: On the Limits of LLMs in Cybersecurity Decision-Making

结构化但脆弱:大型语言模型(LLMs)在网络安全决策中的局限性

Pasquale Malacaria, Yunxiao Zhang

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究探讨LLMs在网络安全决策中的表现,发现其在明确攻击图结构时能产生接近优化基线的策略,但随复杂度增加而脆弱,对提示敏感,且无法稳健应用结构化推理,为AI辅助安全决策系统设计评估提供参考。

Comments 31 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20845 2026-08-24 cs.AI cs.DB cs.IR 新提交 57%

RAG Deserves an Index: Why Ingest-Time Compilation Beats Query-Time Interpretation

检索增强生成(RAG)值得一个索引:为什么摄入时编译优于查询时解释

Kyle Wild, Yusuke Takahashi, Asako Uraki

机构 * Endgame Labs, Inc.(终局实验室公司) Asia AI Institute(亚洲人工智能研究院) Musashino University(武藏野大学) Faculty of Data Science, Musashino University(武藏野大学数据科学学院) AIx, Inc.(AIx公司)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 该研究提出摄入时语义编译(ISC)范式,将语料编译为可查询数据库对象,实验显示其检索效果优于传统RAG方法,增量更新成本更低,为RAG提供了索引化解决方案。

Comments Position paper. 6 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20771 2026-08-24 cs.AI 新提交 57%

CAS: Conformalized Agentic Search via Adaptive Retrieval and Policy Weighting

CAS:通过自适应检索与策略加权实现的保形智能体搜索

Zixi Zhu, Jiayuan Su, Jian Zhang, Yu Lin, Hongwei Wang

机构 * Zhejiang University(浙江大学) ZJU-UIUC Institute, Zhejiang University(浙江大学ZJU-UIUC学院) Tencent Inc.(腾讯公司)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究针对搜索智能体RL微调的可靠性问题,提出CAS框架,通过自适应检索与策略加权结合CP技术,提升推理准确率并减少冗余搜索,构建高可靠高效智能体范式。

Comments 21 pages, including figures, tables, and appendix

详情

展开后加载摘要…

URL PDF HTML 收藏