arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-27 至 2026-08-27 共收录 36 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 36 篇

2511.11635 2026-08-27 cs.CY cs.AI cs.CL 版本更新 85%

EduAgentQG: Multi-Agent Personalized Mathematics Question Generation with Explicit Diversity and Objective-Aware Evaluation

EduAgentQG:具有显式多样性和目标感知评估的多智能体个性化数学问题生成

Rui Jia, Min Zhang, Fengrui Liu, Bo Jiang, Kun Kuang, Zhongxiang Dai

机构 * East China Normal University(东华大学) Shanghai Institute of Al for Education(上海人工智能教育研究院) The Chinese University of Hong Kong, Shenzhen School of Data Science(香港中文大学(深圳)数据科学学院)

专题命中 推理评测 :CoT(summary_cn,abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本文针对现有数学问题生成方法难以兼顾目标对齐与可控多样性的问题,提出多智能体框架EduAgentQG,构建专属基准并验证其在多项指标上优于COT等基线方法。

Comments Accepted to IPM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25667 2026-08-27 cs.CR cs.AI 新提交 83%

AI Slop and Hallucinations in Vulnerability Assessment: A Survey on Reasoning Failures and Trustworthy Mitigation

漏洞评估中的AI垃圾内容与幻觉:关于推理失败及可信缓解措施的综述

Junchen Ding, Jialiang Dong, Yichen Zhu, Yi Liu, Gelei Deng, Willy Susilo, Siqi Ma, Yuekang Li

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本综述针对LLMs用于漏洞评估时产生的AI垃圾内容与幻觉问题,分析其源于专家演绎推理与LLMs自回归生成的差距,提出神经符号验证等缓解方案及CVE-Bench等评估工具,为AI驱动的安全分诊系统提供路线图。

Comments Accepted to SiMLA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26036 2026-08-27 cs.AI cs.CL 新提交 81%

Trace Integrity for LLM Data Agents: A Vision for Auditable Structured Reasoning in Real-World Systems

LLM数据智能体的追踪完整性:现实世界系统中可审计结构化推理的愿景

Srimonti Dutta, Akshata Kishore Moharir

机构 * WAI USA Research Labs(WAI美国研究实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文针对LLM数据智能体提出追踪完整性标准,结合执行契约实现,通过CAIT率实验表明需同时评估答案准确率与可审计计算,为现实系统的LLM数据智能体提供评估方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25177 2026-08-27 cs.SD cs.AI 新提交 79%

AudioLens: Multi-Perspective Speech Clustering with Reasoning Audio-Language Models

AudioLens:基于推理音频-语言模型的多视角语音聚类

Wenjun Huang, Qiaosong Chu, Tiger Shao, Pengfei Zhang, Yutong Song, Hanning Chen, Yezi Liu, Weiyi Wu, SungHeon Jeong, Ryozo Masukawa, Sanggeon Yun, Yang Ni, Jiang Gui, Mohsen Imani

机构 * University of California, Irvine(加利福尼亚大学欧文分校) Dartmouth College(达特茅斯学院) Purdue University Northwest(普渡大学西北分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 该研究提出音频多视角聚类任务,构建基准AudioLens-Bench,开发经推理蒸馏和偏好优化训练的AudioLens-R1模型,实验显示其在语音聚类任务中性能优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08636 2026-08-27 cs.CL 版本更新 79%

InternBootcamp: Boosting LLM Reasoning with Verifiable Task Scaling

InternBootcamp 技术报告:通过可验证的任务扩展提升大语言模型推理能力

Peiji Li, Jiasheng Ye, Yongkang Chen, Linyang Li, Yichuan Ma, Zijie Yu, Ganqu Cui, Haozhan Li, Jiacheng Chen, Chengqi Lyu, Wenwei Zhang, Qipeng Guo, Dahua Lin, Bowen Zhou, Kai Chen

机构 * Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出InternBootcamp框架,通过可验证的任务扩展方法提升大语言模型的推理能力,为基于强化学习的模型优化、合成数据生成和模型评估提供了基础设施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09772 2026-08-27 cs.AI 版本更新 79%

Two Heads are Better Than One: Test-time Scaling of Multi-agent Collaborative Reasoning

两个脑袋胜过一个:测试时扩展多智能体协作推理

Can Jin, Hongwu Peng, Qixin Zhang, Yang Zhou, Yujin Tang, Tong Che, Dimitris N. Metaxas

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 该研究针对单智能体测试时扩展(TTS)的瓶颈,提出用多智能体系统(MAS)升级TTS,引入M500数据集并结合CEO智能体的自适应策略,微调的Qwen2.5-32B-MAS等模型性能优于基础模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05788 2026-08-27 cs.LG cs.AI cs.CL 版本更新 75%

Emergent Abilities in Large Language Models: A Survey

大语言模型中的涌现能力:一项综述

Leonardo Berti, Flavio Giorgi, Gjergji Kasneci

专题命中 推理评测 :reasoning(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本综述全面梳理大语言模型(LLMs)及大推理模型(LRMs)的涌现能力,分析其定义、出现条件,同时指出其潜在有害行为,强调需完善评估框架与监管监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24958 2026-08-27 cs.SD cs.AI cs.CL 新提交 73%

Can We Read the Mind of an Audio LLM? A Verbalizable, Multilingual Middle-Layer Workspace

我们能否解读音频大语言模型的思维?一个可解读的多语言中间层工作空间

Jiajun Fan, Jingyuan Li, Prashanth Gurunath Shivakumar, Qi Luo, Jia-Hong Huang, M. Maruf, Roger Ren, Yile Gu, Rahul Pandey, Ge Liu, Ivan Bulyko

机构 * Amazon AGI Foundations(亚马逊AGI基金会) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过logit lens分析Qwen3-Omni模型,发现其中间层可在输出前清晰呈现音频问题答案,揭示了音频模型推理的特性与信号分布,为解读音频大语言模型内部思维提供了定性依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25869 2026-08-27 cs.CL 新提交 70%

Anchoring Bias in LLM-as-a-Judge Systems: Prior Scores Compromise Evaluation Independence

LLM作为评判者系统中的锚定偏差:先验分数损害评估独立性

Ante Kapetanovic, Kemal Altwlkany, Andro Mercep, Tomislav Duricic, Emanuel Lacic

机构 * Infobip(英福比普(Infobip))

专题命中 推理评测 :chain-of-thought(abstract,abstract_cn);分类 cs.CL

AI总结 该研究发现LLM-as-a-Judge系统存在锚定偏差,先验分数作为元数据会系统性偏移LLM的评估结果,且现有缓解措施效果有限,需针对性设计评估方案。

Comments 10 pages, full research paper, to appear in proceedings of the 35th ACM International Conference on Information and Knowledge Management (CIKM '26), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03890 2026-08-27 cs.CV 版本更新 67%

OVO-S-Bench: A Hierarchical Benchmark for Streaming Spatial Intelligence in Multimodal LLMs

OVO-S-Bench:多模态大语言模型中流式空间智能的分层基准

Yifei Li, Pengyiang Liu, Yuhang Zang, Zhongyue Shi, Qi Fu, Hongye Hao, Jiwen Lu

机构 * Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室) Beihang University(北京航空航天大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract)

AI总结 提出OVO-S-Bench,一个完全人工标注的流式空间智能基准,包含1680个问题,涵盖四个抽象层次,评估38个MLLM,发现Gemini-3.1-Pro落后人类专家27分,流式空间微调MLLM表现不如其骨干模型。

Comments Accepted to EMNLP 2026 Main Conference. 55 pages, 12 figures, 20 tables. Project page: this https URL (https://internlm.github.io/OVO-S-Bench/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25922 2026-08-27 cs.CL cs.AI cs.IR 新提交 62%

Query-Side Attacks on GNN-Based KGQA: Tracing Failures from Entity Linking to Answer Generation

基于图神经网络的知识图谱问答(KGQA)的查询侧攻击:从实体链接到答案生成的失败溯源

Pankaj Kumar, Subhankar Mishra

机构 * National Institute of Science Education and Research(国家科学教育与研究学院) Homi Bhabha National Institute(霍米·巴巴国家学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对基于GNN的KGQA流水线提出两种查询侧对抗扰动,发现子图构建是鲁棒性瓶颈,而非GNN推理,为KGQA的鲁棒性优化提供了明确方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25660 2026-08-27 cs.CL cs.AI 新提交 62%

Think-Probe-Respond: Improving Large Language Models as Judges of Research Idea Novelty

Think-Probe-Respond:提升大型语言模型作为研究创意新颖性评判者的能力

Tim Schopf, Tobias Schreieder, Akiko Aizawa

机构 * National Institute of Informatics(情报研究综合研究所) TU Dresden(德累斯顿工业大学) ScaDS.AI Dresden/Leipzig(德累斯顿/莱比锡应用数据科学中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对大型语言模型评判研究创意新颖性时的“中等新颖”偏差,提出TPR轻量方法,通过探测推理阶段隐藏状态的潜在评判约束最终响应,使性能提升22.30%。

Comments Accepted to EMNLP 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25325 2026-08-27 cs.AI cs.CL 新提交 62%

FinRiskAtlas: Decision-Aligned Evaluation of Large Language Models for Financial Risk Review

FinRiskAtlas:面向金融风险审查的决策对齐大语言模型评估

Suyang Zhong, Jingzhe Zhu, Qi Xu, Liyao Sun, Yin Wang, Qingqing Sun, Shuai Chen, Tianyi Zhang

机构 * Ant International(蚂蚁集团) Xiamen University(厦门大学) Shanghai University(上海大学) Tongji University(同济大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究推出面向金融风险审查的中文基准FinRiskAtlas,从操作执行与证据状态控制两维度评估金融大语言模型,发现通用金融能力评分无法完全反映模型在专业工作流程中的可靠性,需采用决策对齐的评估单元。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25005 2026-08-27 cs.CL cs.LG 新提交 62%

The Imperfective Paradox Is Not Necessarily in Large Language Models: A Benchmark Failure Before a Model Failure

进行体悖论不一定存在于大型语言模型中:模型失效前的基准失效

Kaiqiao Han, Yizhou Sun

机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 该研究发现进行体悖论相关的基准失效,构建词汇匹配最小对并评估多步推理,揭示模型的充分性偏差等失效模式,表明部分大模型体分类性能可媲美人类标注者。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18062 2026-08-27 cs.CL cs.LG 版本更新 62%

TokEval: A Tokenizer Evaluation Suite

TokEval:一个分词器评估套件

Clara Meister

机构 * EPFL(洛桑联邦理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本研究推出TokEval框架,通过信息论、结构敏感等指标评估分词器,经实验验证其可预测下游模型性能,助力更原则性的分词器评估。

Comments Published as a conference paper at COLM 2026; Library hosted at this https URL (https://github.com/cimeister/tokenizer-intrinsic-evals)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14684 2026-08-27 cs.LG cs.AI 版本更新 62%

Mitigating Rubric Interference in LLM Judges via On-Policy Self-Distillation

通过策略内自蒸馏缓解大语言模型评审员中的评分标准干扰

Dingyao Yu, Tong Zhang, Yutao Mou, Yunxiao Zhang, Wei Ye, Shikun Zhang

机构 * Peking University(北京大学) Weixin Al, Tencent Inc(腾讯公司微信智能)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本研究针对LLM评审员多评分标准评估时的干扰问题,提出SARA方法,通过策略内自蒸馏提升评估一致性,且该一致性可跨数据集迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02585 2026-08-27 cs.AI cs.CL 版本更新 62%

Mitigating LLM biases toward spurious social contexts using direct preference optimization

通过直接偏好优化减轻LLM对虚假社会情境的偏见

Hyunji Nam, Dorottya Demszky

机构 * Stanford University(斯坦福大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了LLM对虚假社会情境的鲁棒性,提出Debiasing-DPO方法,通过自监督训练和监督微调减少偏见并提升预测准确性。

Comments COLM 2026, main text 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25937 2026-08-27 cs.AI cs.MA 新提交 57%

Candidate supply and answer selection shape the value of LLM judging in multi-agent systems

候选供给与答案选择塑造多智能体系统中大语言模型(LLM)评判的价值

Jia-Hao Ji, Sijie Li, Jiabei Cheng, Zixi She, Jin-Tai Yu, Zhiyuan Yuan

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 该研究针对多智能体系统中LLM评判的价值,通过分析多组基准数据集,发现结合答案频率与LLM评判可提升答案准确率,为设计多智能体架构提供了诊断基础。

Comments 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25894 2026-08-27 cs.CL 新提交 57%

From Passive Response to Proactive Correction: Enhancing LLM Robustness Against Input Fact Perturbations

从被动响应到主动修正:增强大语言模型(LLM)对输入事实扰动的鲁棒性

Ping Wang, Xiangguo Sun, Bingbing Xu, Guocong Li, Xiaofeng Meng

机构 * Renmin University of China(中国人民大学) Southeast University(东南大学) Zhejiang University(浙江大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 针对LLM易受输入事实误导产生错误响应的问题,提出三阶段框架DEDUCE,结合新数据集与指标,在多基准上提升了Qwen、LLaMA等系列模型的鲁棒性与错误修正能力。

Comments Accepted to the Main Conference of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25775 2026-08-27 cs.AI 新提交 57%

ToST: A Tree-of-Thought Socratic Teaching Framework for Multi-Path Guidance and Parallel Thinking

ToST:用于多路径引导与并行思考的思维树式苏格拉底教学框架

Feng Ling, Heng Yu

机构 * Beijing Normal University(北京师范大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出ToST框架,采用多路径范式与并行策略,建立MPSG-Bench基准,可提升LLMs苏格拉底教学的引导成功率,助力学生探索多解决方案路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25417 2026-08-27 cs.AI 新提交 57%

Paint What You See: Benchmarking Dexterous Visual Tool Use in Multimodal Agents

绘制你所见:多模态智能体的灵巧视觉工具使用基准测试

Shudong Liu, Dongyang Chen, Enci Zhang, Jinwei Liang, Zheng Ma, Lewei Lu

机构 * Peking University(北京大学) Tsinghua University(清华大学) SenseTime Research(商汤科技研究院)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 本文提出名为EASEL的基准测试,结合44万样本的EASEL-Data数据集与EASEL-9B模型,评估多模态智能体的灵巧视觉工具使用能力,发现现有25个模型在该任务上表现不佳,EASEL-9B相对基础模型提升6.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25398 2026-08-27 cs.CL 新提交 57%

OmniPhys: A Unified Multimodal Benchmark for Physics Understanding and Generation from Chinese Educational Corpora

OmniPhys:面向中文教育语料库的物理理解与生成统一多模态基准

Hao Chen, Yumin Lin, Nadila Yushanjiang, Xin Lin, Min Zhang

机构 * East China Normal University(华东师范大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 研究人员推出OmniPhys这一覆盖中文教育语料库中中学至大学物理问题的大规模多模态基准,含15246个问题与19850张图像,可评估MLLMs的物理理解、推理及结构化图表生成能力,发现当前模型存在复杂推理与视觉生成差距,将推进物理领域多模态智能发展。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24910 2026-08-27 cs.HC cs.AI 新提交 57%

From Plots to Words: Model-Aware Multimodal Explanations as a Foundation for Accessible, Non-Visual Interaction

从图表到文本:模型感知的多模态解释作为可访问非视觉交互的基础

Nur Keleşoğlu, Łukasz Sobczak, Joanna Domańska

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 该研究提出多智能体框架,将时间序列预测的视觉输出转为模型感知文本解释,可提升非视觉交互的可访问性,其可解释配置使解释质量最高提升32%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24886 2026-08-27 cs.AI 新提交 57%

VLM-based automatic multi-granularity graph representation of building layouts for design informatics

基于视觉语言模型的建筑布局多粒度图自动表示方法,用于设计信息学

Song Guo, Zhuoshi Chen, Maosu Li, Weimin Zhuang

机构 * Massachusetts Institute of Technology(麻省理工学院) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Tsinghua University(清华大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出基于VLM的多粒度图自动构建方法,以147份高校图书馆平面图为案例,验证其生成的图与人工标注图一致性良好,可用于设计信息学相关任务,提升建筑全生命周期设计信息利用率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25097 2026-08-27 cs.AI cs.MM math-ph 新提交 57%

PhysElite: How Far Are LLMs from Solving Olympiad-Level Physics Problems?

PhysElite:大型语言模型在解决奥林匹克级物理问题上的表现差距有多大?

Ruoran Xu, Wending Gao, Liyunfeng Chen, Aixin Shi, Haoyu Cheng, Zixiang Fang, Yiqiang Zou, Qiufeng Wang

机构 * Xi’an Jiaotong-Liverpool University(西交利物浦大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出PhysElite基准,含11586道奥林匹克级物理题及配套资源,测试18款MLLM发现最强者准确率仅33.7%,还开展分步流程评估诊断推理失败环节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24625 2026-08-27 cs.CR cs.AI 版本更新 57%

APPA: Recoverable Information-Flow Control for Real-World LLM Agents

用于大语言模型代理中污点限制的代理权限策略代数

Arseny Kravchenko, Vadim Liventsev, Innokentii Konstantinov, Ildar Iskhakov, Matvey Kukuy

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究大语言模型代理处理混合机密数据时的安全风险,提出APPA框架,通过引擎管理上下文分支等解决可用性瓶颈,经双幺半群模型证明相关特性,实验表明其能抑制数据泄露并恢复部分被污点跟踪损失的效用。

Comments 21 pages, 3 figures. v2: Major revision with updated title, MCP protocol gateway architecture, 3-model empirical benchmark (6,600 episodes), recovery ablations, gradual security typing, and complete formal safety proofs

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02689 2026-08-27 cs.CV cs.AI 版本更新 57%

S-EMBER: A Large-Scale Benchmark for Streaming Egocentric Memory Retrieval

S-EMBER:用于流式自我中心记忆检索的大规模基准测试

Xiaodong Wang, Xuanyi Zhao, Pedro Rodriguez, Devendra Singh Sachan, Barlas Oguz, Seungwhan Moon, Shang-Wen Li, Gargi Ghosh, Xin Dong, Wen-Tau Yih

机构 * FAIR, Meta(公平研究院,元公司) Reality Labs, Meta(现实实验室,元公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究针对可穿戴设备连续第一人称记录下AI助手的情景记忆问题,引入S-EMBER基准测试,通过视频及问答对模拟真实交互,发现前沿模型存在定位矛盾,为可穿戴AI代理情景记忆发展奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21147 2026-08-27 cs.SD cs.AI 版本更新 57%

AOR-Bench: Do Large Audio Language Models Over-Refuse Pseudo-Harmful Queries?

AOR-Bench: 大型音频语言模型是否会过度拒绝伪有害查询?

Jiaxi Yang, Chaewan Chun, Jason Lucas, Yuchen Yang, Dongwon Lee

机构 * Penn State University(宾夕法尼亚州立大学)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.AI

AI总结 提出首个针对大型音频语言模型过度拒绝问题的基准AOR-Bench,包含3000个伪有害音频样本,评估12个模型发现过度拒绝普遍存在,并探索了两种轻量缓解策略。

Comments To appear in EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15971 2026-08-27 cs.CL 版本更新 57%

SAG: SQL-Retrieval Augmented Generation with Query-Time Dynamic Hyperedges

SAG: 查询时动态超边的SQL检索增强生成

Yuchao Wu, Junqin Li, Xingcheng Liang, Yongjie Chen, Yinghao Liang, Linyuan Mo, Guanxian Li

机构 * Zleap AI

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出SAG架构,通过SQL查询动态构建局部超边索引,避免全局图维护,在多跳推理基准上达到最优召回率,支持亿级数据生产部署。

Comments v2: revised version, with the earlier copy of this revision inadvertently posted as a separate submission ( arXiv:2608.12129 (https://arxiv.org/abs/2608.12129), now withdrawn)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01975 2026-08-27 cs.AI cs.SE 版本更新 57%

Algorithmic algorithm development with LLMs: A Case Study on LLM-Usage for Contraction Order Optimization in Tensor Networks

基于LLM的算法开发:以张量网络收缩顺序优化中LLM使用为例

Fabian Hoppe, Melven Röhrig-Zöllner, Philipp Knechtges

机构 * German Aerospace Center (DLR), Institute of Software Technology, department High-Performance Computing(德国航空航天中心(DLR)软件技术研究所高性能计算部门)

专题命中 推理评测 :verifier(abstract);分类 cs.AI

AI总结 通过OpenEvolve对张量网络收缩顺序优化的案例研究,探讨了基于LLM的算法开发,重点分析了LLM选择、评估指标和测试实例等设计因素,强调了验证引导的进化编码代理的潜力以及人类科学家在评估、验证和解释方面的重要性与挑战。

Comments Submitted to the proceedings of the deRSE26 conference

详情

展开后加载摘要…

URL PDF HTML 收藏