arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-01 至 2026-01-01 共收录 69 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 20 篇

2505.13414 2026-01-01 eess.IV cs.CV 50%

GuidedMorph: Two-Stage Deformable Registration for Breast MRI

GuidedMorph: 两阶段可变形配准用于乳腺MRI

Yaqian Chen, Hanxue Gu, Haoyu Dong, Qihang Li, Yuwen Chen, Nicholas Konz, Lin Li, Maciej A. Mazurowski

机构 * Department of Electrical and Computer Engineering, Duke University(电子工程系,杜克大学) Department of Biostatistics & Bioinformatics, Duke University(生物统计学与生物信息学系,杜克大学) Department of Health Outcomes and Biomedical Informatics, College of Medicine, University of Florida(健康结果与生物医学信息学系,医学院,佛罗里达大学)

专题命中 规划推理 :planning(abstract)

AI总结 GuidedMorph通过两阶段可变形配准框架提升乳腺MRI的密集组织对齐与结构相似性,实现更精确的肿瘤追踪和诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉空间推理 2 篇

2512.24532 2026-01-01 cs.AI cs.CL 88%

From Building Blocks to Planning: Multi-Step Spatial Reasoning in LLMs with Reinforcement Learning

从积木到规划:通过强化学习在LLMs中实现多步骤空间推理

Amir Tahmasbi, Sadegh Majidi, Kazem Taram, Aniket Bera

机构 * Department of Computer Science(计算机科学系)

专题命中 视觉空间推理 :reasoning(title,abstract);planning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种两阶段方法,通过强化学习在LLMs中实现多步骤空间推理,通过微调和LoRA适配器提升模型在结构环境中的空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22942 2026-01-01 cs.RO cs.AI 70%

AINav: Large Language Model-Based Adaptive Interactive Navigation

AINav: 基于大语言模型的自适应交互导航

Kangjie Zhou, Yao Mu, Haoyang Song, Yi Zeng, Pengying Wu, Han Gao, Chang Liu

机构 * School of Advanced Manufacturing and Robotics, Peking University(北京大学先进制造与机器人学院) AI Institute, School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机学院人工智能研究所)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 AINav通过基于大语言模型的自适应交互导航方法,实现复杂环境中的路径规划与目标达成。

Comments 13 pages, 12 figures, accepted to IEEE Robotics & Automation Magazine

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 测试时计算 7 篇

2504.10481 2026-01-01 cs.CL 88%

xVerify: Efficient Answer Verifier for Reasoning Model Evaluations

xVerify:用于推理模型评估的高效答案验证器

Ding Chen, Qingchen Yu, Pengyuan Wang, Mengting Hu, Wentao Zhang, Zhengren Wang, Bo Tang, Feiyu Xiong, Xinchi Li, Chao Wang, Minchuan Yang, Zhiyu Li

机构 * China Telecom Research Institute(中国电信研究院) MemTensor (Shanghai) Technology Co., Ltd.(MemTensor(上海)技术有限公司) College of Software, Nankai University(南开大学软件学院) Center for Data Science, Peking University(北京大学数据科学中心) Peking University(北京大学) Data Development Center of China Telecom(中国电信数据开发中心)

专题命中 测试时计算 :reasoning(title,abstract);verifier(title,abstract);分类 cs.CL

AI总结 xVerify是一种高效答案验证器,通过VAR数据集训练,能够准确评估推理模型的等价性判断和最终答案提取,实验表明其在多个任务中表现优异。

Comments 35 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06415 2026-01-01 cs.CL cs.LG 81%

PERK: Long-Context Reasoning as Parameter-Efficient Test-Time Learning

PERK:长上下文推理作为参数高效测试时学习

Zeming Chen, Angelika Romanou, Gail Weiss, Antoine Bosselut

机构 * EPFL(瑞士联邦理工学院)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 PERK通过参数高效测试时学习方法,实现对长上下文的高效推理,显著提升模型性能。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23765 2026-01-01 cs.CL cs.AI 81%

Entropy-Aware Speculative Decoding Toward Improved LLM Reasoning

基于熵的推测解码:改进大语言模型推理

Tiancheng Su, Meicong Zhang, Guoxiu He

机构 * School of Economics and Management(经济管理学院)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 基于熵的推测解码通过动态熵惩罚提升大语言模型推理性能,实验表明其在多数情况下优于目标模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.25014 2026-01-01 cs.LG cs.CC 70%

Diffusion Language Models are Provably Optimal Parallel Samplers

扩散语言模型是可证明最优的并行采样器

Haozhe Jiang, Nika Haghtalab, Lijie Chen

专题命中 测试时计算 :chain-of-thought(abstract);CoT(abstract);分类 cs.LG

AI总结 本文证明了通过链式思维和修订,扩散语言模型能够以最优步骤和空间复杂度模拟并行采样算法,从而提升其作为高效并行采样器的理论基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23852 2026-01-01 cs.LG cs.CL 62%

Trellis: Learning to Compress Key-Value Memory in Attention Models

Trellis: 在注意力模型中学习压缩键值记忆

Mahdi Karami, Ali Behrouz, Praneeth Kacham, Vahab Mirrokni

机构 * Google Research(谷歌研究)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 Trellis通过动态压缩键值内存提升注意力模型的效率与长上下文处理能力

Comments In Second Conference on Language Modeling (COLM) (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23760 2026-01-01 cs.CR cs.AI 57%

Audited Skill-Graph Self-Improvement for Agentic LLMs via Verifiable Rewards, Experience Synthesis, and Continual Memory

通过可验证奖励、经验合成和持续记忆对代理LLM进行审计化技能图自改进

Ken Huang, Jerry Huang

机构 * OWASP Fairfax, VA, USA Kleiner Perkins

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 本文提出ASG-SI框架,通过可验证奖励、经验合成和持续记忆实现代理LLM的审计化技能图自改进,以提升安全性和可追溯性。

Comments 11 pages, 4 figures. Includes a complete runnable reference implementation and audit logging framework

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22693 2026-01-01 cs.CV 50%

VADTree: Explainable Training-Free Video Anomaly Detection via Hierarchical Granularity-Aware Tree

VADTree: 通过分层粒度感知树实现可解释的无训练视频异常检测

Wenlong Li, Yifei Xu, Yuan Rao, Zhenhua Wang, Shuiguang Deng

机构 * School of Software, Xi’an Jiaotong University(西安交通大学软件学院) China Railway Xi’an Group(中国铁路西安集团) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

专题命中 测试时计算 :reasoning(abstract)

AI总结 VADTree通过分层粒度感知树结构实现无训练视频异常检测,利用预训练模型知识和多维先验提升异常感知与推理能力。

Comments NeurIPS 2025 poster

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 复杂问题求解 8 篇

2512.23988 2026-01-01 cs.CL cs.AI cs.LG 85%

Fantastic Reasoning Behaviors and Where to Find Them: Unsupervised Discovery of the Reasoning Process

非凡的推理行为及其发现位置:无监督发现推理过程

Zhenyu Zhang, Shujian Zhang, John Lambert, Wenxuan Zhou, Zhangyang Wang, Mingqing Chen, Andrew Hard, Rajiv Mathews, Lun Wang

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Google DeepMind(谷歌DeepMind)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出无监督框架RISE,通过稀疏自编码器发现LLM推理行为,揭示可解释的推理特征并控制推理轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23713 2026-01-01 cs.CL cs.AI 84%

PyBangla at BLP-2025 Task 2: Enhancing Bangla-to-Python Code Generation with Iterative Self-Correction and Multilingual Agents

在BLP-2025任务2中提升孟加拉语到Python代码生成:通过迭代自我纠正和多语言代理

Jahidul Islam, Md Ataullha, Saiful Azad

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 复杂问题求解 :self-correction(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出BanglaCodeAct框架,通过多代理提示和迭代自我纠正,提升孟加拉语到Python代码生成的性能,实验显示Qwen3-8B结合该框架在开发集和盲测集上分别达到94.0%和71.6%的准确率。

Comments 6 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00743 2026-01-01 cs.CL cs.AI cs.LG 82%

Multi-step retrieval and reasoning improves radiology question answering with large language models

多步检索与推理提升大型语言模型在放射学问答中的表现

Sebastian Wind, Jeta Sopa, Daniel Truhn, Mahshad Lotfinia, Tri-Thien Nguyen, Keno Bressem, Lisa Adams, Mirabela Rusu, Harald Köstler, Gerhard Wellein, Andreas Maier, Soroosh Tayebi Arasteh

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 RaR通过多步检索与推理提升放射学问答中大型语言模型的诊断准确性和事实一致性。

Comments Published in npj Digital Medicine

Journal ref npj Digit. Med. 8, 790 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24613 2026-01-01 cs.AI 79%

Group Deliberation Oriented Multi-Agent Conversational Model for Complex Reasoning

面向复杂推理的群体讨论导向多智能体对话模型

Zheyu Shi, Dong Qiu, Shanlong Yu

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出一种群体讨论导向的多智能体对话模型,通过三级角色架构和改进的优化策略,提升复杂推理任务的准确性和一致性。

Comments Accepted by IEEE ITCA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23848 2026-01-01 cs.CL cs.CE cs.LG 62%

Integrating Domain Knowledge for Financial QA: A Multi-Retriever RAG Approach with LLMs

在金融问答中整合领域知识:一种基于多检索器RAG方法与LLM的多检索器RAG方法

Yukun Zhang, Stefan Elbl Droguett, Samyak Jain

机构 * Department of Computer Science Stanford University(计算机科学系 斯坦福大学) Graduate School of Business Stanford University(商学院 斯坦福大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出一种基于多检索器RAG方法与LLM的金融问答系统,通过领域知识训练提升数值推理能力,验证了领域特定训练在不同模型规模下的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24615 2026-01-01 cs.AI 57%

Youtu-Agent: Scaling Agent Productivity with Automated Generation and Hybrid Policy Optimization

Youtu-Agent:通过自动化生成和混合策略优化提升代理生产力

Yuchen Shi, Yuzheng Cai, Siqi Cai, Zihan Xu, Lichao Chen, Yulei Qin, Zhijian Zhou, Xiang Fei, Chaofan Qiu, Xiaoyu Tan, Gang Li, Zongyi Li, Haojia Lin, Guocan Cai, Yong Mao, Yunsheng Wu, Ke Li, Xing Sun

机构 * Youtu-Agent Team(优图代理团队)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 Youtu-Agent通过自动化生成和混合策略优化提升LLM代理的生产力和性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23824 2026-01-01 cs.LG 57%

MS-SSM: A Multi-Scale State Space Model for Efficient Sequence Modeling

MS-SSM:一种用于高效序列建模的多尺度状态空间模型

Mahdi Karami, Ali Behrouz, Peilin Zhong, Razvan Pascanu, Vahab Mirrokni

机构 * Google Research(谷歌研究) Google DeepMind(谷歌DeepMind)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 MS-SSM通过多尺度状态空间模型提升序列建模效率,尤其在长程和分层任务中表现优异。

Comments In Second Conference on Language Modeling (COLM) (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22386 2026-01-01 cs.IR 50%

OxygenREC: An Instruction-Following Generative Framework for E-commerce Recommendation

OxygenREC: 一种用于电商推荐的指令遵循生成框架

Xuegang Hao, Ming Zhang, Alex Li, Xiangyu Qian, Zhi Ma, Yanlong Zang, Shijie Yang, Zhongxuan Han, Xiaolong Ma, Jinguang Liu, Zhen Li, Zhida Jiang, Shusheng Wang, Ning Tang, Yanchen Qiao, Chenxiang Yang, Chen Sun, Jincheng Yuan, Chunhua Peng, Heng Hu, Peijun Yang, Baopeng Yuan, Caiyun Qiu, Zhaolong Xing, Haofei Yuan, Haipeng Zhang, Yuzhang Guo, Weijie Ding, Jiahua Gao, Hao Huang, Zhen Chen, Tongxuan Liu, Pinghua Gong

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 OxygenREC通过快慢思考架构和语义对齐机制,实现低延迟多场景的深度推荐推理。

Comments 37 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 推理评测 13 篇

2506.04245 2026-01-01 cs.AI cs.CL cs.LG 82%

Contextual Integrity in LLMs via Reasoning and Reinforcement Learning

通过推理和强化学习实现大语言模型中的上下文完整性

Guangchen Lan, Huseyin A. Inan, Sahar Abdelnabi, Janardhan Kulkarni, Lukas Wutschitz, Reza Shokri, Christopher G. Brinton, Robert Sim

机构 * Purdue University(普渡大学) Microsoft(微软) National Univ of Singapore(新加坡国立大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过推理和强化学习方法,提升大语言模型在执行任务时的信息披露合理性,减少不适当信息泄露,同时保持任务性能。

Comments 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24156 2026-01-01 cs.AI 79%

Graph-Based Exploration for ARC-AGI-3 Interactive Reasoning Tasks

基于图的探索用于ARC-AGI-3交互推理任务

Evgenii Rudakov, Jonathan Shock, Benjamin Ultan Cowley

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 基于图的探索方法在ARC-AGI-3任务中实现高效交互推理,无需训练即可解决大量级别,优于LLM方法。

Journal ref AAAI 2026 Workshop on AI for Scientific Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24063 2026-01-01 cs.LG 79%

How and Why LLMs Generalize: A Fine-Grained Analysis of LLM Reasoning from Cognitive Behaviors to Low-Level Patterns

LLMs如何泛化:从认知行为到低级模式的细粒度分析

Haoyue Bai, Yiyou Sun, Wenjie Hu, Shi Qiu, Maggie Ziyu Huan, Peiyang Song, Robert Nowak, Dawn Song

机构 * University of Wisconsin, Madison(威斯康星大学麦迪逊分校) University of California, Berkeley(加州大学伯克利分校) University of Pennsylvania(宾夕法尼亚大学) California Institute of Technology(加州理工学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 本文通过细粒度分析揭示LLMs在SFT和RL微调下的泛化差异,提出基于核心技能的基准测试,揭示RL模型在推理稳定性上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24119 2026-01-01 cs.CV 75%

GeoBench: Rethinking Multimodal Geometric Problem-Solving via Hierarchical Evaluation

GeoBench: 通过分层评估重新思考多模态几何问题解决

Yuan Feng, Yue Yang, Xiaohan He, Jiatong Zhao, Jianlong Chen, Zijun Chen, Daocheng Fu, Qi Liu, Renqiu Xia, Bo Zhang, Junchi Yan

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);planning(abstract)

AI总结 GeoBench通过分层评估框架,系统评估几何问题解决能力,揭示任务复杂度对性能的影响及子目标分解的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13142 2026-01-01 cs.CV cs.CL cs.LG cs.MM cs.RO 62%

Holistic Evaluation of Multimodal LLMs on Spatial Intelligence

多模态大语言模型在空间智能方面的综合评估

Zhongang Cai, Yubo Wang, Qingping Sun, Ruisi Wang, Chenyang Gu, Wanqi Yin, Zhiqian Lin, Zhitao Yang, Chen Wei, Oscar Qian, Hui En Pang, Xuanke Shi, Kewang Deng, Xiaoyang Han, Zukai Chen, Jiaqi Li, Xiangyu Fan, Hanming Deng, Lewei Lu, Bo Li, Ziwei Liu, Quan Wang, Dahua Lin, Lei Yang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出EASI框架,用于评估多模态大语言模型在空间智能方面的综合表现,揭示GPT-5在SI中的优势与不足,并展示专有模型在困难任务上的劣势。

Comments Codebase: https://github.com/EvolvingLMMs-Lab/EASI/ ; Leaderboard: https://huggingface.co/spaces/lmms-lab-si/EASI-Leaderboard

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15301 2026-01-01 cs.CL cs.AI 62%

A Survey on LLM-Assisted Clinical Trial Recruitment

关于LLM辅助临床试验招募的综述

Shrestha Ghosh, Moritz Schneider, Carina Reinicke, Carsten Eickhoff

机构 * University of Tübingen(图宾根大学) Boehringer Ingelheim(勃林格殷曼)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了LLM在临床试验招募中匹配试验与患者任务的应用,分析了现有方法和挑战,并探讨了未来发展方向。

Comments Accepted to IJCNLP-AACl 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23898 2026-01-01 cs.LG cs.AI 62%

Efficient Deep Learning for Short-Term Solar Irradiance Time Series Forecasting: A Benchmark Study in Ho Chi Minh City

高效深度学习用于短期太阳能辐照时间序列预测:胡志明市的基准研究

Tin Hoang

机构 * University of Surrey(塞维利亚大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本研究通过对比十种深度学习架构,发现Transformer在短期太阳能辐照预测中表现最佳,且通过知识蒸馏实现模型压缩,降低误差。

Comments preprint, 40 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18565 2026-01-01 cs.CL cs.AI 62%

Bielik 7B v0.1: A Polish Language Model -- Development, Insights, and Evaluation

Bielik 7B v0.1:波兰语言模型——开发、见解与评估

Krzysztof Ociepa, Łukasz Flis, Krzysztof Wróbel, Adrian Gwoździej, Remigiusz Kinas

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 Bielik 7B v0.1通过创新技术提升波兰语处理能力,实现多项NLP任务性能提升,为语言AI发展提供新基准。

Journal ref Computer Science 26(4) (2025) 131-161

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15272 2026-01-01 cs.CL cs.AI cs.CV 62%

OmniBench: Towards The Future of Universal Omni-Language Models

OmniBench: 向通用多语言模型的未来迈进

Yizhi Li, Yinghao Ma, Ge Zhang, Ruibin Yuan, Kang Zhu, Hangyu Guo, Yiming Liang, Jiaheng Liu, Zekun Wang, Jian Yang, Siwei Wu, Xingwei Qu, Jinjie Shi, Xinyue Zhang, Zhenzhu Yang, Yidan Wen, Yanghai Wang, Shihao Li, Zhaoxiang Zhang, Zachary Liu, Emmanouil Benetos, Wenhao Huang, Chenghua Lin

机构 * University of Manchester(曼彻斯特大学) Queen Mary University of London(伦敦大学玛丽女王学院) Hongkong University of Science and Technology(香港科学与技术大学) Nanjing University(南京大学) Dartmouth College(达特茅斯学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 OmniBench提出了一种评估通用多语言模型三模态处理能力的基准,揭示了现有模型在多模态推理中的不足,并提出OmniInstruct数据集以改进训练方法。

Comments Accepted by The Thirty-Ninth Annual Conference on Neural Information Processing Systems (NeurIPS2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23165 2026-01-01 cs.LG 57%

Evaluating Parameter Efficient Methods for RLVR

评估用于RLVR的参数高效方法

Qingyu Yin, Yulun Wu, Zhennan Shen, Sunbowen Li, Zhilin Wang, Yanshu Li, Chak Tou Leong, Jiale Kang, Jinjin Gu

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本研究评估了RLVR中多种参数高效微调方法,发现结构变体如DoRA优于LoRA,并揭示了初始化策略中的谱崩溃现象及参数减少对推理能力的限制。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07017 2026-01-01 cs.SE cs.AI 57%

Benchmarking LLMs for Fine-Grained Code Review with Enriched Context in Practice

基于实践丰富上下文的LLM细粒度代码审查基准测试

Ruida Hu, Xinchen Wang, Xin-Cheng Wen, Zhao Zhang, Bo Jiang, Pengfei Gao, Chao Peng, Cuiyun Gao

机构 * Harbin Institute of Technology(哈尔滨工业大学) ByteDance(字节跳动)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 ContextCRBench通过丰富上下文的细粒度代码审查基准测试,评估LLM在代码审查中的性能,发现文本上下文比代码上下文更有效,且在工业应用中提升了审查系统性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21799 2026-01-01 cs.IR 50%

KG20C & KG20C-QA: Scholarly Knowledge Graph Benchmarks for Link Prediction and Question Answering

KG20C & KG20C-QA:面向链接预测和问答的学术知识图谱基准测试

Hung-Nghiep Tran, Atsuhiro Takasu

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出KG20C和KG20C-QA两个学术知识图谱基准测试,用于提升基于学术数据的问答和推理能力。

Comments extracted and extended from author's PhD thesis, "Multi-Relational Embedding for Knowledge Graph Representation and Analysis"

详情

展开后加载摘要…

URL PDF HTML 收藏