arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-05 至 2026-03-05 共收录 93 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 27 篇

2603.03983 2026-03-05 cs.CV cs.AI 79%

GeoSeg: Training-Free Reasoning-Driven Segmentation in Remote Sensing Imagery

GeoSeg: 无需训练的推理驱动遥感图像分割

Lifan Jiang, Yuhang Pei, oxi Wu, Yan Zhao, Tianrun Wu, Shulong Yu, Lihui Zhang, Deng Cai

机构 * State Key lab of CAD\&CG, Zhejiang University UniTTEC Co. Ltd. Wuchan Zhongda Chengtou (Ningbo) Holdings. Ltd.

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 GeoSeg通过结合大规模语言模型推理与精确定位,无需训练实现遥感图像分割的高效解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03825 2026-03-05 cs.CV cs.AI 79%

From Narrow to Panoramic Vision: Attention-Guided Cold-Start Reshapes Multimodal Reasoning

从窄视场到全景视觉:基于注意力的冷启动重塑多模态推理

Ruilin Luo, Chufan Shi, Yizhen Zhang, Cheng Yang, Songtao Jiang, Tongkun Guan, Ruizhe Chen, Ruihang Chu, Peng Wang, Mingkun Yang, Yujiu Yang, Junyang Lin, Zhibo Yang

机构 * Tsinghua University(清华大学) University of South California(南加州大学) Qwen Team, Alibaba Group(通义实验室,阿里巴巴集团) University of California San Diego(南加州大学圣地亚哥分校) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出AVAR框架,通过视觉锚定与注意力引导提升多模态推理性能,实现7%的平均提升。

Comments ICLR 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07181 2026-03-05 cs.RO cs.AI cs.CV 79%

TIGeR: Tool-Integrated Geometric Reasoning in Vision-Language Models for Robotics

TIGeR: 视觉-语言模型中集成工具的几何推理

Yi Han, Enshen Zhou, Shanyu Rong, Jingkun An, Pengwei Wang, Zhongyuan Wang, Cheng Chi, Lu Sheng, Shanghang Zhang

机构 * Beihang University(北洋大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机科学学院多媒体信息处理国家重点实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 TIGeR通过集成工具实现视觉-语言模型的几何推理,提升机器人操作的精确度。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03590 2026-03-05 cs.MA cs.AI 79%

Social Norm Reasoning in Multimodal Language Models: An Evaluation

多模态语言模型中的社会规范推理:一项评估

Oishik Chowdhury, Anushka Debnath, Bastin Tony Roy Savarimuthu

机构 * School of Computing, University of Otago, New Zealand(奥塔哥大学计算机学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文评估了多模态大语言模型在社会规范推理中的能力,发现GPT-4o在文本和图像模态中表现最佳,但所有模型在处理复杂规范时仍有困难。

Comments to be published in ICAART 2026 post proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05091 2026-03-05 cs.CV 75%

Factuality Matters: When Image Generation and Editing Meet Structured Visuals

事实性至关重要:当图像生成与编辑遇见结构化视觉

Le Zhuo, Songhao Han, Yuandong Pu, Boxiang Qiu, Sayak Paul, Yue Liao, Yihao Liu, Jie Shao, Xi Chen, Si Liu, Hongsheng Li

机构 * CUHK MMLab(香港大学多模态实验室) Beihang University(北京航空航天大学) Krea AI(Krea人工智能) Shanghai Jiao Tong University(上海交通大学) Shanghai AI Lab(上海人工智能实验室) Hugging Face National University of Singapore(新加坡国立大学) ByteDance(字节跳动) The University of Hong Kong(香港大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);planning(abstract)

AI总结 本文提出了一种统一模型,通过整合视觉语言模型和FLUX.1 Kontext,提升结构化视觉生成与编辑的多模态理解与事实准确性。

Comments Accepted by ICLR 2026, Project page: https://structvisuals.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03543 2026-03-05 cs.CL cs.AI 73%

Tucano 2 Cool: Better Open Source LLMs for Portuguese

Tucano 2 Cool: 更好的开源葡萄牙语大语言模型

Nicholas Kluge Corrêa, Aniket Sen, Shiza Fatimah, Sophia Falk, Lennard Landgraf, Julia Kastner, Lucie Flek

机构 * Bonn-Aachen International Center for Information Technology (b-it) / CAISA Lab(波恩-亚琛国际信息科技中心(b-it)/ CAISA实验室) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔机器学习与人工智能研究所) Center for Science and Thought(科学与思想研究中心) Helmholtz-Institut für Strahlen- und Kernphysik(亥姆霍兹辐射与核物理研究所) Bonn Sustainable AI Lab(波恩可持续AI实验室)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 Tucano 2推出了一系列开源葡萄牙语大语言模型,通过扩展数据集和改进训练方法,实现了在多种语言任务上的最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03315 2026-03-05 cs.CL cs.AI cs.LG 67%

M-QUEST -- Meme Question-Understanding Evaluation on Semantics and Toxicity

M-QUEST -- 周期性问题理解评估在语义和毒性上

Stefano De Giorgis, Ting-Chih Chen, Filip Ilievski

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 M-QUEST提出一个语义框架和基准,用于自动提取迷因知识,评估模型在毒性理解上的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03330 2026-03-05 cs.CL cs.AI 62%

Certainty robustness: Evaluating LLM stability under self-challenging prompts

确定性鲁棒性:在自我挑战提示下评估LLM的稳定性

Mohammadreza Saadat, Steve Nemzer

机构 * TELUS Digital(TELUS数字公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出确定性鲁棒性基准,评估LLM在自我挑战提示下的稳定性与适应性平衡,揭示模型在交互压力下的可靠性差异。

Comments 20 pages, 7 tables Benchmark and evaluation study of large language models

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03298 2026-03-05 cs.CL cs.AI 62%

TATRA: Training-Free Instance-Adaptive Prompting Through Rephrasing and Aggregation

TATRA: 无需训练的实例自适应提示法通过重述与聚合

Bartosz Dziuba, Kacper Kuchta, Paweł Batorski, Przemysław Spurek, Paul Swoboda

机构 * Jagiellonian University(雅盖隆大学) IDEAS Research Institute(IDEAS研究机构)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 TATRA通过重述与聚合生成实例特定的少量示例提示,无需训练数据和优化循环,在文本分类和数学推理任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04142 2026-03-05 cs.LG 57%

A Multi-Agent Framework for Interpreting Multivariate Physiological Time Series

多智能体框架用于解释多变量生理时间序列

Davide Gabrielli, Paola Velardi, Stefano Faralli, Bardh Prenkaj

机构 * Sapienza University of Rome Rome Italy ISTC-CNR \& Sapienza University of Rome Rome Italy Technical University of Munich Munich Germany Sapienza University of Rome ISTC-CNR \& Sapienza University of Rome Technical University of Munich

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本研究提出Vivaldi多智能体框架,通过对比不同模型表现,发现智能体系统在非思考模型中提升解释质量,但在思考模型中反而降低相关性,强调了计算外部化在医疗AI中的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03781 2026-03-05 cs.AI 57%

LifeBench: A Benchmark for Long-Horizon Multi-Source Memory

LifeBench: 一个用于长周期多源记忆的基准

Zihao Cheng, Weixin Wang, Yu Zhao, Ziyang Ren, Jiaxuan Chen, Ruiyang Xu, Shuai Huang, Yang Chen, Guowei Li, Mengshi Wang, Yi Xie, Ren Zhu, Zeren Jiang, Keda Lu, Yihong Li, Xiaoliang Wang, Liwei Liu, Cam-Tu Nguyen

机构 * Institute for Clarity in Documentation(清晰文档研究所) Inria Paris-Rocquencourt(巴黎-罗克琴库特研究所) Rajiv Gandhi University(拉贾夫·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒尔研究实验室) State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) School of Artificial Intelligence, Nanjing University(人工智能学院,南京大学) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 Lifebench是一个用于长周期多源记忆的基准,通过密集连接的长周期事件模拟,推动AI代理在多样且时间延长的上下文中整合声明性和非声明性记忆推理。

Comments A total of 28 pages, 8 pages of main text, and 15 figures and tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09937 2026-03-05 cs.AI cs.DC 57%

Why Do AI Agents Systematically Fail at Cloud Root Cause Analysis?

为何AI代理在云根因分析中系统性失败?

Taeyoon Kim, Woohyeok Park, Hoyeong Yun, Kyungyong Lee

机构 * Hanyang University(汉阳大学) OKESTRO Co., Ltd.(OKESTRO公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文分析了基于LLM的云根因分析代理在推理、通信和环境交互中的系统性故障,揭示了幻觉数据和不完全探索等普遍问题,并通过改进通信协议减少故障率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06803 2026-03-05 cs.CL cs.MA 57%

SEVADE: Self-Evolving Multi-Agent Analysis with Decoupled Evaluation for Hallucination-Resistant Irony Detection

SEVADE:基于解耦评估的自演化多智能体分析用于抗幻觉讽刺检测

Ziqi Liu, Ziyang Zhou, Yilin Li, Mingxuan Hu, Yushan Pan, Zhijie Xu, Yangbin Chen

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 SEVADE通过自演化多智能体分析框架,结合解耦评估机制,提升抗幻觉讽刺检测的准确率和宏F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06743 2026-03-05 cs.RO cs.AI 57%

TPK: Trustworthy Trajectory Prediction Integrating Prior Knowledge For Interpretability and Kinematic Feasibility

TPK: 通过整合先验知识实现可解释性和运动学可行性轨迹预测

Marius Baden, Ahmed Abouelazm, Christian Hubschneider, Yin Wu, Daniel Slieter, J. Marius Zöllner

机构 * FZI Research Center for Information Technology(弗赖堡信息科技研究中心) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) CARIAD SE

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 TPK通过整合车辆、行人和自行车的交互和运动学先验知识,提高轨迹预测的可解释性和物理可行性。

Comments First and Second authors contributed equally; Accepted in the 36th IEEE Intelligent Vehicles Symposium (IV 2025) for oral presentation; Winner of the best paper award

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20505 2026-03-05 cs.AI 57%

MuRAL: A Multi-Resident Ambient Sensor Dataset Annotated with Natural Language for Activities of Daily Living

MuRAL:一个多居所环境传感器数据集,标注有自然语言用于日常活动

Xi Chen, Julien Cumin, Fano Ramparany, Dominique Vaufreydaz

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 MuRAL数据集通过自然语言标注多居所环境传感器数据,用于提升LLMs在日常活动识别中的性能和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03515 2026-03-05 cs.CY cs.AI 57%

The Controllability Trap: A Governance Framework for Military AI Agents

可控性陷阱:军事AI代理的治理框架

Subramanyam Sahoo

机构 * MARS (Mentorship for Alignment Researchers) 4.0 Fellow(MARS(对齐研究导师计划)4.0 Fellow) Cambridge AI Safety Hub (CAISH) University of Cambridge(剑桥AI安全中心(CAISH)剑桥大学)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 本文提出AMAGF框架,通过预防、检测和纠正三个支柱,解决军事AI代理中的控制失效问题,通过控制质量评分实现持续控制管理。

Comments Accepted at ICLR 2026 Workshop on Agents in the Wild. 20 Pages and 3 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03334 2026-03-05 cs.CL 57%

The CompMath-MCQ Dataset: Are LLMs Ready for Higher-Level Math?

CompMath-MCQ数据集:大语言模型是否准备好应对高级数学?

Bianca Raimondi, Francesco Pivi, Davide Evangelista, Maurizio Gabbrielli

机构 * Department of Computer Science and Engineering, University of Bologna(计算机科学与工程系,博洛尼亚大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 CompMath-MCQ数据集通过多选格式评估LLMs在高级数学推理中的表现,揭示其在复杂计算数学任务上的挑战。

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03300 2026-03-05 cs.CL 57%

Benchmarking Legal RAG: The Promise and Limits of AI Statutory Surveys

法律RAG基准测试:AI立法调研的潜力与局限

Mohamed Afane, Emaan Hariri, Derek Ouyang, Daniel E. Ho

机构 * Stanford University(斯坦福大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文评估了三种新兴工具在法律RAG基准测试中的表现,发现STARA性能显著提升,而商业平台表现不佳,同时揭示了DOL律师的遗漏问题,并提出了法律RAG的未来设计原则。

Comments Accepted at the 5th ACM Symposium on Computer Science and Law (CS&Law '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04306 2026-03-05 stat.CO 50%

Theory Discovery in Social Networks: Automating ERGM Specification with Large Language Models

社交网络中的理论发现:利用大语言模型自动化ERGM规范

Yidan Sun, Mayank Kejriwal

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出Forge框架,利用大语言模型自动化ERGM规范,通过验证可行性与稳定性约束,提升社交网络形成机制的建模效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04176 2026-03-05 cs.DB 50%

Scalable Join Inference for Large Context Graphs

大规模上下文图的可扩展连接推断

Shivani Tripathi, Ravi Shetye, Shi Qiao, Alekh Jindal

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出一种结合统计剪枝与LLM推理的可扩展连接推断方法,用于提升大规模上下文图构建的精度与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03762 2026-03-05 cs.CV 50%

Seeing as Experts Do: A Knowledge-Augmented Agent for Open-Set Fine-Grained Visual Understanding

如同专家所见:一个知识增强的代理用于开放集细粒度视觉理解

Junhan Chen, Zilu Zhou, Yujun Tong, Dongliang Chang, Yitao Luo, Zhanyu Ma

专题命中 推理评测 :reasoning(abstract)

AI总结 KFRA通过知识增强推理代理实现开放集细粒度视觉理解,提升推理准确率和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01154 2026-03-05 cs.CR 50%

vEcho: A Paradigm Shift from Vulnerability Verification to Proactive Discovery with Large Language Models

vEcho:从漏洞验证到大语言模型主动发现的范式转变

Mingcheng Jiang, Jiancheng Huang, Jiangfei Wang, Zhengzhu Xie, Nan Fang, Guang Cheng, Xiaoyan Hu, Hua Wu

专题命中 推理评测 :reasoning(abstract)

AI总结 vEcho利用大语言模型主动发现漏洞,显著提升检测率并降低误报率,同时发现新的0日漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11371 2026-03-05 cs.IR 50%

RAG vs. GraphRAG: A Systematic Evaluation and Key Insights

RAG与GraphRAG:系统评估与关键洞察

Haoyu Han, Li Ma, Yu Wang, Harry Shomer, Yongjia Lei, Zhisheng Qi, Kai Guo, Zhigang Hua, Bo Long, Hui Liu, Charu C. Aggarwal, Jiliang Tang

专题命中 推理评测 :reasoning(abstract)

AI总结 本文系统评估RAG与GraphRAG在文本任务中的表现,提出统一评估协议,揭示两者优势与权衡,并探索整合策略以提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 10 篇

2602.10619 2026-03-05 cs.CV cs.AI 79%

Improving Medical Visual Reinforcement Fine-Tuning via Perception and Reasoning Augmentation

通过感知与推理增强改进医疗视觉强化微调

Guangjing Yang, ZhangYuan Yu, Ziyuan Qin, Xinyuan Song, Huahui Yi, Qingbo Kang, Jun Gao, Yiyue Li, Chenlin Du, Qicheng Lao

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Emory University(埃默里大学) Sichuan University(四川大学) Peking University(北京大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究提出VRFT-Aug框架,通过增强感知与推理能力,改进医疗影像领域的强化微调效果,提升模型在医学应用中的可靠性与推理能力。

Comments CPAL 2026

Journal ref 2026 Conference on Parsimony and Learning (CPAL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03857 2026-03-05 cs.CV 78%

DeepScan: A Training-Free Framework for Visually Grounded Reasoning in Large Vision-Language Models

DeepScan: 一种无需训练的框架,用于大视觉-语言模型中的视觉引导推理

Yangfu Li, Hongjian Zhan, Jiawei Chen, Yuning Gong, Qi Liu, Yue Lu

机构 * East China Normal University(东华大学) Sichuan University(四川大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 其他推理 :reasoning(title,abstract)

AI总结 DeepScan是一种无需训练的框架,通过层次扫描、聚焦和证据增强推理提升大视觉-语言模型在视觉任务中的表现。

Comments 18 pages 17 figures

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03517 2026-03-05 cs.LG cs.AI cs.CL 67%

MMAI Gym for Science: Training Liquid Foundation Models for Drug Discovery

MMAI Gym for Science: 训练液态基础模型用于药物发现

Maksim Kuznetsov, Zulfat Miftahutdinov, Rim Shayakhmetov, Mikolaj Mizera, Roman Schutski, Bogdan Zagribelnyy, Ivan Ilin, Nikita Bondarev, Thomas MacDougall, Mathieu Reymond, Mihir Bafna, Kaeli Kaymak-Loveless, Eugene Babin, Maxim Malkov, Mathias Lechner, Ramin Hasani, Alexander Amini, Vladimir Aladinskiy, Alex Aliper, Alex Zhavoronkov

机构 * Insilico Medicine Liquid AI

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MMAI Gym for Science通过训练液态基础模型,实现了在药物发现任务中超越大模型的性能,同时保持高效和广泛适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03325 2026-03-05 cs.CL cs.AI cs.LG 67%

IntPro: A Proxy Agent for Context-Aware Intent Understanding via Retrieval-conditioned Inference

IntPro:一种通过检索条件推理的代理代理,用于基于情境的意图理解

Guanming Liu, Meng Wu, Peng Zhang, Yu Zhang, Yubo Shu, Xianliang Huang, Kainan Tu, Ning Gu, Liuxin Zhang, Qianying Wang, Tun Lu

机构 * Fudan University(复旦大学) Lenovo Group Ltd(联想集团有限公司)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 IntPro通过检索条件推理学习适应个体用户,提升基于情境的意图理解性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03583 2026-03-05 cs.CL cs.LG 62%

ByteFlow: Language Modeling through Adaptive Byte Compression without a Tokenizer

ByteFlow:通过自适应字节压缩实现语言建模而不使用分词器

Chunyuan Deng, Sanket Lokegaonkar, Colin Lockard, Besnik Fetahu, Nasser Zalmout, Xian Li

机构 * Rice University(里士德大学) Amazon Science(亚马逊科学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 ByteFlow通过自适应字节压缩实现无分词器的语言建模,提升模型性能与适应性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04244 2026-03-05 cs.SE cs.AI cs.HC 57%

FeedAIde: Guiding App Users to Submit Rich Feedback Reports by Asking Context-Aware Follow-Up Questions

FeedAIde: 通过提问情境感知的后续问题引导应用用户提交丰富的反馈报告

Ali Ebrahimi Pourasad, Meyssam Saghiri, Walid Maalej

机构 * University of Hamburg(汉堡大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 FeedAIde通过情境感知和生成式AI技术,帮助用户更高效地提交详细反馈报告,提升开发人员获取信息的价值。

Comments Accepted for publication at the 13th International Conference on Mobile Software Engineering and Systems (MOBILESoft) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03872 2026-03-05 cs.LG 57%

Believe Your Model: Distribution-Guided Confidence Calibration

相信你的模型:分布引导的置信度校准

Xizhong Yang, Haotian Zhang, Huiming Wang, Mofei Song

机构 * Southeast University(东南大学) Kuaishou Technology(快手科技)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出DistriVoting和SelfStepConf,通过结合分布先验和动态调整推理过程,提升模型在答案选择中的可靠性与准确性。

Comments 38 pages

详情

展开后加载摘要…

URL PDF HTML 收藏