arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 18875 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 18875 篇

2608.08889 2026-08-11 cs.AI 新提交 90%

LLM Reasoning for Subjective Tasks: Failure Modes, Mitigation, and Dynamic Reasoning Routing

用于主观任务的大语言模型推理:失败模式、缓解措施与动态推理路由

Juncheng Dong, Ding Tong, Ishan Gupta, Yuyan Wang

机构 * Duke University(杜克大学) Netflix(网飞公司)

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 该研究针对主观任务中LLM推理的失败模式,提出带条件长度惩罚的后训练算法缓解推理崩溃,还发现推理风格不匹配是主观验证误差主因,给出算法补丁与架构蓝图。

Comments 20th ACM Conference on Recommender Systems (RecSys 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07637 2026-08-11 cs.AI cond-mat.mtrl-sci 新提交 90%

Agent-MD: Selective LLM Intervention with Event-Driven Escalation for Stateful GCMC--MD Campaigns

Agent-MD:用于有状态GCMC-MD模拟流程的带事件驱动升级机制的选择性大语言模型干预框架

Yijie Wang, Zhen-Yu Yin, Zhenheng Tang, Xiaowen Chu

机构 * The Hong Kong Polytechnic University(香港理工大学) The Hong Kong University of Science and Technology(香港科技大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Agent-MD框架将LLM推理选择性用于GCMC-MD分子模拟流程的构建与事件审查,结合确定性执行,在蒙脱石水蒸汽脱附模拟中完成多周期计算,识别问题并揭示体系依赖的低湿度响应,实现可复现的代理辅助分子模拟。

Comments 7 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05234 2026-08-07 cs.LG cs.PL 新提交 90%

PPDL: LLM-Based Flows as Probabilistic Programs

PPDL:基于大语言模型的流作为概率程序

Louis Mandel, Guillaume Baudart, Mandana Vaziri, Martin Hirzel

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出用于编程基于LLM的流的概率语言PPDL,可量化传播流中不确定性,无需额外代码即可尝试推理缩放技术,还通过实验及面向Rocq的定理证明智能体案例验证了其能力。

Comments Published at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02650 2026-08-05 cs.AI cs.SE 新提交 90%

HyperAgent: Planning and Acting over Tool-Schema Hypergraphs for Tool-Use LLM Agents

HyperAgent:面向工具-模式超图的规划与执行,用于工具使用型大语言模型智能体

Zian Zhai, Xingyu Tan, Gaowang Zou, Xiaoyang Wang, Wenjie Zhang

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 HyperAgent是一种基于工具-模式超图的LLM智能体框架,通过构建相关图引导任务规划与执行,在AppWorld实验中提升了任务完成性能并降低了资源消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01732 2026-08-04 cs.IR cs.AI 新提交 90%

X-KGRank: A Knowledge Graph RAG Framework for Explainable Recommendations via Pattern Mining and LLM Re-Ranking

X-KGRank:一种基于知识图谱检索增强的推荐框架,通过模式挖掘与大语言模型重排序实现可解释推荐

Meenakshi Rajpurohit, Jainish Patel

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 X-KGRank是一种知识图谱检索增强推荐框架,结合协同过滤与LLM解释,在MovieLens-1M数据集上提升了推荐指标,且小参数LLM可实现相当的解释质量但更易产生事实错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29549 2026-08-03 cs.AI 新提交 90%

AMTFV: Agentic Mathematical Tool-Flow Verification for LLM Self-Correction

AMTFV:面向LLM自校正的智能体数学工具流验证

Rui Zou, Yutao Zhu, Mengqi Wei, Ji-Rong Wen

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究针对LLM数学答案验证难题,提出AMTFV方法,通过MTF接口解耦验证建模与执行,在5个数学推理数据集上较基线提升最高8.3个百分点,验证复杂度越高增益越显著。

Comments 19 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29087 2026-08-03 cs.AI 新提交 90%

Harnessing the Wisdom of LLM Crowds through Complementarity-Driven Iterative Collaboration

通过互补驱动的迭代协作挖掘大语言模型群体的智慧

Yanbin Fang, Xuan Wei, Wei Chen

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究针对现有LLM组合方法忽略动态互补性的问题,提出WILC框架,通过迭代反思优化与双门互补模型选择机制,在四个基准上性能优于现有方法,成本仅为GPT-5.2的约1/7,扩展了群体智慧理论并提供多AI协调设计原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28947 2026-08-03 cs.LG 新提交 90%

Overcoming the Weakest-Link Effect in LLM-Driven Program Optimization via Heterogeneous Edit Recombination

通过异构编辑重组克服大语言模型驱动的程序优化中的最弱链效应

Jingwen Fu, Zhen Liu, Yuhan Liu, He Zhang, Nanning Zheng

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究针对LLM程序优化的最弱链效应,提出HERO异构编辑重组优化器,可生成多样非重叠原子编辑并结合评估器分数组合改进,在多领域实现更高分数、更快收敛与更少token消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28877 2026-08-03 cs.AR cs.LG cs.SE 新提交 90%

Open-Source LLM-Driven Formal Verification: A Multi-Agent Pipeline for RTL Repair

开源大语言模型驱动的形式化验证:用于RTL修复的多智能体流水线

Ha Trung Tran

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出将LLM与开源形式化后端结合的多智能体RTL修复流水线,通过反例引导迭代实现RTL修复,经ALU案例及6基准测试验证可行性并分析失效模式。

Comments 6 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28330 2026-07-31 cs.AI 新提交 90%

Paying for Honesty Without Knowing the Truth: Reputation-Penalty Design for LLM Marketplace Agents

在未知真相的情况下为诚实付费:LLM市场智能体的声誉惩罚机制设计

Mingdai Yang, Shicheng Fan, Kejing Yu, Duohao Wang, Li Sun, Hao Peng, Philip S. Yu, Zhiwei Liu

机构 * Univ. of Illinois Chicago(伊利诺伊大学芝加哥分校) Springbrand Inc.(春品牌公司) Beijing University of Posts and Telecommunications(北京邮电大学) Beihang University(北京航空航天大学) Hangzhou Innovation Institute of BUAA(北京航空航天大学杭州创新研究院) Microsoft(微软公司)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI

AI总结 针对LLM智能体商家伪造属性的问题,设计无需真实情况的CARP声誉惩罚机制,搭配SPARC机制可保护消费者、提升福利,且在多模型中具有约束力。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26909 2026-07-30 cs.CL 新提交 90%

Dual-Path LLM Reasoning for Multimodal Few-Shot Knowledge Graph Completion

用于多模态少样本知识图谱补全的双路径大语言模型推理

Jinlan Liu, Zhiying Tu, Yongchao Xing, Yicheng Liu, Bolin Zhang, Dianbo Sui, Dianhui Chu, Hongliang Sun

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究针对多模态少样本知识图谱补全难题,提出双路径大语言模型推理框架DuPLeR,结合多模态LLM先验与事实支撑构建校准关系图,经实验验证其在数据稀缺场景下性能稳健。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26773 2026-07-30 cs.AI 新提交 90%

Do Latent Channels Actually Communicate? A Causal Audit of Latent Multi-Agent LLM

隐通道真的在通信吗?隐式多智能体大语言模型的因果审计

Huixiang Zhang, Mahzabeen Emu

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究针对隐式多智能体LLM提出因果审计方法,通过受控消息替换揭示隐式通信的作用机制,发现不同规模Qwen模型在不同数据集上的隐式消息效应存在差异,证明总准确率无法反映隐式消息的实际影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26120 2026-07-30 cs.AI 新提交 90%

Even More Deception: Objective Misalignment in Mixed-Motive LLM Multi-Agent Systems

更严重的欺骗:混合动机大型语言模型多智能体系统中的目标不一致

Marylou Fauchard, Florian Carichon, Margarida Carvalho, Golnoosh Farnadi

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究以《狼人杀》为框架,分析LLM多智能体的目标不一致问题,发现其会破坏对抗环境结果且在公开行为中难察觉,凸显需缓解策略。

Comments Accepted at AIWILD@ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27784 2026-07-28 cs.AI 版本更新 90%

WIRE: Profiling Witnessed Within-Policy Instruction Collisions in LLM Agents

诊断LLM代理中实时策略内指令冲突的见证解析轮廓

Lu Yan, Xuan Chen, Xiangyu Zhang

机构 * Purdue University(普渡大学)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI

AI总结 提出WIRE管道,通过提取规则、编码为PyRule子句、检测冲突并生成见证实例,诊断LLM代理单一提示策略内规则对之间的冲突,发现64.6%的见证实例至少违反一条源规则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21187 2026-07-24 cs.LO cs.AI cs.SC 新提交 90%

Case study: proving sqrt(2) irrational with LPTP and an LLM

案例研究:使用LPTP和大语言模型证明√2是无理数

Fred Mesnard, Étienne Payet, Wim Vanhoof

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究在逻辑编程环境下,从基本谓词定义出发,借助LPTP系统,简述√2无理数的证明并与LLM交互,最终获得由LLM部分生成、LPTP完全验证的完整形式证明。

Comments In Proceedings ICLP 2026, arXiv:2607.17707

Journal ref EPTCS 450, 2026, pp. 67-80

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03447 2026-07-23 cs.SE cs.AI 版本更新 90%

Measuring LLM Trust Allocation Across Conflicting Software Artifacts

在冲突软件构件中衡量LLM的信任分配

Noshin Ulfat, Ahsanul Ameen Sabit, Soneya Binta Hossain

机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校) IQVIA Inc.(IQVIA公司)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI

AI总结 研究探讨LLM在处理冲突软件构件时的信任分配问题,提出TRACE框架评估不同构件的质量、不一致性和信任校准,发现模型在检测文档错误时表现优于实现错误,但对实现漂移而文档无误的情况检测率下降,且信任校准不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18310 2026-07-22 physics.soc-ph cs.AI 新提交 90%

Distribution-First Population Simulation: Collapse, Calibration, and Recall in Non-WEIRD LLM Persona Modeling

分布优先的总体模拟:非怪异大语言模型角色建模中的崩溃、校准和召回

Gurkan Ozkan

机构 * Istanbul Technical University(伊斯坦布尔技术大学)

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究非怪异LLM角色建模中独立代理范式的问题,提出分布优先校正方法,通过言语化采样等进行实验,发现原范式有崩溃等问题,校正方法能测量内部不一致性及校准条件。

Comments 8 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04818 2026-07-22 cs.AI 版本更新 90%

LLM-Grounded Explainable AI for Supply Chain Risk Early Warning via Temporal Graph Attention Networks

基于时间图注意力网络的LLM解释性AI用于供应链风险早期预警

Zhiming Xue, Yujue Wang, Menghao Huo

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出基于时间图注意力网络和大语言模型的框架,用于可解释的供应链风险早期预警,通过结合证据导向的方法提升预测准确性与解释可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17437 2026-07-21 cs.AI 新提交 90%

Empirical Grounding Improves the Realism of LLM Agents Simulating Human Behavior During Disruptions

经验基础提升了在干扰期间模拟人类行为的大语言模型智能体的现实性

Chen Xia, Zexi Kuang, Yuqing Hu

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究探讨经验基础对提升LLM智能体模拟人类行为现实性的作用,开发基于经验的框架,将多项调查数据嵌入其中,通过实验验证该框架能显著提升模拟效果,使LLM智能体成为更具统计可信度的人口行为模拟器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15841 2026-07-21 cs.AI 版本更新 90%

Heteroskedastic Signals in Budgeted LLM Verification: Structural Heterogeneity Limits Optimization Gains

预算受限LLM验证中的异方差信号:结构异质性限制了优化收益

Jinlong Yang

机构 * Northwestern Polytechnical University(西北工业大学)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI

AI总结 本文发现LLM不确定性信号在预算受限验证中存在异方差性,导致全局分配扭曲;通过分层阈值干预(CST)在强异质性设置下提升命中率达17个百分点,揭示结构异质性是主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22455 2026-07-21 cs.LG 版本更新 90%

SkillRouter: Skill Routing for LLM Agents at Scale

SkillRouter:大规模LLM代理中的技能路由

YanZhao Zheng, ZhenTao Zhang, Chao Ma, YuanQiang Yu, JiHuai Zhu, Yong Wu, Tianze Xu, Baohua Dong, Hangcheng Zhu, Ruohui Huang, Gang Yu

机构 * Alibaba Group(阿里巴巴集团)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.LG

AI总结 本文提出SkillRouter,通过全文本检索和重排序提升大规模LLM代理的技能路由性能,实验显示隐藏技能体导致路由准确率下降31-44个百分点,SkillRouter在基准测试中达到74.0%的Hit@1性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14574 2026-07-17 cs.AI cs.SI 新提交 90%

Collaborative Spatial Learning with Multi-LLM Agents in Networked Social Experiments

网络社会实验中多语言模型智能体的协作空间学习

Hao He, Chris J. Kuhlman, Xinwei Deng

机构 * Virginia Tech(弗吉尼亚理工大学) Advanced Research Computing, Virginia Tech(弗吉尼亚理工大学高级研究计算中心)

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究一组大语言模型智能体在梅森-瓦茨实验中的网络效率效应,开发机械贝叶斯优化智能体作比较。计算实验表明,指示LLM智能体随机化首轮选择有显著网络效率效应,贝叶斯优化智能体收益更高,还比较了智能体多方面行为。

Comments Accepted at ASONAM 2026; to appear in the Springer proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06461 2026-07-08 eess.AS cs.CL cs.SD 新提交 90%

WordVoice: Explicit and Decoupled Multi-Dimensional Word-Level Control for LLM-Based TTS

WordVoice:基于大语言模型的文本转语音中显式且解耦的多维词级控制

Sihang Nie, Jinxin Ji, Xiaofen Xing, Deyi Tuo, Chengbin Jin, Jialong Mai, Xiangmin Xu

机构 * South China University of Technology(南方科技大学) Huya Inc.(Huya公司) Tongji University(同济大学) The Hongkong polytechnic university(香港理工大学) Foshan University(佛山大学)

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究针对基于LLM的TTS系统词级控制粗糙的问题,提出统一框架。构建含五维注释的数据集,引入WordVoice将隐式生成变为显式可控范式,经实验验证其在多声学维度上实现卓越解耦控制且保持零样本合成稳定性。

Comments 10 pages, 4 figures, 6 tables; Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02537 2026-07-08 cs.CL cond-mat.mtrl-sci 版本更新 90%

PolyJarvis: An LLM-Orchestrated Agent for Automated All-Atom Molecular Dynamics of Amorphous Homopolymers

PolyJarvis:用于自主聚合物分子动力学模拟的LLM代理

Alexander Zhao, Achuth Chandrasekhar, Amir Barati Farimani

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 PolyJarvis结合大语言模型与RadonPy平台,通过MCP服务器实现从自然语言输入自主执行聚合物分子动力学模拟,预测密度、体积模量和玻璃化温度等性质,验证结果在不同聚合物中表现良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31158 2026-07-01 cs.RO cs.AI 新提交 90%

LLM-Powered Interactive Robotic Action Synthesis from Multimodal Speech, Gestures, and Music

基于多模态语音、手势和音乐的LLM驱动交互式机器人动作合成

Snehasis Banerjee, Ranjan Dasgupta

机构 * TCS Research, Tata Consultancy Services(塔塔咨询服务公司TCS研究院)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出利用大语言模型融合语音、手势和音乐节拍等多模态输入,合成复杂机器人动作序列的框架,实现更自然的人机交互。

Comments IROS 2025 Workshop on Action and Interaction: Humans and Robots in Collaboration

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29399 2026-06-30 cs.AI 90%

LLM-Guided Planning for Multi-hop Reasoning over Multimodal Nuclear Regulatory Documents

LLM引导的规划:多模态核监管文档的多跳推理

Mingyu Jeon, Bokyeong Kim, Suwan Cho, Jae Young Suh, Yonggyun Yu

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI

AI总结 提出LLM引导的规划方法,通过动态知识图谱状态和文档树工具,在多跳推理任务中实现81.5%准确率,显著优于无状态规划方法。

Comments Accepted at the Second Workshop on Agents in the Wild: Safety, Security, and Beyond @ ICML 2026. 8 pages (main), 3 figures, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29067 2026-06-30 cs.CL 90%

ThinkProbe: Beyond Accuracy -- Structural Profiling of Open-Ended LLM Reasoning Traces via Non-Generative Thought Graphs

ThinkProbe:超越准确性——通过非生成式思维图对开放式LLM推理轨迹进行结构分析

Mohamed Amine Kerkouri, Simon D. Hernandez, Marouane Tliba, Yann Dauxais, Maha Ben-Fares, Pierre Holat

机构 * F-Initiatives Université sorbonne Paris Nord(巴黎-索邦大学 Nord)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL

AI总结 提出ThinkProbe框架,将LLM推理轨迹转化为思维图,通过非生成式管道提取五维认知特征,发现推理结构是模型级稳定属性,且结构维度对问题领域敏感。

Comments Under Review for EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28409 2026-06-30 cs.AR cs.AI 90%

Evidence-Driven LLM Agent for C-to-Synthesizable-C Conversion and Verification

证据驱动的LLM智能体用于C到可综合C的转换与验证

Zhe Zhao, Hongbing Lang, Zhihan Xiao, Luke Ztz Hu, John Imoleayo Adebisi, Songping Mai

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出一种基于大语言模型的闭环生成-验证-诊断-修复框架,通过四阶段验证器、渐进式不匹配定位链和证据检索增强生成,将C代码转换为HLS可综合C,显著优于现有方法。

Comments 14 pages, 8 figures, submitted to IEEE Transactions on Computer-Aided Design of Integrated Circuits and Systems (TCAD)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28011 2026-06-29 eess.SY cs.LG cs.SY 新提交 90%

From Detection to Action: Using LLM Agents for Fault-Tolerant Control

从检测到行动:使用LLM智能体进行容错控制

Javal Vyas, Milapji Singh Gill, Artan Markaj, Felix Gehlhoff, Mehmet Mercangöz

机构 * Imperial College London(帝国理工学院伦敦校区) Helmut Schmidt University(海德堡-施密特大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出基于大语言模型智能体的主动容错控制框架,通过多智能体协作、数字孪生和知识图谱增强检索,生成并验证最小风险恢复路径,在离散和连续过程控制中实现从故障检测到有效纠正行动的闭环。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10379 2026-06-26 cs.CL 版本更新 90%

Not All Proofs Are Equal: Evaluating LLM Proof Quality Beyond Correctness

并非所有证明都平等:超越正确性的LLM证明质量评估

Ivo Petrov, Jasper Dekoninck, Dimitar I. Dimitrov, Martin Vechev

机构 * INSAIT(INSAIT研究所) Sofia University "St. Kliment Ohridski"(索菲亚大学"圣克莱孟·奥赫里迪斯基") ETH Zurich(苏黎世联邦理工学院)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出ProofRank基准,评估证明的简洁性、计算便捷性、认知简单性、多样性及适应性,揭示正确性之外的证明质量差异及优劣权衡。

Comments 9 main text pages, 36 total pages, Accepted at ICML 2026 AI for Math workshop

详情

展开后加载摘要…

URL PDF HTML 收藏