arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 1129 信号源:cs.CL, cs.AI, cs.LG

1. 代码与定理证明 1129 篇

2606.01160 2026-06-02 cs.AI 57%

Expected Value Alignment for Generative Reward Modeling in Formal Mathematics Verification

形式数学验证中生成式奖励建模的期望值对齐

Shihao Ji, Haotao Tan, Zihui Song, Mingyu Li

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 提出期望值对齐(EVA)方法,通过从模型词元分布中提取连续分数,在保持生成式奖励模型离散输出的同时实现连续评分,用于Lean 4形式验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12081 2026-06-02 cs.IR cs.LG 57%

From Scaling to Structured Expressivity: Rethinking Transformers for CTR Prediction

从规模到结构化表达能力:重新思考用于CTR预测的Transformer

Bencheng Yan, Yuejie Lei, Zhiyuan Zeng, Zheye Deng, Di Wang, Kaiyi Lin, Pengjie Wang, Chuan Yu, Jian Xu, Bo Zheng

机构 * Alibaba Group(阿里巴巴集团)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.LG

AI总结 针对CTR预测中Transformer模型因结构错位导致收益递减的问题,提出Field-Aware Transformer (FAT),通过场感知参数重构和基组合超网络实现结构化表达能力,在理论(Rademacher复杂度标度律)和实验(AUC提升+4.38%,线上CTR+2.33%,RPM+0.66%)上均优于现有方法。

Comments KDD 2026; The first four authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31064 2026-06-01 cs.IR cs.AI 57%

Fighting Numerical Hallucinations via Data-centric Compilation for Online Financial QA

通过数据为中心的编译对抗在线金融问答中的数值幻觉

Hao Chen, Xing Tang, Qirui Liu, Weijie Shi, Shiwei Li, Fuyuan Lyu, Weihong Luo, Xiku Du, Xiuqiang He

机构 * Shenzhen Technology University(深圳科技大学) FiT, Tencent(腾讯金融科技部) South China University of Technology(华南理工大学) The Hong Kong University of Science and Technology(香港科学与技术大学) Huazhong University of Science and Technology(华中科技大学) McGill University(麦吉尔大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 提出数据为中心推理编译器(DCRC),通过对抗数据构建、多阶段训练和编译执行推理流程,解决在线金融问答中检索增强生成面临的噪声敏感、计算脆弱和可审计性危机,实现可靠的数值推理。

Comments Accepted by KDD 2026 ADS track

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30914 2026-06-01 cs.LG cs.SE 57%

Automating Formal Verification with Reinforcement Learning and Recursive Inference

用强化学习和递归推理自动化形式验证

Max Tan

机构 * Department of Electrical Engineering and Computer Science(电气工程与计算机科学系) Massachusetts Institute of Technology(麻省理工学院)

专题命中 代码与定理证明 :verifier(abstract);分类 cs.LG

AI总结 研究通过可验证奖励的强化学习和验证器引导的推理搜索,提升大语言模型生成验证程序和证明的能力,在Dafny和Lean上取得显著进展。

Comments Master's thesis, 140 pages, 16 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30861 2026-06-01 cs.AI 57%

Distilling LLM Feedback for Lean Theorem Proving

蒸馏LLM反馈用于Lean定理证明

Gaetan Narozniak, Gérard Biau, Rémi Munos, Ahmad Rammal, Pierre Marion

机构 * FAIR at Meta(Meta 的 FAIR 部门) Inria(法国国家科学与技术研究院) Sorbonne Université(索邦大学) Institut universitaire de France(法国国家科学研究院) CERMICS École des Ponts ParisTech(巴黎理工学院 CERMICS 实验室) ENS, PSL Research University(巴黎高等师范学院与巴黎科学实验室)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 提出反馈蒸馏方法,通过让模型在token级别匹配自身分布(基于语言模型提供的特权反馈)来训练,以解决GRPO在推理后训练中的稀疏奖励和模式崩溃问题,并在Lean4定理证明中取得更好效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30144 2026-05-29 cs.AI cs.MA 57%

AgentSchool: An LLM-Powered Multi-Agent Simulation for Education

AgentSchool:基于LLM的多智能体教育模拟系统

Yulei Ye, Wenhao Li, Zhong Wen, Yunshu Huang, Yichen Hu, Zifan Wei, Yige Wang, Xinyu Xie, Haoxuan Yang, Yanjun Huang, Ruijia Li, Hong Qian, Yu Song, Bo Jiang, Bingdong Li, Lijun Li, Bo Zhang, Pinlong Cai, Xingcheng Xu, Shuangye Chen, Xia Hu, Liang He, Aimin Zhou, Jingjing Qu, Jing Shao, Xiangfeng Wang

机构 * Shanghai Institute of AI for Education(上海人工智能教育研究院) School of Computer Science and Technology(计算机科学与技术学院) East China Normal University(东华大学) School of Design(设计学院) Faculty of Education(教育学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 提出AgentSchool,一种LLM驱动的多智能体模拟器,通过可成长的学生智能体(带知识图谱、思维工作流和错误概念)与自适应教师智能体(基于最近发展区)模拟学习过程,支持多尺度模拟,实验验证了其生成差异化掌握轨迹和符合课堂社会理论的行为模式。

Comments 39 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27485 2026-05-28 cs.LO cs.LG cs.SE 57%

Automating Formal Verification with Agent-Guided Tree Search

利用智能体引导的树搜索自动化形式验证

Leo Yao

机构 * Massachusetts Institute of Technology(麻省理工学院) Department of Electrical Engineering and Computer Science(电气工程与计算机科学系)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.LG

AI总结 本文提出智能体引导的树搜索方法,通过状态和上下文两种编排器改进基于大语言模型的Lean形式验证代码生成性能,在基准测试中达到95.0%的通过率。

Comments 78 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26959 2026-05-28 cs.LO cs.CL 57%

MerLean-Prover: A Recursive Looping Harness for Lean 4 Theorem Proving

MerLean-Prover:用于 Lean 4 定理证明的递归循环框架

Jinzheng Li, Zeru Zhu, Yuanjie Ren

机构 * Northeastern University(东北大学) Stony Brook University(石溪大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 代码与定理证明 :planning(abstract);分类 cs.CL

AI总结 提出一种基于递归循环框架的端到端 Lean4 定理证明器 MerLean-Prover,通过规划、检查与证明三种智能体协作,无需微调或定制强化学习,在 FormalQualBench 和 Putnam2025 上超越现有开源基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27320 2026-05-27 cs.AI cs.CY econ.GN q-fin.EC 57%

Modeling Agentic Technical Debt and Stochastic Tax: A Standalone Framework for Measurement, Simulation, and Dashboarding

建模代理技术债务与随机税:一个用于测量、模拟和仪表盘展示的独立框架

Muhammad Zia Hydari, Raja Iqbal, Narayan Ramasubbu

机构 * School of Business, University of Pittsburgh(匹兹堡大学商学院)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一个形式化且可管理的框架,区分代理技术债务(累积的设计与治理负债存量)与随机税(使用随机代理时产生的运营负担流),并通过应付账款模拟和电子表格说明其应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27051 2026-05-27 cs.SE cs.AI 57%

ConVer: Using Contracts and Loop Invariant Synthesis for Scalable Formal Software Verification

ConVer:使用合约和循环不变式合成实现可扩展的形式化软件验证

Muhammad A. A. Pirzada, Weiqi Wang, Yiannis Charalambous, Konstantin Korovin, Lucas C. Cordeiro

机构 * The University of Manchester(曼彻斯特大学)

专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI

AI总结 提出一种自上而下的组合验证工具ConVer,利用大语言模型合成函数合约,并通过CEGAR-CEGIS循环迭代精炼合约,以解决大规模C程序形式化验证中的状态空间爆炸问题。

Comments 12 pages; 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20690 2026-05-27 cs.AI 57%

Declarative Data Services: Structured Agentic Discovery for Composing Data Systems

声明式数据服务:用于组合数据系统的结构化智能体发现

Shanshan Ye, Duo Lu

机构 * Northeastern University(东北大学) Brown University(布朗大学)

专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI

AI总结 提出声明式数据服务(DDS)架构,通过分层类型契约将全局搜索分解为有界子搜索,解决无界智能体发现无法稳定收敛的问题,并在交易后端工作负载上验证其有效性。

Comments Accepted at AI Agents for Discovery in the Wild (AID-Wild), Workshop at ACM CAIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19186 2026-05-27 cs.AI 57%

Discoverable Agent Knowledge -- A Formal Framework for Agentic KG Affordances (Extended Version)

可发现的智能体知识——智能体知识图谱能力的形式化框架(扩展版)

Terry R. Payne, Valentina Tamma, Enrico Daga

机构 * School of Computer Science and Informatics, University of Liverpool, UK(利物浦大学计算机科学与信息学学院) Open University(开放大学)

专题命中 代码与定理证明 :planning(abstract);分类 cs.AI

AI总结 本文提出一个四维形式化框架(语义表达性、智能体可发现性、任务相对基础性和认知信任范围),并从中推导出智能体能力概况(AAP),作为VoID和DCAT之上的语义层,支持智能体在规划时进行原则性的知识图谱选择、组合和故障诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09943 2026-05-26 cs.AI 57%

PathMem: Toward Cognition-Aligned Memory Transformation for Pathology MLLMs

PathMem: 面向病理学多模态大模型的认知对齐记忆转换

Jinyue Li, Yuci Liang, Qiankun Li, Xinheng Lyu, Jiayu Qian, Huabao Chen, Kun Wang, Zhigang Zeng, Anil Anthony Bharath, Yang Liu

机构 * University of Science and Technology of China(中国科学技术大学) Shenzhen University(深圳大学) Nanyang Technological University(南洋理工大学) Imperial College London(伦敦帝国学院) Huazhong University of Science and Technology(华中科技大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 提出PathMem框架,通过长期记忆与工作记忆的动态转换机制,实现结构化病理知识整合与可解释记忆控制,在WSI报告生成和开放诊断任务上达到SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13389 2026-05-26 cs.AI 57%

From Next Token Prediction to (STRIPS) World Models

从下一个词预测到(STRIPS)世界模型

Carlos Núñez-Molina, Vicenç Gómez, Hector Geffner

机构 * RWTH Aachen University, Germany(亚琛工业大学,德国) Universitat Pompeu Fabra, Spain(庞培法华大学,西班牙)

专题命中 代码与定理证明 :planning(abstract);分类 cs.AI

AI总结 研究下一个词预测能否产生支持规划的世界模型,提出STRIPS Transformer和标准Transformer两种架构,在五个经典规划领域评估训练准确率、泛化能力和规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10009 2026-05-22 cs.AI cs.HC 57%

Discovering High Level Patterns from Simulation Traces

从仿真轨迹中发现高层次模式

Sean Memery, Kartic Subr

机构 * University of Edinburgh(爱丁堡大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种通过程序合成进行无监督学习的方法,将仿真轨迹转换为稀疏的高层次模式表示,以提升大语言模型对物理系统的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21180 2026-05-21 cs.LG cs.SE 57%

Domain-Adaptable Reinforcement Learning for Code Generation with Dense Rewards

用于密集奖励的领域可适应强化学习代码生成

Erfan Aghadavoodi Jolfaei, Daniel Maninger, Abhinav Anand, Mert Tiftikci, Mira Mezini

机构 * Hessian Center for Artificial Intelligence (hessian.AI)(海斯曼人工智能中心) National Research Center for Applied Cybersecurity ATHENE(应用网络安全国家研究中心ATHENE)

专题命中 代码与定理证明 :planning(abstract);分类 cs.LG

AI总结 本研究提出了一种领域可适应的强化学习框架,用于改进代码生成的正确性、质量和安全性,通过定制化的执行感知奖励公式和令牌级奖励映射机制,提高了代码生成在不同领域中的适应性和执行效率。

Comments 10 pages, 2 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11768 2026-05-20 cs.AI 57%

Governing Evolving Memory in LLM Agents: Risks, Mechanisms, and the Stability and Safety Governed Memory (SSGM) Framework

在LLM代理中治理演化的记忆:风险、机制以及稳定性与安全性的治理记忆(SSGM)框架

Chingkwun Lam, Jiaxin Li, Lingfei Zhang, Kuo Zhao

机构 * College of Intelligent Science and Engineering(智能科学与工程学院)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文研究了LLM代理中记忆治理的问题,提出了一种新的SSGM框架,通过一致性验证、时间衰减建模和动态访问控制来缓解记忆腐蚀风险,提高记忆系统的稳定性与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19638 2026-05-20 cs.HC cs.AI cs.CY cs.SE 57%

The Accessibility Capability Boundary: Operational Limits and Expansion Potential of AI-Generated Browser-Native Accessibility Systems

可访问性能力边界:AI生成浏览器原生可访问性系统的操作极限与扩展潜力

Rizwan Jahangir, Daisuke Ishii

机构 * NUST Business School, NUST(NUST商学院,NUST) Kiara Inc.(Kiara公司)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文提出可访问性能力边界(ACB)理论框架,探讨AI生成浏览器原生可访问性系统在操作极限和扩展潜力方面的核心问题,并通过实证原型分析,定义了可访问性能力空间中的可达区域和不可达区域,为自主可访问性计算的可扩展性提供了理论基础。

Comments 21 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19604 2026-05-20 cs.AI 57%

Formal Skill: Programmable Runtime Skills for Efficient and Accurate LLM Agents

形式技能:用于高效且准确LLM代理的可编程运行时技能

Xi Zhang, Meijun Gao, Yuntian Zhao, Xinyu Tan, Yilun Yao, Feiyu Wang, Yanshu Wang, Dingsiyi, Tong Yang

机构 * FairyClaw

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文提出形式技能,一种用于LLM代理的可编程运行时技能抽象,通过JSON元数据和动作模式、可靠的Python执行器、受钩子控制的控制逻辑、形式技能路由和本地运行时状态,提高代理的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18133 2026-05-19 cs.CR cs.AI cs.HC cs.IR 57%

An Empirical Study of Privacy Leakage Chains via Prompt Injection in Black-Box Chatbot Environments

通过提示注入在黑盒聊天机器人环境中研究隐私泄露链的实证研究

Hongjang Yang, Hyunsik Na, Daeseon Choi

机构 * Department of Information Security(信息安全系) Soongsil University(松山大学) AI Safety Center(人工智能安全中心) Department of AI Software(人工智能软件系)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文研究了通过间接提示注入在黑盒聊天机器人环境中存在的隐私泄露攻击链,分析了攻击者如何通过构造看似无害的外部内容来劫持代理任务,并评估了新的提示注入技术'exemplification'的攻击成功率,最终展示了使用虚构个人信息的证明概念数据外泄链。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18073 2026-05-19 cs.SE cs.AI 57%

A-ProS: Towards Reliable Autonomous Programming Through Multi-Model Feedback

A-ProS:通过多模型反馈实现可靠的自主编程

Anika Tabassum, Md Sifat Hossain, Md. Fahim Arefin, Tariqul Islam, Tarannum Shaila Zaman

机构 * Dept. of Computer Science and Engineering, University of Dhaka(达卡大学计算机科学与工程系) Dept. of Information Systems, University of Maryland, Baltimore County(马里兰大学巴尔的摩县信息学院) University of Maryland, Baltimore County(马里兰大学巴尔的摩县)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文提出A-ProS,一种通过多模型反馈框架实现自主编程的AI代理,结合生成器和调试器,通过多轮反馈提升代码生成的准确性与效率,实验表明其在解决编程问题上具有显著优势。

Comments Accepted for Publication in ACM Transactions on Software Engineering and Methodology (TOSEM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17255 2026-05-19 cs.AI math.OC 57%

CAM-Bench: A Benchmark for Computational and Applied Mathematics in Lean

CAM-Bench: 一个用于Lean中的计算与应用数学的基准测试

Wentao Long, Yunfei Zhang, Chenyi Li, Li Zhou, Chumin Sun, Zaiwen Wen

机构 * Fudan University(复旦大学) Qingdao University(青岛大学) Peking University(北京大学) Huawei Technologies Ltd.(华为技术有限公司)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文提出CAM-Bench,一个包含1000个Lean证明目标的基准测试,涵盖优化、数值线性代数和数值分析等领域,旨在补充现有形式化数学基准测试,通过针对依赖教科书概念和基本定理的应用数学问题进行评估。

Comments Preprint. 44 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08437 2026-05-19 cs.CL 57%

Large Language Models and Impossible Language Acquisition: "False Promise" or an Overturn of our Current Perspective towards AI

大语言模型与不可能的语言习得:"虚假承诺"或对当前人工智能观点的颠覆

Ziyan Wang, Longlong Ma

机构 * New Talent Academy(新人才学院) Institute of Software, University of Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 代码与定理证明 :self-correction(abstract);分类 cs.CL

AI总结 本文通过实验探讨大语言模型学习可能与不可能语言的能力,发现GPT-2模型在自然语言任务上表现优于不可能语言任务,而LSTM模型则无显著差异,挑战了Chomsky对AI的理性主义基础观点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16640 2026-05-19 cs.LG 57%

Provably Shorter Scratchpads in Hybrid DeltaNet-Attention Decoders

在混合DeltaNet-注意力解码器中证明更短的scratchpad

Tomasz Steifer

机构 * Centre for Credible AI(可信人工智能中心) Warsaw University of Technology(华沙理工大学)

专题命中 代码与定理证明 :chain-of-thought(abstract);分类 cs.LG

AI总结 研究混合递归-注意力解码器的表达能力,证明混合架构在模型表达性和效率上有优势,使用常数精度假设,Qwen风格的混合模型能以常数scratchpad解决parity-conditioned检索任务,而纯DeltaNet或纯注意力模型需多项式scratchpad。

Comments Under review at a ML conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15445 2026-05-18 cs.AI 57%

From LLM-Generated Conjectures to Lean Formalizations: Automated Polynomial Inequality Proving via Sum-of-Squares Certificates

从LLM生成的猜想到Lean形式化:通过求和平方证书实现自动多项式不等式证明

Ruobing Zuo, Hanrui Zhao, Gaolei He, Zhengfeng Yang, Jianlin Wang

机构 * School of Software Engineering, East China Normal University, Shanghai, China(东华大学软件工程学院) College of Computer Science and Technology, National University of Defense Technology, Changsha, China(国防科技大学计算机科学与技术学院) School of Computer and Information Engineering, Henan University, Kaifeng, China(河南大学计算机与信息工程学院)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文提出NSPI框架,结合LLM和符号计算,通过求和平方证书实现多项式不等式证明,展示其在10变量多项式上的有效性与可扩展性。

Comments Accepted to ICML 2026. Preprint version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15301 2026-05-18 cs.AI 57%

Solvita: Enhancing Large Language Models for Competitive Programming via Agentic Evolution

Solvita:通过代理进化增强大型语言模型以应对编程竞赛

Han Li, Jinyu Tian, Rili Feng, Yuqiao Du, Chong Zheng, Chenyu Wang, Chenchen Liu, Shihao Li, Xinping Lei, Yifan Yao, Weihao Xie, Letian Zhu, Jiaheng Liu

机构 * Nanjing University(南京大学) Tsinghua University(清华大学) Independent Researcher(独立研究者)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 Solvita通过闭环系统和可训练知识网络,使代理动态学习,提升编程竞赛任务的准确性和经验积累。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15223 2026-05-18 cs.AR cs.AI 57%

GenAI-Driven Approach to RISC-V Supply Chain Exploration

基于生成式人工智能的RISC-V供应链探索方法

Nenad Petrovic, Andre Schamschurko, Yingjie Xu, Alois Knoll

机构 * Chair of Robotics, Artificial Intelligence and Real-Time Systems(机器人、人工智能与实时系统教授会) Technical University of Munich(慕尼黑技术大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文提出利用LLM和VLM的供应链分析流程,结合MDE技术提升对异构数据的分析能力,通过知识图谱揭示供应链组件间的依赖关系,支持供应链韧性评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14561 2026-05-15 cs.AI 57%

Prompt Segmentation and Annotation Optimisation: Controlling LLM Behaviour via Optimised Segment-Level Annotations

提示分割与标注优化:通过优化段级标注控制大语言模型行为

Devika Prasad, Luke Gerschwitz, Tong Li, Henry Xiao, Anjin Liu, Coco Wu, Anna Leontjeva, Luiz Pizzato

机构 * Commonwealth Bank of Australia(澳大利亚全国银行)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文提出PSAO框架,通过段级标注提升提示优化的可控性和效率,实验证明标注能提高LLM推理准确性和自一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13773 2026-05-15 cs.SE cs.AI cs.LO 57%

(How) Do Large Language Models Understand High-Level Message Sequence Charts?

(如何)大型语言模型理解高层次消息序列图?

Mohammad Reza Mousavi

机构 * Department of Informatics, King's College London(伦敦国王学院信息学院)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 研究探讨大型语言模型对高层次消息序列图(HMSC)语义的理解程度,通过129个语义任务测试三个模型,发现其在基本概念上准确率较高,但在抽象、组合及轨迹计算等任务上表现较差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21104 2026-05-15 cs.LG cs.PL 57%

BRIDGE: Building Representations In Domain Guided Program Synthesis

BRIDGE: 在领域引导的程序合成中构建表示

Robert Joseph George, Carson Eisenach, Udaya Ghai, Dominique Perrault-Joncas, Anima Anandkumar, Dean Foster

机构 * California Institute of Technology(加州理工学院) Amazon(亚马逊)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.LG

AI总结 BRIDGE通过多艺术ifacts程序合成框架提升Lean验证正确性,结合代码、规范和定理证明领域,提高生成效率和正确率。

Comments 41 pages, 10 figures, 3 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏