Recognizing and Verifying Mathematical Equations using Multiplicative Differential Neural Units
专题命中 数学推理 :reasoning(abstract);分类 cs.LG
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 数学推理 :reasoning(abstract);分类 cs.LG
专题命中 数学推理 :reasoning(abstract);分类 cs.LG
Comments Accepted by IEEE Transactions on Intelligent Transportation Systems
专题命中 数学推理 :reasoning(abstract);分类 cs.CL
Comments 43 pages, lots of pictures
专题命中 数学推理 :reasoning(abstract);分类 cs.CL
Comments 40+32 pages
专题命中 数学推理 :reasoning(abstract);分类 cs.AI
专题命中 数学推理 :reasoning(abstract);分类 cs.AI
Comments 12 pages, 1 figure, 1 table, submitted version
专题命中 数学推理 :reasoning(abstract);分类 cs.AI
Comments 145 pages, 61 figures, 1 table. PhD thesis, National Laboratory for Scientific Computing (LNCC), Brazil, February 2015
专题命中 数学推理 :分类 cs.CL、cs.AI、cs.LG;reasoning(comments)
Comments NeurIPS'24 MATH-AI, the 4th Workshop on Mathematical Reasoning and AI
面向多模态智能体学习者的双粒度智能体记忆与Shapley上下文归因
机构 * UC Merced(加州大学默塞德分校) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 数学推理 :reasoning(abstract)
AI总结 针对多模态大模型推理不足的问题,提出双粒度智能体记忆框架DG-Mem,结合Shapley上下文归因,在多个数学多模态推理数据集上实现性能提升,且无需参数更新即可适配各类骨干模型。
扰动思路而非像素:用于视觉语言模型强化学习的潜在空间展开多样化
机构 * Amazon Web Services(亚马逊网络服务)
专题命中 数学推理 :reasoning(abstract)
AI总结 该研究提出 NC-GRPO 方法,通过在 VLM 潜在空间注入噪声实现展开多样化,提升了其数学推理与幻觉鲁棒性,且仅需少量代码修改即可整合进 RLVR 流程。
评估大语言模型在科学软件中稳定数值表达式的能力
专题命中 数学推理 :reasoning(abstract)
AI总结 本文评估大语言模型在数值稳定性任务中的表现,发现其在检测和稳定不稳定的计算方面与传统方法相当,并在某些情况下表现更优,但对控制流和高精度字面量处理较弱。
AI作为独立游戏开发中的民主化力量
专题命中 数学推理 :planning(abstract)
AI总结 该研究考察AI对2024-2026年游戏行业分化的影响,发现AI大幅降低独立游戏制作的协调成本,推动第三波民主化浪潮,披露AI的游戏接受度与传统游戏相当,但市场已呈现结构性过剩的前提条件。
MIDAL:用于无障碍学习的数学图像描述
机构 * E.K. Solutions Pvt. Ltd.(E.K.解决方案私人有限公司)
专题命中 数学推理 :reasoning(abstract)
AI总结 该研究推出含2020张多级别数学图像的MIDAL数据集,用于训练视觉语言模型生成无障碍图像描述,还可微调语言模型提升数学推理能力,助力高等教育STEM内容无障碍性建设。
密码分析基准测试:大语言模型能进行密码分析吗?
专题命中 数学推理 :reasoning(abstract)
AI总结 研究探讨大语言模型能否进行密码分析,引入包含六个密码原语家族191个任务的CryptanalysisBench基准测试,五个前沿模型在不同层级有一定破解率,不仅得出已知结果还产生新成果,发布该基准测试以追踪人工智能密码分析进展及压力测试候选方案。
Comments 46 pages, 5 figures, 4 tables
Smart-TCP:基于智能体AI的自主自适应TCP协议
专题命中 数学推理 :reasoning(abstract)
AI总结 提出Smart-TCP框架,利用大/小语言模型与算术逻辑单元协同决策,实现TCP控制逻辑的自适应,实验显示高精度与全生命周期成功率。
Comments Submitted for possible journal publication
TGMS:一种原生代理双时态图管理系统
专题命中 数学推理 :verifier(abstract)
AI总结 研究针对时态图问题中LLM代理常失败的情况,提出双时态属性图管理系统TGMS,将13个运算符作为代理工具,LLM规划调用,系统计算,能分离有效时间与事务时间,在基准测试中表现优异,开源代码等。
稀疏-LaViDa:稀疏多模态离散扩散语言模型
机构 * Adobe(Adobe公司) ; UCLA(加州大学洛杉矶分校)
专题命中 数学推理 :reasoning(abstract)
AI总结 针对掩码离散扩散模型推理速度慢的问题,提出Sparse-LaViDa框架,通过动态截断冗余掩码令牌加速采样,引入专用寄存器令牌和注意力掩码保证质量与一致性,基于LaViDa - O构建,在多任务中实现加速且保持质量。
Comments 18 pages (12 pages for the main paper and 6 pages for the appendix), 9 figures
SIVA-RL:用于多模态强化学习的灵敏度不变视觉对齐
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Shanghai Jiao Tong University(上海交通大学) ; Sichuan University(四川大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; University of Macau(澳门大学)
专题命中 数学推理 :reasoning(abstract)
AI总结 研究多模态强化学习中视觉语言模型预测与视觉证据结合问题,提出SIVA-RL框架,通过特定方法构建局部干预并以奖励下降为权重驱动对齐,在多基准测试中相比基线改进了模型。
Comments 27 pages, 11 figures
ParaTutor: 通过角色分离的实时脚手架界面实现LLM介导的亲子辅导
专题命中 数学推理 :reasoning(abstract)
AI总结 针对亲子辅导中角色不对称问题,提出ParaTutor系统,通过为家长提供辅导指导、为孩子提供视觉基础,在实时互动中保持家长主导和孩子参与,实验表明优于通用LLM辅助。
没有理解的自动化
专题命中 数学推理 :reasoning(abstract)
AI总结 探讨人工智能产出数学成果但美国削弱相关人才培养渠道这一现象,主张将数学能力视为战略资产,提出要求进行重要推理的人工智能系统以可检查形式公开关键主张,以避免战略错误。
Comments 10 pages. Comments welcome
有界峰度下的精确最坏情况尾概率
专题命中 数学推理 :reasoning(abstract)
AI总结 研究有界峰度下单边尾控制问题,通过AI引导搜索确定最坏情况尾概率的四区域映射,给出各区域表达式及证明度相图,还得到精确最坏情况分位数等。
Comments v2: fixed cross-reference names rendered incorrectly by the arXiv TeX complier and made minor edits. Code, certificates, and the full instance tables are available at https://github.com/xiaoyulics/lemmaforge
证明门与CDCL求解器的效率
专题命中 数学推理 :reasoning(abstract)
AI总结 本文提出证明门参数,用于解释CDCL求解器在电路验证中的效率,证明具有小证明门的公式有短的分辨率证明,并展示某些CDCL求解器能高效生成此类证明。
Comments version 2.1
知识增强的智能体漏洞修复
专题命中 数学推理 :reasoning(abstract)
AI总结 提出KeaRepair,一种基于智能体的自动化漏洞修复方法,通过提取历史漏洞知识并利用工具增强的智能体进行诊断,生成并迭代优化补丁,在55个C/C++漏洞上修复率达83.64%。
审计AI投资建议作为可执行行动
专题命中 数学推理 :verifier(abstract)
AI总结 提出将AI投资建议作为可执行金融行动进行审计,通过确定性基线协议评估有效性、稳定性和一致性,发现一致性单独评估具有误导性。
对抗性同伴下的异构LLM辩论:诚实增益、替代成本与韧性
专题命中 数学推理 :reasoning(abstract)
AI总结 研究异构LLM辩论中诚实与对抗性同伴对修正行为的影响,发现诚实同伴降低有害修正率,对抗性同伴则逆转,且异构性在已有对手时也能作为防御。
通过数学多模态模型识别非厄密系统拓扑不变量
专题命中 数学推理 :reasoning(abstract)
AI总结 本文提出利用多模态模型识别非厄密系统拓扑不变量,通过输入哈密顿量的本征值和本征向量,结合数学大语言模型进行复杂计算和推理,有效提取拓扑信息。
朴素和非承诺的复杂代理的通用停止行为,及其在概率扭曲中的应用
专题命中 数学推理 :reasoning(abstract)
AI总结 本文研究了在时间不一致的收益函数下停止扩散过程的问题,分析了朴素代理的连续再优化决策和复杂代理的均衡策略,并探讨了概率扭曲对停止策略的影响。
Journal ref Mathematical Finance, Vol. 30 (2020), Issue 1, pp 310-340
辅导效果指数:从四个对话信号预测LLM数学辅导质量
专题命中 数学推理 :reasoning(abstract)
AI总结 提出无需训练和外部评判的辅导效果指数(TEI),通过四个内部推理信号选择冻结模型,将预错误场景的改进率从59.0%提升至81.9%。
分歧的思维,趋同的基线:LLM与人类战略行为的有界理性解释
专题命中 数学推理 :reasoning(abstract)
AI总结 本文提出有界理性框架,将人类与LLM在战略博弈中的行为差异归因于计算约束的不同,并给出四个操作测试来区分两者的偏差项δ。
Comments 12 pages, 1 table, no figures. Theoretical prequel paper
基于视觉优势的在线策略蒸馏用于视觉-语言模型
机构 * Institute of Automation, CAS(中国科学院自动化研究所) ; School of Advanced Interdisciplinary Sciences, UCAS(中国科学院大学(UCAS)先进交叉学科学院) ; Hello Group Inc.(Hello集团有限公司) ; Sun Yat-sen University(中山大学)
专题命中 数学推理 :reasoning(abstract)
AI总结 本文提出了一种基于视觉优势的在线策略蒸馏方法,用于提升视觉-语言模型对视觉输入的依赖性,通过引入视觉优势指标来区分关键视觉token与语言token,从而提高蒸馏效果。