arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3240 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3240 篇

2605.11167 2026-05-13 cs.CL cs.AI cs.LG 67%

The Bicameral Model: Bidirectional Hidden-State Coupling Between Parallel Language Models

双通道模型:并行语言模型之间双向隐藏状态耦合

Cedric Flamant, Udaya Ghai, Kanna Shimizu

机构 * AWS Agentic AI(AWS智能AI)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出双通道模型,通过可训练的神经接口在两个预训练语言模型的中间隐藏状态之间建立双向耦合,实现任务驱动与工具执行的协同,提升多任务性能。

Comments 9 pages main text, 5 figures, 24 pages appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04894 2026-05-13 cs.CL cs.AI cs.LG 67%

Asymmetric Advantage Modulation Calibrates Entropy Dynamics in RLVR

不对称优势调制校准RLVR中的熵动态

Hengrui Gu, Xiaotian Han, Yujing Bian, Feiyi Wang, Kaixiong Zhou

机构 * North Carolina State University(北卡罗来纳州立大学) Case Western Reserve University(凯斯西储大学) Oak Ridge National Laboratory(橡树岭国家实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究RLVR中探索受限问题,提出AsymGRPO通过分离正负优势调制强度,精准控制熵动态以提升推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03783 2026-05-12 cs.LG cs.AI cs.CL 67%

Efficient Estimation of Kernel Surrogate Models for Task Attribution

高效估计用于任务归因的核替代模型

Zhenshuo Zhang, Minxuan Duan, Hongyang R. Zhang

机构 * Northeastern University(东北大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出核替代模型用于高效估计任务归因,通过第二阶分析建立线性替代模型与影响函数的联系,并在多个任务设置中验证其有效性,实现更高的相关性和可扩展性。

Comments 27 pages. Appeared in ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07865 2026-05-11 cs.LG cs.AI cs.CL 67%

KL for a KL: On-Policy Distillation with Control Variate Baseline

KL 为 KL:带有控制变量基线的在线蒸馏

Minjae Oh, Sangjun Song, Gyubin Choi, Yunho Choi, Yohan Jo

机构 * Graduate School of Data Science(数据科学研究生院) Seoul National University(首尔国立大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出vOPD,通过引入控制变量基线将在线蒸馏转化为策略梯度强化学习,有效降低梯度方差,提升稳定性,并在多个基准上优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00847 2026-05-08 cs.CL cs.AI cs.LG 67%

H-Probes: Extracting Hierarchical Structures From Latent Representations of Language Models

H-Probes:从语言模型的潜在表示中提取层次结构

Cutter Dawes, Aryan Sharma, Angelos Ioannis Lagos, Shivam Raval

机构 * Supervised Program for Alignment Research(对齐研究监督计划) Yale University(耶鲁大学) Harvard University(哈佛大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 H-Probes通过线性探针从语言模型的潜在表示中提取层次结构,揭示模型在语法、概念及推理过程中的深层抽象能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16989 2026-04-27 cs.CL cs.AI cs.LG cs.LO 67%

Bolzano: Case Studies in LLM-Assisted Mathematical Research

Bolzano:大语言模型辅助数学研究的案例研究

Martin Balko, Jan Grebík, Pavel Hubáček, Martin Koutecký, Matěj Kripner, Václav Rozhoň, Robert Šámal, Adrián Zámečník

机构 * Computer Science Institute, Charles University(查尔斯大学计算机科学研究所) Institute of Mathematics, Czech Academy of Sciences(捷克科学院数学研究所) Institute of Formal and Applied Linguistics, Charles University(查尔斯大学形式与应用语言学研究所) Department of Applied Mathematics, Charles University(查尔斯大学应用数学系)

专题命中 数学推理 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过八个数学和理论计算机科学问题,展示Bolzano系统如何通过多代理交互生成可发表的研究成果,其中五项几乎完全自主完成。

Comments 33 pages, 1 figure. Project page: https://bolzano.app

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19485 2026-04-22 cs.LG cs.AI cs.CL 67%

EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training

EVPO:用于大语言模型后训练中自适应批评者利用的解释方差策略优化

Chengjun Pan, Shichun Liu, Jiahang Lin, Dingwei Zhu, Jiazheng Zhang, Shihan Dou, Songyang Gao, Zhenhua Han, Binghai Wang, Rui Zheng, Xuanjing Huang, Tao Gui, Yansong Feng

机构 * Peking University(北京大学) Fudan University(复旦大学) Shanghai Qiji Zhifeng Co., Ltd.(上海启智科技有限公司) Shanghai AI Lab(上海人工智能实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出EVPO,通过监控批量方差并自适应切换基于批评者或批量均值估计,证明在每一步都能达到更小的方差。在四个任务中,EVPO优于PPO和GRPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17614 2026-04-21 cs.AI cs.CL cs.LG 67%

Characterizing Model-Native Skills

刻画模型内禀技能

Feiyang Kang, Mahavir Dabas, Myeongseob Ko, Ruoxi Jia

机构 * Virginia Tech(弗吉尼亚理工学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出模型内禀技能的刻画方法,通过从序列激活中恢复紧凑正交基,实现行为变化轴的自组织,验证了在推理和安全对齐中的有效性,优于人类定义的技能。

Comments We argue that when the goal is to intervene on model behavior, skill characterization should be *model-native*: grounded in the model's own representations rather than imposed through external ontologies

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07084 2026-04-21 cs.LG cs.AI cs.CL 67%

Countdown-Code: A Testbed for Studying The Emergence and Generalization of Reward Hacking in RLVR

Countdown-Code:研究RLVR中奖励黑客现象涌现与泛化的测试平台

Muhammad Khalifa, Zohaib Khan, Omer Tafveez, Hao Peng, Lu Wang

机构 * University of Michigan(密歇根大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Countdown-Code测试环境,通过分离代理奖励与真实奖励,研究LLM在监督微调中无意学习奖励黑客行为及其在强化学习中的泛化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10959 2026-04-20 cs.LG cs.AI cs.CL stat.ML 67%

Revisiting Entropy Regularization: Adaptive Coefficient Unlocks Its Potential for LLM Reinforcement Learning

重新审视熵正则化:自适应系数解锁其在大语言模型强化学习中的潜力

Xiaoyun Zhang, Xiaojian Yuan, Di Huang, Wang You, Chen Hu, Jingqing Ruan, Ai Jian, Kejiang Chen, Xing Hu

机构 * State Key Lab of Processors, Institute of Computing Technology, CAS(处理器国家重点实验室,计算技术研究所,中国科学院) University of Science and Technology of China(中国科学技术大学) University of Chinese Academy of Sciences(中国科学院大学) StepFun Inc(StepFun公司)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文重新审视熵正则化在强化学习中的应用,提出自适应熵正则化框架,通过动态平衡探索与利用提升数学推理性能。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19509 2026-04-14 cs.CL cs.AI cs.LG 67%

Pyramid MoA: A Probabilistic Framework for Cost-Optimized Anytime Inference

金字塔MoA:一种用于成本优化的任何时间推断概率框架

Arindam Khaled

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Pyramid MoA框架,通过概率方法优化任何时间推断,实现高效查询路由和计算节省。

Comments 12 pages, 6 figures, 4 tables. v3: corrected router direction, added multi-benchmark context-aware escalation analysis, added Dean & Boddy and Horvitz citations

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04898 2026-04-07 cs.AI cs.CL cs.LG 67%

QED-Nano: Teaching a Tiny Model to Prove Hard Theorems

QED-Nano:用小型模型证明难题定理

LM-Provers, Yuxiao Qu, Amrith Setlur, Jasper Dekoninck, Edward Beeching, Jia Li, Ian Wu, Lewis Tunstall, Aviral Kumar

机构 * CMU(卡内基梅隆大学) Hugging Face ETH Zurich(苏黎世联邦理工学院) Project Numina

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出QED-Nano模型,通过三个阶段训练在数学竞赛证明任务中超越大模型,以较低成本实现高性能证明生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18756 2026-03-20 cs.LG cs.AI cs.CL 67%

Are complicated loss functions necessary for teaching LLMs to reason?

复杂损失函数是否必要用于教LLM进行推理?

Gabriele Carrino, Andrea Sassella, Nicolo Brunello, Federico Toschi, Mark James Carman

机构 * DEIB, Politecnico di Milano(米兰理工学院DEIB学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过分析GRPO发现负反馈对训练至关重要,PPO风格约束非必需,提出简化版RGRA在数学基准上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18411 2026-03-20 cs.CL cs.AI cs.LG 67%

TARo: Token-level Adaptive Routing for LLM Test-time Alignment

TARo: 令牌级自适应路由用于大语言模型测试时间对齐

Arushi Rai, Qiang Zhang, Hanqing Zeng, Yunkai Zhang, Dipesh Tamboli, Xiangjun Fan, Zhuokai Zhao, Lizhu Zhang

机构 * Meta University of Pittsburgh(匹兹堡大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 TARo通过令牌级自适应路由在推理时引导冻结的LLM进行结构化推理,提升推理性能达22.4%,并在医疗和指令遵循任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10055 2026-03-12 cs.LG cs.AI cs.CL 67%

Training Language Models via Neural Cellular Automata

通过神经细胞自动机训练语言模型

Dan Lee, Seungwook Han, Akarsh Kumar, Pulkit Agrawal

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过神经细胞自动机生成合成非语言数据,提升语言模型的预训练效果和推理能力。

Comments Website: https://hanseungwook.github.io/blog/nca-pre-pre-training/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01815 2026-03-12 cs.CL cs.AI cs.LG 67%

KV Cache Transform Coding for Compact Storage in LLM Inference

KV缓存变换编码用于LLM推理中的紧凑存储

Konrad Staniszewski, Adrian Łańcucki

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 KVTC通过变换编码实现LLM推理中的高效缓存压缩,保持推理和长上下文准确性,压缩率可达20倍或更高。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11662 2026-03-10 cs.AI cs.CL cs.LG cs.MA cs.RO 67%

Let's Think in Two Steps: Mitigating Agreement Bias in MLLMs with Self-Grounded Verification

两步思考:通过自我 grounded 验证缓解 MLLM 的同意偏差

Moises Andrade, Joonhyuk Cha, Brandon Ho, Vriksha Srihari, Karmesh Yadav, Zsolt Kira

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出 SGV 方法,通过自我 grounded 验证缓解 MLLM 的同意偏差,提升验证准确性和任务完成率。

Comments ICLR 2026. Code, models, and data publicly available at https://mshalimay.github.io/agreement-bias-sgv/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06333 2026-03-09 cs.AI cs.CL cs.LG 67%

SAHOO: Safeguarded Alignment for High-Order Optimization Objectives in Recursive Self-Improvement

SAHOO:递归自我改进中高阶优化目标的安全保障

Subramanyam Sahoo, Aman Chadha, Vinija Jain, Divya Chaudhary

机构 * MARS 4.0 Fellowship, Cambridge AI Safety Hub(CAISH), University of Cambridge(剑桥大学) AWS Generative AI Innovation Center, Amazon Web Services, USA(亚马逊网络服务) Google, USA(谷歌) Stanford University(斯坦福大学) Northeastern University, Seattle, WA, USA(东北大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SAHOO通过三种保障措施实现递归自我改进中高阶优化目标的安全保障,显著提升代码生成和推理质量,同时保持约束和事实性。

Comments Published at ICLR 2026 Workshop on AI with Recursive Self-Improvement. 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10177 2026-03-09 cs.LG cs.AI cs.CL cs.CY 67%

Towards Autonomous Mathematics Research

迈向自主数学研究

Tony Feng, Trieu H. Trinh, Garrett Bingham, Dawsen Hwang, Yuri Chervonyi, Junehyuk Jung, Joonkyung Lee, Carlo Pagano, Sang-hyun Kim, Federico Pasqualotto, Sergei Gukov, Jonathan N. Lee, Junsu Kim, Kaiying Hou, Golnaz Ghiasi, Yi Tay, YaGuang Li, Chenkai Kuang, Yuan Liu, Hanzhao Lin, Evan Zheran Liu, Nigamaa Nayakanti, Xiaomeng Yang, Heng-Tze Cheng, Demis Hassabis, Koray Kavukcuoglu, Quoc V. Le, Thang Luong

机构 * UC Berkeley(伯克利大学) Brown University(布朗大学) Yonsei University(延世大学) Concordia University(Concordia 大学) Korea Institute for Advanced Study(韩国高级研究院) UC San Diego(圣地亚哥大学) Caltech(加州理工学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Aletheia是一个能够自主生成、验证和修订数学解决方案的代理,展示了AI在数学研究中的应用,包括生成研究论文和解决开放问题。

Comments 42 pages, updated with summary of FirstProof results. Accompanied blog post https://deepmind.google/blog/accelerating-mathematical-and-scientific-discovery-with-gemini-deep-think/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03230 2026-03-04 cs.LG cs.AI cs.CL math.OC 67%

DiaBlo: Diagonal Blocks Are Sufficient For Finetuning

DiaBlo: 对角块足以用于微调

Selcuk Gurses, Aozhong Zhang, Yanxia Deng, Xun Dong, Xin Li, Naigang Wang, Penghang Yin, Zi Yang

机构 * University at Albany, SUNY(纽约州立大学阿尔巴尼分校) IBM T. J. Watson Research Center(IBM 汤普逊·杰·沃森研究中心)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 DiaBlo是一种仅更新模型权重矩阵对角块的参数高效微调方法,通过消除低秩矩阵乘积需求,实现稳定收敛和高效训练。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23383 2026-03-03 cs.CL cs.AI cs.LG 67%

Train Once, Answer All: Many Pretraining Experiments for the Cost of One

一次训练,全部回答:为一次训练成本进行多项预训练实验

Sebastian Bordt, Martin Pawelczyk

机构 * University of Tübingen(图宾根大学) Tübingen AI Center(图宾根人工智能中心) University of Vienna(维也纳大学) Faculty of Computer Science(计算机科学学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过一次训练运行同时进行多项预训练实验,有效降低计算成本并提升研究的严谨性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01822 2026-03-03 cs.CL cs.AI cs.CV cs.LG cs.MA 67%

InnoGym: Benchmarking the Innovation Potential of AI Agents

InnoGym:评估AI智能体创新潜力的基准测试

Jintian Zhang, Kewei Xu, Jingsheng Zheng, Zhuoyun Yu, Yuqi Zhu, Yujie Luo, Lanning Wei, Shuofei Qiao, Lun Du, Da Zheng, Shumin Deng, Huajun Chen, Ningyu Zhang

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) National University of Singapore(新加坡国立大学) Zhejiang University - Ant Group Joint Laboratory of Knowledge Graph(知识图谱联合实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 InnoGym通过引入性能提升和新颖性两个指标,首次系统评估AI智能体的创新潜力,揭示了创造力与有效性的平衡问题。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02245 2026-03-03 cs.LG cs.AI cs.CL 67%

ExGRPO: Learning to Reason from Experience

ExGRPO:从经验中学习推理

Runzhe Zhan, Yafu Li, Zhi Wang, Xiaoye Qu, Dongrui Liu, Jing Shao, Derek F. Wong, Yu Cheng

机构 * University of Macau(澳门大学) Shanghai AI Laboratory(上海人工智能实验室) Nanjing University(南京大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ExGRPO通过组织和优先处理有价值的经验,提升大语言模型的推理性能并稳定训练过程。

Comments ICLR 2026 Camera Ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11164 2026-02-13 cs.LG cs.AI cs.CL 67%

Automated Optimization Modeling via a Localizable Error-Driven Perspective

通过可定位的误差驱动视角实现自动化优化建模

Weiting Liu, Han Wu, Yufei Kuang, Xiongwei Han, Tao Zhong, Jianfeng Feng, Wenlian Lu

机构 * Fudan University(复旦大学) Huawei Noah’s Ark Lab(华为诺亚实验室) University of Science and Technology of China(中国科学技术大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MIND通过可定位的误差驱动视角,改进自动化优化建模方法,提升训练后性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14238 2026-02-10 cs.CL cs.AI cs.LG 67%

ABBA-Adapters: Efficient and Expressive Fine-Tuning of Foundation Models

ABBA-Adapters: 高效且表达力强的基础模型微调

Raghav Singhal, Kaustubh Ponkshe, Rohit Vartak, Praneeth Vepakomma

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫德尔·本·扎耶德人工智能大学) Duke University(杜克大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ABBA-Adapters通过引入低秩矩阵的Hadamard乘积,实现高效且表达力强的基础模型微调,显著提升适应新领域的性能。

Comments ICLR 2026. Raghav Singhal, Kaustubh Ponkshe, and Rohit Vartak contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04010 2026-02-09 cs.LG cs.AI cs.CL cs.NE 67%

Hyperbolic Fine-Tuning for Large Language Models

双曲微调用于大语言模型

Menglin Yang, Ram Samarth B B, Aosong Feng, Bo Xiong, Jihong Liu, Irwin King, Rex Ying

机构 * HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学) Indian Institute of Science(印度科学研究院) Yale University(耶鲁大学) Stanford University(斯坦福大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 HypLoRA通过在双曲空间中进行低秩适应,提升大语言模型在算术和常识推理任务中的性能。

Comments NeurIPS 2025; https://github.com/marlin-codes/HypLoRA

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03531 2026-02-06 cs.CL cs.AI cs.LG 67%

Real-Time Detection of Hallucinated Entities in Long-Form Generation

长文本生成中hallucinated实体的实时检测

Oscar Obeso, Andy Arditi, Javier Ferrando, Joshua Freeman, Cameron Holmes, Neel Nanda

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种廉价且可扩展的方法,用于实时检测长文本生成中的幻觉实体,通过网络搜索标注数据集训练高效分类器,并在多个模型家族上实现了优于基线的检测效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00092 2026-02-03 cs.LG cs.AI cs.CL cs.CV 67%

Interpreting and Controlling Model Behavior via Constitutions for Atomic Concept Edits

通过宪法进行原子概念编辑来解释和控制模型行为

Neha Kalibhat, Zi Wang, Prasoon Bajpai, Drew Proud, Wenjun Zeng, Been Kim, Mani Malek

机构 * Google DeepMind(谷歌DeepMind)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究提出通过原子概念编辑学习模型宪法,以解释和控制模型行为,实验证明其在提升模型成功率方面效果显著。

Journal ref Twenty-Ninth Annual Conference on Artificial Intelligence and Statistics (AISTATS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23149 2026-02-02 cs.SD 67%

Hearing is Believing? Evaluating and Analyzing Audio Language Model Sycophancy with SYAUDIO

听信还是不信?评估和分析音频语言模型的趋炎附势行为 with SYAUDIO

Junchi Yao, Lokranjan Lakshmikanthan, Annie Zhao, Danielle Zhao, Shu Yang, Zikang Ding, Di Wang, Lijie Hu

机构 * University of Electronic Science and Technology of China(电子科技大学) Mohamed bin Zayed University of Artificial Intelligence(Mohamed bin Zayed人工智能大学) King Abdullah University of Science and Technology(卡布斯大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract)

AI总结 SYAUDIO是首个评估音频语言模型趋炎附势行为的基准,通过系统分析不同领域和条件下的趋炎附势现象,验证了监督微调在减少此类行为中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22628 2026-02-02 cs.LG cs.AI cs.CL 67%

TTCS: Test-Time Curriculum Synthesis for Self-Evolving

TTCS: 测试时课程合成用于自演化

Chengyi Yang, Zhishang Xiang, Yunbo Tang, Zongpei Teng, Chengsong Huang, Fei Long, Yuhan Liu, Jinsong Su

机构 * Xiamen University(厦门大学) Washington University in St. Louis(华盛顿大学圣路易斯分校) Renmin University of China(中国人民大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 TTCS通过共进化框架提升LLM推理能力,利用生成器和求解器的协同进化,动态构建测试时课程以增强模型性能。

Comments 10 pages, 4 figures, Our code and implementation details are available at https://github.com/XMUDeepLIT/TTCS

详情

展开后加载摘要…

URL PDF HTML 收藏