arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-19 至 2025-12-19 共收录 195 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 9 篇

2512.16565 2025-12-19 math.OC cs.LG 77%

Non-Asymptotic Global Convergence of PPO-Clip

PPO-Clip算法的非渐近全局收敛性

Yin Liu, Qiming Dai, Junyu Zhang, Zaiwen Wen

机构 * Beijing International Center for Mathematical Research, Peking University(北京国际数学研究中心,北京大学) School of Mathematical Sciences, Peking University(北京大学数学学院) Department of Industrial Systems Engineering and Management, National University of Singapore(新加坡国立大学工业系统工程与管理系) Beijing International Center for Mathematical Research and Center for Machine Learning Research, Peking University(北京国际数学研究中心和机器学习研究中心,北京大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.LG

AI总结 本文研究了PPO-Clip算法的非渐近全局收敛性,通过理论分析建立了前向KL正则化器的线性收敛率及反向KL正则化器的静止收敛与局部线性收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09670 2025-12-19 cs.AI 70%

MEML-GRPO: Heterogeneous Multi-Expert Mutual Learning for RLVR Advancement

MEML-GRPO:异构多专家互学习用于强化学习可验证奖励的进步

Weitao Jia, Jinghui Lu, Haiyang Yu, Siqi Wang, Guozhi Tang, An-Lan Wang, Weijie Yin, Dingkang Yang, Yuxiang Nie, Bin Shan, Hao Feng, Irene Li, Kun Yang, Han Wang, Jingqun Tang, Teng Fu, Changhong Jin, Chao Feng, Xiaohui Lv, Can Huang

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 MEML-GRPO通过异构多专家互学习机制,提升RLVR在复杂任务中的推理能力,实现显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08697 2025-12-19 cs.SE cs.AI cs.CL 62%

BigCodeArena: Unveiling More Reliable Human Preferences in Code Generation via Execution

BigCodeArena: 通过执行揭示更多可靠的代码生成人类偏好

Terry Yue Zhuo, Xiaolong Jin, Hange Liu, Juyong Jiang, Tianyang Liu, Chen Gong, Bhupesh Bishnoi, Vaisakhi Mishra, Marek Suppa, Noah Ziems, Saiteja Utpala, Ming Xu, Guangyu Song, Kaixin Li, Yuhan Cao, Bo Liu, Zheng Liu, Sabina Abdurakhmanova, Wenhao Yu, Mengzhao Jia, Jihan Yao, Kenneth Hamilton, Kumar Shridhar, Minh Chien Vu, Dingmin Wang, Jiawei Liu, Zijian Wang, Qian Liu, Binyuan Hui, Meg Risdal, Ahsen Khaliq, Atin Sood, Zhenchang Xing, Wasi Uddin Ahmad, John Grundy, David Lo, Banghua Zhu, Xiaoning Du, Torsten Scholak, Leandro von Werra

机构 * Monash University(墨尔本大学) CSIRO’s Data61(CSIRO的数据61) Purdue University(普渡大学) Independent(独立) HKUST (Guangzhou)(香港科技大学(广州)) UCSD(加州大学圣地亚哥分校) UVA(弗吉尼亚大学) CNRS, France(法国国家科学研究中心) IBM Cisco(思科) Comenius University in Bratislava(布拉提斯拉瓦康门纽斯大学) University of Notre Dame(Notre Dame大学) Uber Tano Labs(Tano实验室) NUS(国立大学新加坡) Institute of Automation, CAS(中国科学院自动化研究所) Tencent AI Lab(腾讯AI实验室) University of Washington(华盛顿大学) Nevsky Collective(Nevsky集体) ETH Zurich(苏黎世联邦理工学院) Detomo Inc(Detomo公司) University of Oxford(牛津大学) UIUC(伊利诺伊大学香槟分校) Google(谷歌) NVIDIA Singapore Management University(新加坡管理学院) ServiceNow Research(ServiceNow研究) Hugging Face

专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 BigCodeArena通过执行揭示更多可靠的代码生成人类偏好,提出自动评分基准评估LLM编码质量。

Comments Built with love by the BigCode community :)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12767 2025-12-19 q-bio.NC cond-mat.dis-nn cs.LG hep-th math.PR 57%

Random matrix theory of sparse neuronal networks with heterogeneous timescales

稀疏神经网络的随机矩阵理论:具有异质时间尺度的神经网络

Thiparat Chotibut, Oleg Evnin, Weerawit Horinouchi

机构 * Complex Systems, Department of Physics, Faculty of Science, Chulalongkorn University, Bangkok, Thailand High Energy Physics Research Unit, Faculty of Science, Chulalongkorn University, Bangkok, Thailand International Solvay Institutes, Brussels, Belgium Mark Kac Center for Complex Systems Research, Jagiellonian University, Krak\'ow, Poland Department of Mathematics, King's College London, London, UK

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 研究通过随机矩阵理论分析稀疏神经网络的动态特性,揭示了异质时间尺度对工作记忆计算稳定性的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16906 2025-12-19 cs.CV 50%

VIVA: VLM-Guided Instruction-Based Video Editing with Reward Optimization

VIVA: 基于VLM的指令式视频编辑与奖励优化

Xiaoyan Cong, Haotian Yang, Angtian Wang, Yizhi Wang, Yiding Yang, Canyu Zhang, Chongyang Ma

机构 * Brown University(布朗大学) Intelligent Creation, ByteDance(字节跳动智能创作)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 VIVA通过VLM引导编码和奖励优化,实现更高效、高质量的指令式视频编辑,提升对复杂指令的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16741 2025-12-19 cs.SE 50%

An Empirical Study of the Realism of Mutants in Deep Learning

深度学习中突变体真实性的实证研究

Zaheed Ahmed, Philip Makedonski, Jens Grabowski

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 本研究通过实证分析比较深度学习中预训练与后训练突变方法的真实性,发现预训练突变体在耦合强度和行为相似性上更优,但其高计算成本促使需开发更高效的后训练操作符。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 长上下文与记忆 8 篇

2512.16532 2025-12-19 cs.AI cs.IR 77%

From Personalization to Prejudice: Bias and Discrimination in Memory-Enhanced AI Agents for Recruitment

从个性化到偏见:记忆增强型AI招聘代理中的偏见与歧视

Himanshu Gharat, Himanshi Agrawal, Gourab K. Patro

机构 * Phi Labs, Quantiphi Inc.(Phi实验室、Quantiphi公司)

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究揭示了记忆增强型AI招聘代理中偏见的系统性引入与强化,强调了对LLM基础AI代理的额外防护措施的必要性。

Comments In Proceedings of the Nineteenth ACM International Conference on Web Search and Data Mining (WSDM '26)

Journal ref In Proceedings of the Nineteenth ACM International Conference on Web Search and Data Mining (WSDM '26), 2026, Boise, ID, USA. ACM, New York, NY, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15790 2025-12-19 cs.CR 75%

Bilevel Optimization for Covert Memory Tampering in Heterogeneous Multi-Agent Architectures (XAMT)

针对异构多智能体架构中的隐蔽内存篡改的双层优化

Akhil Sharma, Shaikh Yaser Arafat, Jai Kumar Sharma, Ken Huang

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 XAMT通过双层优化方法针对异构多智能体架构中的隐蔽内存篡改问题,提出了一种新的训练时威胁模型,以提升系统安全性。

Comments 10 pages, 5 figures, 4 tables. Conference-style paper (IEEEtran). Proposes unified bilevel optimization framework for covert memory poisoning attacks in heterogeneous multi-agent systems (MARL + RAG)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14516 2025-12-19 cs.CR cs.CV cs.LG 70%

Memory Backdoor Attacks on Neural Networks

神经网络中的记忆后门攻击

Eden Luzon, Guy Amit, Roy Weiss, Torsten Kraub, Alexandra Dmitrienko, Yisroel Mirsky

机构 * Ben-Gurion University, Institute of Software Systems and Security(本·加隆大学软件系统与安全研究所) University of Würzburg(魏泽堡大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出了一种神经网络的记忆后门攻击方法,通过恶意服务器系统性地提取客户端训练样本,揭示了联邦学习中的隐私安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16262 2025-12-19 cs.AI 70%

Learning to Wait: Synchronizing Agents with the Physical World

学习等待:与物理世界同步智能体

Yifei She, Ping Zhang, He Liu, Yanmin Jia, Yang Jing, Zijun Liu, Peng Sun, Xiangbin Li, Xiaohe Hu

机构 * Infrawaves Shanghai Qiji Zhifeng Co., Ltd.(上海启智风有限公司) Tsinghua University(清华大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种智能体侧方法,使大语言模型通过预测等待时间实现与物理世界的同步,解决了异步环境中动作延迟的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02262 2025-12-19 cs.CV 67%

From Frames to Clips: Training-free Adaptive Key Clip Selection for Long-Form Video Understanding

从帧到片段:训练免费的自适应关键片段选择用于长形式视频理解

Guangyu Sun, Archit Singhal, Burak Uzkent, Mubarak Shah, Chen Chen, Garin Kessler

机构 * Amazon(亚马逊公司) University of Central Florida(中央佛罗里达大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract)

AI总结 F2C通过自适应关键片段选择提升长视频理解,比均匀采样在多个基准上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24320 2025-12-19 cs.LG stat.ML 57%

AuON: A Linear-time Alternative to Orthogonal Momentum Updates

AuON: 一种线性时间的替代正交动量更新方法

Dipan Maity

专题命中 长上下文与记忆 :language model(abstract);分类 cs.LG

AI总结 AuON是一种线性时间优化器,通过归一化非线性缩放实现替代单位范数动量更新,无需近似正交矩阵,有效处理爆炸性注意力logits并在语言建模任务中优于Muon

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16285 2025-12-19 cs.HC 50%

Machines, AI and the past//future of things

机器、人工智能与事物的过去//未来

Karola Köpferl, Albrecht Kurze

专题命中 长上下文与记忆 :language model(abstract)

AI总结 本文通过重新激活1980年代东德打字机,探讨人工智能与历史技术的交互,挑战进步叙事,强调慢速与物质性在设计中的价值。

Comments State of Responsible Technology 2025 - Generative Things. pp 13-19. Stichting ThingsCon Amsterdam

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15309 2025-12-19 cs.RO 50%

DynamicGSG: Dynamic 3D Gaussian Scene Graphs for Environment Adaptation

DynamicGSG: 动态3D高斯场景图用于环境适应

Luzhou Ge, Xiangyu Zhu, Zhuo Yang, Xuesong Li

机构 * School of Computer Science, Beijing Institute of Technology, China(计算机学院,北京理工大学)

专题命中 长上下文与记忆 :language model(abstract)

AI总结 DynamicGSG通过动态高斯场景图实现环境适应,利用高斯溅射技术构建层次化场景图,提升环境理解和适应能力。

Journal ref 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 推理与问题求解 28 篇

2512.16245 2025-12-19 cs.AI 90%

AlignMerge - Alignment-Preserving Large Language Model Merging via Fisher-Guided Geometric Constraints

AlignMerge - 通过Fisher引导的几何约束实现的保持对齐的大语言模型合并

Aniruddha Roy, Jyoti Patel, Aman Chadha, Vinija Jain, Amitava Das

机构 * AI Institute, University of South Carolina(AI研究院,南卡罗来纳大学) Indian Institute of Technology, Kharagpur(印度理工学院,Khargpur分校) Islamic University of Technology(伊斯兰科技大学) Stanford University, USA(斯坦福大学,美国) Amazon AI, USA(亚马逊AI,美国) HCL(HCL公司) Evalueserve(Evalueserve公司) Apple (USA)(苹果(美国)) Google (USA)(谷歌(美国)) Pragya Lab, BITS Pilani, Goa(Pragya实验室, BITS Pilani,Goa分校)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);foundation model(abstract)

AI总结 AlignMerge通过Fisher引导的几何约束实现大语言模型合并,提升对齐度量并保持性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16676 2025-12-19 cs.LG cs.CL 86%

DataFlow: An LLM-Driven Framework for Unified Data Preparation and Workflow Automation in the Era of Data-Centric AI

DataFlow:面向数据导向AI时代的统一数据准备与工作流自动化框架

Hao Liang, Xiaochen Ma, Zhou Liu, Zhen Hao Wong, Zhengyang Zhao, Zimo Meng, Runming He, Chengyu Shen, Qifeng Cai, Zhaoyang Han, Meiyi Qiang, Yalin Feng, Tianyi Bai, Zewei Pan, Ziyi Guo, Yizhen Jiang, Jingwen Deng, Qijie You, Peichao Lai, Tianyu Guo, Chi Hsu Tsai, Hengyi Feng, Rui Hu, Wenkai Yu, Junbo Niu, Bohan Zeng, Ruichuan An, Lu Ma, Jihao Huang, Yaowei Zheng, Conghui He, Linpeng Tang, Bin Cui, Weinan E, Wentao Zhang

机构 * Peking University(北京大学) Institute for Advanced Algorithms Research(先进算法研究所) OriginHub Technology(OriginHub技术) OpenDataLab(OpenData实验室) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) LLaMA-Factory Team(LLaMA-Factory团队)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 DataFlow通过统一的数据准备框架和自动化工作流,提升LLM性能,实现高效、可靠的数据处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17361 2025-12-19 cs.LG cs.CR 85%

Trust Me, I Know This Function: Hijacking LLM Static Analysis using Bias

相信我,我知道这个函数:利用偏见进行LLM静态分析的劫持

Shir Bernstein, David Beste, Daniel Ayzenshteyn, Lea Schonherr, Yisroel Mirsky

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出利用LLM的抽象偏见进行代码分析的攻击方法,通过注入熟悉模式攻击来劫持LLM的控制流,揭示了LLM在静态分析中的安全漏洞。

Journal ref The Network and Distributed System Security Symposium (NDSS). 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11900 2025-12-19 cs.CL 85%

Finding Flawed Fictions: Evaluating Complex Reasoning in Language Models via Plot Hole Detection

寻找有缺陷的虚构作品:通过情节漏洞检测评估语言模型的复杂推理

Kabir Ahuja, Melanie Sclar, Yulia Tsvetkov

机构 * Paul G. Allen Center for Computer Science & Engineering(保罗·G·艾伦计算机科学与工程中心) University of Washington(华盛顿大学)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL

AI总结 本研究提出通过情节漏洞检测评估语言模型的复杂推理能力,发现先进模型在检测漏洞时表现不佳,且生成故事易引入漏洞。

Comments CoLM 2025 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16649 2025-12-19 cs.CL 83%

JustRL: Scaling a 1.5B LLM with a Simple RL Recipe

JustRL: 通过简单强化学习方法扩展1.5B语言模型

Bingxiang He, Zekai Qu, Zeyuan Liu, Yinghao Chen, Yuxin Zuo, Cheng Qian, Kaiyan Zhang, Weize Chen, Chaojun Xiao, Ganqu Cui, Ning Ding, Zhiyuan Liu

机构 * Tsinghua University(清华大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Shanghai AI Lab(上海人工智能实验室)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 JustRL通过简单强化学习方法在1.5B语言模型上实现高性能,省去复杂训练流程,展现稳定训练效果。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09254 2025-12-19 cs.GT cs.MA 82%

The Illusion of Rationality: Tacit Bias and Strategic Dominance in Frontier LLM Negotiation Games

理性幻觉:前沿大语言模型谈判游戏中的隐性偏见与战略主导

Manuel S. Ríos, Ruben F. Manrique, Nicanor Quijano, Luis F. Giraldo

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract)

AI总结 研究揭示前沿大语言模型在谈判游戏中存在隐性偏见和战略主导现象,挑战了其理性与无偏的假设。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16561 2025-12-19 cs.CV 78%

N3D-VLM: Native 3D Grounding Enables Accurate Spatial Reasoning in Vision-Language Models

N3D-VLM:原生3D接地使视觉-语言模型在3D场景中实现精确的空间推理

Yuxin Wang, Lei Ke, Boqiang Zhang, Tianyuan Qu, Hanxun Yu, Zhenpeng Huang, Meng Yu, Dan Xu, Dong Yu

机构 * HKUST(香港科技大学) Tencent AI Lab(腾讯AI实验室) CUHK(香港中文大学) ZJU(浙江大学) NJU(南京大学)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 N3D-VLM通过原生3D感知能力提升视觉-语言模型在3D场景中的空间推理精度与解释性。

Comments Project Page: https://n3d-vlm.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15940 2025-12-19 cs.CV cs.RO 78%

R4: Retrieval-Augmented Reasoning for Vision-Language Models in 4D Spatio-Temporal Space

R4:在4D时空空间中为视觉语言模型引入检索增强推理

Tin Stribor Sohn, Maximilian Dillitzer, Jason J. Corso, Eric Sax

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Esslingen University of Applied Sciences(埃斯林根应用科学大学) Dr. Ing. h.c. F. Porsche AG(德意志联邦汽车工业协会) University of Michigan(密歇根大学) Voxel51 Inc.(Voxel51公司)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 R4通过构建4D时空知识库,使视觉语言模型具备结构化终身记忆,实现无需训练的检索增强推理,提升动态环境中的具身推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01869 2025-12-19 cs.RO cs.AI cs.MA 77%

TACOS: Task Agnostic COordinator of a multi-drone System

TACOS:多无人机系统的任务无关协调器

Alessandro Nazzari, Roberto Rubinacci, Marco Lovera

机构 * Dipartimento di Scienze e Tecnologie Aerospaziali, Politecnico di Milano(航空航天科学与技术系,米兰理工学院)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 TACOS通过大型语言模型实现多无人机系统的高层自然语言控制,整合自然语言接口、智能协调器和自主代理,实现灵活的任务分配与实时协调。

Comments 8 pages, 9 figures, submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15892 2025-12-19 cs.CR cs.AI 77%

VET Your Agent: Towards Host-Independent Autonomy via Verifiable Execution Traces

验证你的代理:通过可验证的执行轨迹实现主机无关的自主性

Artem Grigor, Christian Schroeder de Witt, Simon Birnbach, Ivan Martinovic

机构 * University of Oxford(牛津大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 VET通过可验证的执行轨迹实现主机无关的自主性,为未来完全自主的代理系统奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08976 2025-12-19 cs.LG cs.AI 73%

Peek-a-Boo Reasoning: Contrastive Region Masking in MLLMs

peek-a-boo推理:多模态大语言模型中的对比区域遮挡

Isha Chaturvedi, Anjana Nair, Yushen Li, Adhitya Rajendra Kumar, Kevin Zhu, Sunishchal Dev, Ashwinee Panda, Vasu Sharma

机构 * Algoverse AI Research(Algoverse AI研究机构) Princeton University(普林斯顿大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 对比区域遮挡通过遮挡视觉区域并对比推理轨迹,揭示多模态大语言模型在推理过程中的依赖模式和失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16279 2025-12-19 cs.AI cs.CL 73%

QuadSentinel: Sequent Safety for Machine-Checkable Control in Multi-agent Systems

QuadSentinel: 多智能体系统中机器可验证的顺序安全控制

Yiliu Yang, Yilei Jiang, Qunzhong Wang, Yingshui Tan, Xiaoyong Zhu, Sherman S. M. Chow, Bo Zheng, Xiangyu Yue

机构 * The Chinese University of Hong Kong(香港中文大学) Alibaba Group(阿里巴巴集团)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 QuadSentinel通过四智能体守卫系统,将安全政策转化为机器可验证规则,提升多智能体系统的安全控制效果。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15756 2025-12-19 cs.LG cs.AI 73%

ReactorFold: Generative discovery of nuclear reactor cores via emergent physical reasoning

ReactorFold:通过涌现物理推理生成核反应堆核心

Yoonpyo Lee

专题命中 推理与问题求解 :language model(abstract);preference optimization(abstract);分类 cs.AI、cs.LG

AI总结 ReactorFold通过生成框架和涌现物理推理,实现了核反应堆核心设计的创新发现,突破传统设计限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16698 2025-12-19 cs.AI cs.CG 70%

Do Multi-Agents Solve Better Than Single? Evaluating Agentic Frameworks for Diagram-Grounded Geometry Problem Solving and Reasoning

多智能体表现更优吗?评估用于图示引导几何问题解决与推理的智能体框架

Mahbub E Sobhani, Md. Faiyaz Abdullah Sayeedi, Mohammad Nehad Alam, Proma Hossain Progga, Swakkhar Shatabda

机构 * BRAC University(布拉克大学) United International University(国际联合大学) Center for Computational & Data Sciences(计算与数据科学中心) Independent University, Bangladesh(孟加拉国独立大学) Spectrum Software & Consulting Ltd(Spectrum软件与咨询有限公司)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文评估了多智能体框架在图示引导几何问题解决中的表现,发现其对开源模型有明显提升,但对闭源模型效果有限,且并非普遍最优。

Comments Accepted to the ARR October 2025 cycle

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16424 2025-12-19 cs.AI 70%

Synthelite: Chemist-aligned and feasibility-aware synthesis planning with LLMs

Synthelite: 基于LLM的化学家对齐且可行性感知的合成规划

Nguyen Xuan-Vu, Daniel Armstrong, Milena Wehrbach, Andres M Bran, Zlatko Jončev, Philippe Schwaller

机构 * École Polytechnique Fédérale de Lausanne (EPFL)(瑞士联邦理工学院洛桑分校) National Centre of Competence in Research (NCCR) Catalysis(瑞士国家催化研究中心) B12 Labs(B12实验室)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Synthelite 基于LLM实现化学家对齐且可行性感知的合成规划,通过自然语言提示允许专家干预,成功率达95%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16287 2025-12-19 cs.CL 70%

Evaluating OpenAI GPT Models for Translation of Endangered Uralic Languages: A Comparison of Reasoning and Non-Reasoning Architectures

评估OpenAI GPT模型用于濒危乌拉尔语系语言的翻译:推理与非推理架构的比较

Yehor Tereshchenko, Mika Hämäläinen, Svitlana Myroniuk

机构 * Metropolia University of Applied Sciences(应用科学大学) University of Helsinki(赫尔辛基大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究比较了OpenAI GPT模型在翻译濒危乌拉尔语系语言中的推理与非推理架构性能,发现推理模型在翻译任务中表现更优。

Comments IWCLUL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏