arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

2026-04-21 至 2026-04-21 共收录 8
2511.14846 2026-04-21 cs.LG cs.AI cs.CL

Empowering Multi-Turn Tool-Integrated Agentic Reasoning with Group Turn Policy Optimization

通过群体回合策略优化增强多轮工具集成代理推理

Yifeng Ding, Hung Le, Songyang Han, Kangrui Ruan, Zhenghui Jin, Varun Kumar, Zijian Wang, Anoop Deoras

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) AWS AI Labs(AWS人工智能实验室) NVIDIA Meta

AI总结 本文提出GTPO算法,通过细粒度奖励、优势估计和自监督奖励塑造,提升大语言模型在多轮工具推理任务中的性能,优于GRPO并在常识推理和程序合成任务中表现更佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18404 2026-04-21 cs.AI

Six Llamas: Comparative Religious Ethics Through LoRA-Adapted Language Models

六头 llama:通过 LoRA 调整的语言模型进行比较宗教伦理研究

Chad Coleman, W. Russell Neuman, Manan Shah, Ali Dasdan, Matthew Crispi, Morris Chiang, Zack Leitman, Mustafa Poonawala

机构 * Meta

AI总结 本文通过 LoRA 调整的语言模型比较不同宗教文本对伦理推理的影响,发现调整模型在伦理推理上与基础模型有系统性差异,并在不同温度设置下表现出稳定性与多样性。

Comments 51 pages, 14 figures. We present Six Llamas, a comparative study examining whether Llama-3.1-8B models fine-tuned on distinct religious corpora encode systematically different patterns of ethical reasoning. Five LoRA-adapted variants are constructed for Christianity, Islam, Judaism, Hinduism, and Buddhism. For theoretical background on the condensate comparative method, see arXiv:2603.07329

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10732 2026-04-21 cs.CL

Macaron: Controlled, Human-Written Benchmark for Multilingual and Multicultural Reasoning via Template-Filling

Macaron:通过模板填充构建多语言多文化推理的受控人工基准

Alaa Elsetohy, Sama Hadhoud, Haryo Akbarianto Wibowo, Chenxi Whitehouse, Genta Indra Winata, Fajri Koto, Alham Fikri Aji

机构 * MBZUAI Meta Capital One

AI总结 Macaron通过模板填充方法构建多语言多文化推理基准,包含11862个实例,涵盖20个国家文化背景、10种文字体系和20种语言方言,评估了21种多语言大模型的推理能力,发现文化相关数学和计数模板最难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21204 2026-04-21 cs.CL cs.AI

SpidR-Adapt: A Universal Speech Representation Model for Few-Shot Adaptation

SpidR-Adapt:一种通用的语音表示模型用于少样本适应

Mahi Luthra, Jiayi Shen, Maxime Poli, Angelo Ortiz, Yosuke Higuchi, Youssef Benchekroun, Martin Gleize, Charles-Eric Saint-James, Dongyan Lin, Phillip Rust, Angel Villar, Surya Parimi, Vanessa Stark, Rashel Moritz, Juan Pino, Yann LeCun, Emmanuel Dupoux

机构 * Meta AI ENS-PSL, EHESS, CNRS(ENS-PSL,EHESS,CNRS)

AI总结 本文提出SpidR-Adapt,通过元学习框架实现语音单元在新语言中的快速适应,采用多任务自适应预训练协议和一阶双层优化方法,实现数据高效的语言建模性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17283 2026-04-21 cs.CL cs.AI

HorizonBench: Long-Horizon Personalization with Evolving Preferences

HorizonBench: 长时间跨度个性化与演变偏好

Shuyue Stella Li, Bhargavi Paranjape, Kerem Oktar, Zhongyao Ma, Gelin Zhou, Lin Guan, Na Zhang, Sem Park, Lin Chen, Diyi Yang, Yulia Tsvetkov, Asli Celikyilmaz

机构 * University of Washington(华盛顿大学) Meta OpenAI Stanford University(斯坦福大学)

AI总结 本文提出HorizonBench,通过生成6个月时间线的对话数据,提供长时间跨度个性化研究的测试平台,揭示状态跟踪能力是长周期个性化的主要瓶颈。

Comments 19 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06082 2026-04-21 cs.AI cs.CE

Offline Materials Optimization with CliqueFlowmer

离线材料优化与CliqueFlowmer

Jakub Grudzien Kuba, Benjamin Kurt Miller, Sergey Levine, Pieter Abbeel

机构 * BAIR, UC Berkeley, Berkeley, California, USA(BAIR,加州大学伯克利分校,伯克利,加利福尼亚州,美国) FAIR, Meta, San Francisco, California, USA(FAIR,Meta,旧金山,加利福尼亚州,美国)

AI总结 本文提出基于离线模型优化的材料发现方法,结合CliqueFlowmer模型优化目标材料属性,优于生成方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06056 2026-04-21 cs.CL cs.AI

Data Compressibility Quantifies LLM Memorization

数据压缩性量化大语言模型的记忆性

Yizhan Huang, Zhe Yang, Meifang Chen, Huang Nianchen, Jianping Zhang, Michael R. Lyu

机构 * The Chinese University of Hong Kong(香港中文大学) Nanyang Technological University(南洋理工大学) University of Southern California(南加州大学) Meta

AI总结 本文通过数据压缩性量化大语言模型的记忆性,发现集级别指标能揭示熵与记忆性之间的线性关系。

Comments accepted by TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21686 2026-04-21 cs.CL cs.AI cs.LG

Matrix: Peer-to-Peer Multi-Agent Synthetic Data Generation Framework

矩阵:基于点对点的多智能体合成数据生成框架

Dong Wang, Yang Li, Ansong Ni, Ching-Feng Yeh, Youssef Emad, Xinjie Lei, Liam Robbins, Karthik Padthe, Hu Xu, Xian Li, Asli Celikyilmaz, Ramya Raghavendra, Lifei Huang, Carole-Jean Wu, Shang-Wen Li

机构 * FAIR at Meta(Meta 的 FAIR)

AI总结 本文提出Matrix框架,通过去中心化设计实现多智能体协同生成高质量、多样化的合成数据,提升数据生成效率2-15倍,适用于多智能体对话、网络推理数据提取等场景。

Comments MLSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏