arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-03 至 2026-03-03 共收录 599 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 124 篇

2603.01423 2026-03-03 cs.CL 88%

Quantifying Conversational Reliability of Large Language Models under Multi-Turn Interaction

量化大型语言模型在多轮交互中的对话可靠性

Jiyoon Myung

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL;foundation model(comments)

AI总结 研究评估了大型语言模型在多轮对话中的可靠性,发现其在复杂交互中存在显著下降,揭示了指令漂移、意图混淆等失败模式,强调了对LLM进行压力测试和改进评估方法的重要性。

Comments Accepted at the Workshop on Assessing and Improving Reliability of Foundation Models in the Real World (AAAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01167 2026-03-03 cs.CL 88%

DEP: A Decentralized Large Language Model Evaluation Protocol

DEP:一种去中心化的大型语言模型评估协议

Jianxiang Peng, Junhao Li, Hongxiang Wang, Haocheng Lyu, Hui Guo, Siyi Hao, Zhen Wang, Chuang Liu, Shaowei Zhang, Bojian Xiong, Yue Chen, Zhuowen Han, Ling Shi, Tianyu Dong, Juesi Xiao, Lei Yang, Yuqi Ren, Deyi Xiong

机构 * TJUNLP Lab, Tianjin University, Tianjin, China(天津大学天津实验室) National Supercomputing Center in Tianjin(天津国家超算中心) Yuanhui AI(元慧AI)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 DEP提出一种去中心化的评估协议,通过匹配服务器实现统一、标准化的LLM评估,支持模块化和即插即用的评估方式,减少基准测试泄露风险并提高可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16395 2026-03-03 cs.CL 88%

OJBench: A Competition Level Code Benchmark For Large Language Models

OJBench: 一个面向大语言模型的竞赛级代码基准

Zhexu Wang, Yiping Liu, Yejie Wang, Wenyang He, Bofei Gao, Muxi Diao, Yanxu Chen, Kelin Fu, Flood Sung, Zhilin Yang, Tianyu Liu, Weiran Xu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学) University of Chinese Academy of Sciences(中国科学院大学) Peking University(北京大学) Moonshot AI

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 OJBench是一个用于评估大语言模型竞赛级代码推理能力的基准,通过232个编程竞赛问题揭示了现有模型在复杂推理任务中的局限性。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04490 2026-03-03 cs.CL q-bio.GN 88%

Large Language Models in Bioinformatics: A Survey

大语言模型在生物信息学中的应用:综述

Zhenyu Wang, Zikang Wang, Jiyue Jiang, Pengan Chen, Xiangyu Shi, Yu Li

机构 * The Chinese University of Hong Kong(香港中文大学) Peking University Third Hospital(北京大学第三医院) The Hong Kong Polytechnic University(香港理工大学) The University of Hong Kong(香港大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文综述了大语言模型在生物信息学中的应用,涵盖基因组序列建模、RNA结构预测等核心方法,并探讨了数据稀缺和跨组学整合等挑战及未来发展方向。

Comments Accepted by ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21722 2026-03-03 cs.CL cs.AI cs.CY 88%

German General Social Survey Personas: A Survey-Derived Persona Prompt Collection for Population-Aligned LLM Studies

德国通用社会调查人设:一种基于德国通用社会调查的人员提示集合,用于与人口一致的LLM研究

Jens Rupprecht, Leon Fröhling, Claudia Wagner, Markus Strohmaier

机构 * University of Mannheim(曼海姆大学) GESIS -- Leibniz Institute for the Social Sciences(莱布尼茨社会科学研究所) RWTH Aachen University(亚琛工业大学) Complexity Science Hub(复杂性科学中心)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出德国通用社会调查人设集合,用于构建与人口一致的LLM研究,通过实验证明其在模拟调查响应方面的有效性。

Comments 20 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20487 2026-03-03 cs.CL cs.AI 88%

Steering Evaluation-Aware Language Models to Act Like They Are Deployed

引导评估意识语言模型以使其表现得像已部署

Tim Tian Hua, Andrew Qin, Samuel Marks, Neel Nanda

机构 * MATS

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);pretraining(abstract)

AI总结 本文提出通过引导向量抑制LLM的评估意识,使其在评估时表现得像已部署,从而提高安全评估的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01778 2026-03-03 cs.CL 87%

LLM-as-an-Annotator: Training Lightweight Models with LLM-Annotated Examples for Aspect Sentiment Tuple Prediction

LLM-as-Annotator: 利用LLM标注示例训练轻量模型进行方面情感元组预测

Nils Constantin Hellwig, Jakob Fehle, Udo Kruschwitz, Christian Wolff

机构 * Media Informatics Group, University of Regensburg, Regensburg, Germany(莱茵河畔大学媒体信息学组) Information Science Group, University of Regensburg, Regensburg, Germany(莱茵河畔大学信息科学组)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出LA-ABSA方法,利用LLM生成的标注示例训练轻量模型,以高效完成复杂的情感分析任务。

Comments Accepted for publication at LREC 2026. Final version will appear in the ACL Anthology

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01257 2026-03-03 cs.CR cs.SE 87%

A Systematic Study of LLM-Based Architectures for Automated Patching

对基于大语言模型的自动补丁架构的系统研究

Qingxiao Xu, Ze Sheng, Zhicheng Chen, Jeff Huang

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文系统研究了基于LLM的自动补丁架构,通过统一基准评估四种范式,揭示了不同架构在效率、灵活性和泛化能力上的权衡,发现通用代码代理在性能上表现最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01260 2026-03-03 cs.LG cs.AI 86%

MOSAIC: A Unified Platform for Cross-Paradigm Comparison and Evaluation of Homogeneous and Heterogeneous Multi-Agent RL, LLM, VLM, and Human Decision-Makers

MOSAIC:一个用于跨范式比较和评估同质和异质多智能体RL、LLM、VLM和人类决策者的统一平台

Abdulhamid M. Mousa, Yu Fu, Rakhmonberdi Khajiev, Jalaledin M. Azzabi, Abdulkarim M. Mousa, Peng Yang, Yunusa Haruna, Ming Liu

机构 * School of Optics and Photonics, Beijing Institute of Technology, Beijing 100081, China(北京理工大学光学工程学院) School of Automation Science and Electrical Engineering, Beihang University, Beijing 100191, China(北京航空航天大学自动化科学与电气工程学院) Faculty of Science, Ain Shams University, Cairo, Egypt(爱思唯命大学科学学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 MOSAIC是一个开源平台,通过统一接口和跨范式评估框架,支持在相同环境中比较不同决策范式的智能体,促进可重复的跨领域研究。

Comments 13 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00428 2026-03-03 cs.CL cs.AI cs.CR 86%

When Agents "Misremember" Collectively: Exploring the Mandela Effect in LLM-based Multi-Agent Systems

当智能体“误忆”时:探索基于大语言模型的多智能体系统中的曼德拉效应

Naen Xu, Hengyu An, Shuo Shi, Jinghuai Zhang, Chunyi Zhou, Changjiang Li, Tianyu Du, Zhihui Fu, Jun Wang, Shouling Ji

机构 * Zhejiang University(浙江大学) University of California, Los Angeles(加州大学洛杉矶分校) Palo Alto Networks(帕洛阿尔托网络公司) OPPO Research Institute(OPPO研究院) Zhejiang Key Laboratory of Decision Intelligence(浙江决策智能重点实验室)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了基于大语言模型的多智能体系统中的曼德拉效应,提出MANBENCH基准并提出缓解策略,实现74.40%的效应减少。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01701 2026-03-03 cs.DB cs.AI 85%

Beyond Single-Modal Analytics: A Framework for Integrating Heterogeneous LLM-Based Query Systems for Multi-Modal Data

超越单一模态分析:一种整合异构LLM查询系统的框架用于多模态数据

Ruyu Li, Tinghui Zhang, Haodi Ma, Daisy Zhe Wang, Yifan Wang

机构 * University of Hawaii at Manoa(夏威夷大学曼纳oa分校) University of Florida(佛罗里达大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Meta Engine,一种整合异构LLM查询系统的框架,通过统一的语义查询引擎提升多模态数据处理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00993 2026-03-03 cs.AI 85%

CollabEval: Enhancing LLM-as-a-Judge via Multi-Agent Collaboration

CollabEval: 通过多智能体协作增强LLM作为裁判

Yiyue Qian, Shinan Zhang, Yun Zhou, Haibo Ding, Diego Socolinsky, Yi Zhang

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 CollabEval通过多智能体协作提升LLM作为裁判的评估性能,克服单一模型的不一致性和偏见问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19208 2026-03-03 cs.CL 85%

DiSRouter: Distributed Self-Routing for LLM Selections

DiSRouter: 分布式自路由用于大语言模型选择

Hang Zheng, Hongshen Xu, Yongkai Lin, Shuai Fan, Lu Chen, Kai Yu

机构 * X-LANCE Lab, School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(上海交通大学计算机科学系X-LANCE实验室) Shanghai Innovation Institution, Shanghai, China(上海创新机构) Jiangsu Key Lab of Language Computing, Suzhou, China(江苏省语言计算重点实验室) AISpeech Co., Ltd., Suzhou, China(AISpeech公司) Suzhou Laboratory, Suzhou, China(苏州实验室)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 DiSRouter通过分布式自路由机制,利用LLM的自我认知能力,实现更灵活、可扩展的多代理系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12462 2026-03-03 cs.AI cs.CR 85%

Evaluating and Mitigating LLM-as-a-judge Bias in Communication Systems

评估和减轻通信系统中LLM-as-a-judge的偏见

Jiaxin Gao, Chen Chen, Yanwen Jia, Xueluan Gong, Kwok-Yan Lam, Qian Wang

机构 * School of Computer Science and Engineering at Nanyang Technological University(南洋理工大学计算机科学与工程学院) School of Cyber Science and Engineering, Wuhan University(武汉大学网络科学与工程学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了LLM-as-a-judge在通信系统中的偏见问题,分析了不同模型对偏见输入的鲁棒性,并提出四种缓解策略以提高判断的公平性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04265 2026-03-03 cs.CR cs.AI 85%

Weaponizing Language Models for Cybersecurity Offensive Operations: Automating Vulnerability Assessment Report Validation; A Review Paper

利用语言模型进行网络安全进攻性操作:自动化漏洞评估报告验证;综述论文

Abdulrahman S Almuhaidib, Azlan Mohd Zain, Zalmiyah Zakaria, Izyan Izzati Kamsani, Abdulaziz S Almuhaidib

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.AI

AI总结 本文综述了利用大型语言模型自动化漏洞评估报告验证的方法,旨在提高验证准确性并减少人工工作量。

Comments Pre-print - Accepted for publication in the Proceedings of the International Computer Sciences and Informatics Conference (ICSIC-2024), published by AIP Publishing

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00489 2026-03-03 cs.SE 85%

Does My README File Need To Be Updated? Exploring LLM-Based README Maintenance

我的 README 文件需要更新吗?探索基于 LLM 的 README 维护

Haoyu Gao, Hong Yi Lin, Christoph Treude, Gregory Gay, Mansooreh Zahedi

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出了一种基于 LLM 的轻量级方法,用于在人机协作流程中精准更新 README 文件,以解决文档过时问题,并通过实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00465 2026-03-03 cs.AI cs.CL 84%

Optimizing In-Context Demonstrations for LLM-based Automated Grading

优化基于大语言模型的自动评分的上下文演示

Yucheng Chu, Hang Li, Kaiqi Yang, Yasemin Copur-Gencturk, Kevin Haudek, Joseph Krajcik, Jiliang Tang

机构 * Michigan State University(密歇根州立大学) University of Southern California(南加州大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 GUIDE通过迭代设计示例优化自动评分,提升评分标准的符合性和边界处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06499 2026-03-03 cs.CV 83%

SportR: A Benchmark for Multimodal Large Language Model Reasoning in Sports

SportR:多模态大语言模型在体育中的推理基准

Haotian Xia, Haonan Ge, Junbo Zou, Hyun Woo Choi, Xuebin Zhang, Danny Suradja, Botao Rui, Ethan Tran, Wendy Jin, Zhen Ye, Xiyang Lin, Christopher Lai, Shengjie Zhang, Junwen Miao, Shichao Chen, Rhys Tracy, Vicente Ordonez, Weining Shen, Hanjie Chen

机构 * Department of Computer Science, Rice University(Rice大学计算机科学系) Ken Kennedy Institute, Rice University(Rice大学肯尼迪研究所) Department of Statistics, University of California, Irvine(伊利诺伊大学欧文分校统计系) College of Sciences, Georgia Institute of Technology(佐治亚理工学院科学学院) Department of Applied Mathematics and Statistics, Johns Hopkins University(约翰霍普金斯大学应用数学与统计学系) Department of Computer Science, University of California, Santa Barbara(加州大学圣芭芭拉分校计算机科学系)

专题命中 评测与基准 :large language model(title);language model(title)

AI总结 SportR是一个多体育大规模基准,旨在训练和评估多模态大语言模型在体育推理中的能力,通过精细的视觉感知和规则推理任务提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22957 2026-03-03 cs.LG 83%

Doubly-Robust LLM-as-a-Judge: Externally Valid Estimation with Imperfect Personas

双重鲁棒的LLM-as-a-Judge:具有不完美人设的外部有效性估计

Luke Guerdan, Justin Whitehouse, Kimberly Truong, Kenneth Holstein, Zhiwei Steven Wu

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(title,abstract);prompting(abstract);分类 cs.LG

AI总结 本研究提出双重鲁棒的LLM-as-a-Judge框架,通过结合不完美的'人设'评分与受抽样偏差影响的人类评分,实现对外部有效性评估的可靠估计。

Comments ICLR 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00164 2026-03-03 cs.CR cs.AI 83%

Reverse CAPTCHA: Evaluating LLM Susceptibility to Invisible Unicode Instruction Injection

反CAPTCHA:评估LLM对不可见Unicode指令注入的易感性

Marcus Graves

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 反CAPTCHA通过测试LLM对不可见Unicode指令的响应,揭示了模型在处理隐藏编码时的易感性及攻击面。

Comments 5 pages, 2 figures, 3 tables. Code and data: https://github.com/canonicalmg/reverse-captcha-eval

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17237 2026-03-03 cs.CV 82%

Grounding-IQA: Grounding Multimodal Language Model for Image Quality Assessment

Grounding-IQA: 多模态语言模型的接地图像质量评估

Zheng Chen, Xun Zhang, Wenbo Li, Renjing Pei, Fenglong Song, Xiongkuo Min, Xiaohong Liu, Xin Yuan, Yong Guo, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Joy Future Academy(京东探索研究院) Huawei Noah’s Ark Lab(华为诺亚实验室) Westlake University(西湖大学) Huawei(华为)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract)

AI总结 本文提出grounding-IQA任务范式,通过结合多模态指称与图像质量评估,实现更细粒度的图像质量感知。

Comments Accepted to ICLR 2026. Code is available at: https://github.com/zhengchen1999/Grounding-IQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00897 2026-03-03 cs.SE 82%

Detect Repair Verify for Securing LLM Generated Code: A Multi-Language Empirical Study

检测修复验证以确保LLM生成的代码安全:一个多语言实证研究

Cheng Cheng

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)

AI总结 本文通过多语言实证研究,提出了一种用于确保LLM生成代码安全的检测-修复-验证流程,并构建了新的基准数据集以评估不同修复方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00822 2026-03-03 cs.SE cs.AI 81%

ContextCov: Deriving and Enforcing Executable Constraints from Agent Instruction Files

ContextCov: 从代理指令文件中推导并强制执行可执行约束

Reshabh K Sharma

机构 * University of Washington(华盛顿大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);language agent(abstract)

AI总结 ContextCov通过从代理指令文件中推导并强制执行可执行约束,解决代理在执行复杂软件任务时因上下文漂移导致的技术债务问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24282 2026-03-03 cs.CL cs.AI 81%

SimuHome: A Temporal- and Environment-Aware Benchmark for Smart Home LLM Agents

SimuHome: 一个时间与环境感知的智能家庭LLM代理基准

Gyuhyeon Seo, Jungwoo Yang, Junseong Pyo, Nalim Kim, Jonggeun Lee, Yohan Jo

机构 * Graduate School of Data Science, Seoul National University(首尔国立大学数据科学研究生院) Department of Information Systems, Hanyang University(翰阳大学信息系统系)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 SimuHome是一个基于Matter协议的智能家庭LLM代理基准,用于评估智能家庭代理在时间与环境感知方面的能力,特别是工作流调度的挑战。

Comments Accepted at ICLR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00530 2026-03-03 cs.AI cs.CL 81%

CityLens: Evaluating Large Vision-Language Models for Urban Socioeconomic Sensing

CityLens:评估大型视觉-语言模型用于城市社会经济感知

Tianhui Liu, Hetian Pang, Xin Zhang, Tianjian Ouyang, Zhiyuan Zhang, Jie Feng, Yong Li, Pan Hui

机构 * Information Hub, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)信息中心) Department of Electronic Engineering, BNRist, Tsinghua University(清华大学电子工程系) School of Electronic and Information Engineering, Beijing Jiaotong University(北京交通大学电子与信息工程学院)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 CityLens通过评估大型视觉-语言模型在城市社会经济指标预测中的表现,揭示了其在可持续城市发展中的潜力与局限性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00173 2026-03-03 cs.CV cs.AI cs.LG 81%

Summer-22B: A Systematic Approach to Dataset Engineering and Training at Scale for Video Foundation Model

Summer-22B:视频基础模型大规模数据集工程与训练的系统方法

Simo Ryu, Chunghwan Han

机构 * fal

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 Summer-22B通过系统化数据集工程与训练方法,实现了视频基础模型的规模化训练,重点在于数据集构建、参数优化及架构设计。

Comments 28 pages, 16 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00039 2026-03-03 cs.LG cs.AI stat.ML 81%

CARE: Confounder-Aware Aggregation for Reliable LLM Evaluation

CARE:面向可靠大语言模型评估的混杂因素意识聚合

Jitian Zhao, Changho Shin, Tzu-Heng Huang, Satya Sai Srinath Namburi GNVV, Frederic Sala

机构 * University of Wisconsin--Madison(威斯康星大学麦迪逊分校)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 CARE通过建模大语言模型判断者的评分来源,有效减少聚合误差,提升评估可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02879 2026-03-03 cs.CL cs.AI cs.CY cs.LG 80%

Wikipedia in the Era of LLMs: Evolution and Risks

维基百科在大语言模型时代的演变与风险

Siming Huang, Yuliang Xu, Mingmeng Geng, Yao Wan, Dongping Chen

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了大语言模型对维基百科的影响,分析了其在文章内容、页面浏览和NLP任务中的作用,指出潜在风险并提出监控框架。

Comments Accepted by TMLR: https://openreview.net/forum?id=ahVmnYkVLt

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05254 2026-03-03 cs.CL cs.AI cs.CY cs.GT cs.LG 80%

GLEE: A Unified Framework and Benchmark for Language-based Economic Environments

GLEE:语言经济环境的统一框架和基准

Eilam Shapira, Omer Madmon, Itamar Reinman, Samuel Joseph Amouyal, Roi Reichart, Moshe Tennenholtz

机构 * Technion - Israel Institute of Technology(技术学院-以色列理工学院) Tel Aviv University(特拉维夫大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 GLEE提出统一框架和基准,用于研究语言驱动的经济环境中的代理行为,评估效率与公平性,并揭示经济参数对结果的复杂影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26601 2026-03-03 cs.CL cs.AI cs.LG 80%

MENLO: From Preferences to Proficiency -- Evaluating and Modeling Native-like Quality Across 47 Languages

MENLO:从偏好到熟练度——在47种语言上评估和建模原生质量

Chenxi Whitehouse, Sebastian Ruder, Tony Lin, Oksana Kurylo, Haruka Takagi, Janice Lam, Nicolò Busetto, Denise Diaz, Francisco Guzmán

机构 * Meta Superintelligence Labs(Meta超智能实验室) Handshake AI

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MENLO通过偏好评估和建模提升多语言LLM的原生质量,结合强化学习和多任务学习方法改进模型表现。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏