arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-09 至 2025-12-09 共收录 291 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 56 篇

2512.06017 2025-12-09 cs.RO eess.IV 50%

Training-Free Robot Pose Estimation using Off-the-Shelf Foundational Models

无需训练的机器人姿态估计使用现成的基础模型

Laurence Liang

机构 * McGill University(麦吉尔大学)

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文提出利用现成的基础模型无需训练即可估计机器人关节角度,通过实验验证了模型性能基准及测试扩展对预测效果的影响。

Comments Accepted at CVIS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13558 2025-12-09 cs.CV 50%

X-Scene: Large-Scale Driving Scene Generation with High Fidelity and Flexible Controllability

X-Scene: 通过高保真和灵活可控性实现大规模驾驶场景生成

Yu Yang, Alan Liang, Jianbiao Mei, Yukai Ma, Yong Liu, Gim Hee Lee

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学)

专题命中 推理与问题求解 :LLM(abstract)

AI总结 X-Scene通过高保真和灵活可控性实现大规模驾驶场景生成,支持多粒度控制和一致性外推,提升自动驾驶的数据生成与模拟能力。

Comments Accepted by NeurIPS 2025, Project page at https://x-scene.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01371 2025-12-09 cs.CV 50%

CLIP-UP: CLIP-Based Unanswerable Problem Detection for Visual Question Answering

CLIP-UP: 基于CLIP的视觉问答中不可回答问题检测

Ben Vardi, Oron Nir, Ariel Shamir

专题命中 推理与问题求解 :language model(abstract)

AI总结 CLIP-UP通过基于CLIP的相似性度量,为视觉问答模型提供检测不可回答问题的能力,提升模型在不可回答问题上的识别性能。

Comments Revised version. Improvements include support for open-ended VQA and an alternative injection method

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 60 篇

2512.07666 2025-12-09 cs.CL cs.SE 91%

Bridging Code Graphs and Large Language Models for Better Code Understanding

连接代码图与大型语言模型以实现更好的代码理解

Zeqi Chen, Zhaoyang Chu, Yi Gui, Feng Guo, Yao Wan, Chuan Shi

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

AI总结 CGBridge通过引入外部Bridge模块,提升LLMs对代码结构语义的理解,显著提高代码生成和翻译任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06272 2025-12-09 cs.CL cs.CE 90%

Golden Touchstone: A Comprehensive Bilingual Benchmark for Evaluating Financial Large Language Models

黄金触点:一种全面的双语基准,用于评估金融大语言模型

Xiaojun Wu, Junxi Liu, Huanyi Su, Zhouchi Lin, Yiyan Qi, Chengjin Xu, Jiajun Su, Jiajie Zhong, Fuwei Wang, Saizhuo Wang, Fengrui Hua, Jia Li, Jian Guo

机构 * IDEA Research(IDEA研究机构) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(香港科学与技术大学) Nanjing University(南京大学) South China Normal University(华南师范大学) DataArcTech Ltd.(DataArcTech有限公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);instruction tuning(abstract)

AI总结 本研究提出Golden Touchstone双语基准,用于全面评估金融大语言模型的性能,通过对比分析揭示模型在处理复杂金融信息时的优势与局限。

Comments Published in Findings of EMNLP 2025

Journal ref In Findings of the Association for Computational Linguistics: EMNLP 2025, pages 22544-22560, Suzhou, China. Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07261 2025-12-09 cs.SE 90%

Automatic Syntax Error Repair for Discrete Controller Synthesis using Large Language Model

利用大语言模型实现离散控制器综合的自动语法错误修复

Yusei Ishimizu, Takuto Yamauchi, Sinan Chen, Jinyu Cai, Jialong Li, Kenji Tei

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文提出利用大语言模型自动修复离散控制器综合模型中的语法错误,通过设计提示策略提高修复准确性和效率,实验显示其比人类开发者快3.46倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.04671 2025-12-09 cs.CL cs.LG q-bio.PE 90%

PhyloLM : Inferring the Phylogeny of Large Language Models and Predicting their Performances in Benchmarks

PhyloLM : 推断大语言模型的系统发育并预测其在基准测试中的性能

Nicolas Yax, Pierre-Yves Oudeyer, Stefano Palminteri

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

AI总结 PhyloLM通过系统发育算法推断大语言模型的系统发育关系并预测其在基准测试中的性能。

Comments The project code is available at https://github.com/Nicolas-Yax/PhyloLM . Published as https://iclr.cc/virtual/2025/poster/28195 at ICLR 2025. A code demo is available at https://colab.research.google.com/drive/1agNE52eUevgdJ3KL3ytv5Y9JBbfJRYqd

Journal ref ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18274 2025-12-09 cs.HC cs.AI 89%

Clinician-Directed Large Language Model Software Generation for Therapeutic Interventions in Physical Rehabilitation

面向物理康复治疗的临床指导大型语言模型软件生成

Edward Kim, Yuri Cho, Jose Eduardo E. Lima, Julie Muccini, Jenelle Jindal, Alison Scheid, Erik Nelson, Seong Hyun Park, Yuchen Zeng, Alton Sturgis, Caesar Li, Jackie Dai, Sun Min Kim, Yash Prakash, Liwen Sun, Isabella Hu, Hongxuan Wu, Daniel He, Wiktor Rajca, Cathra Halabi, Maarten Lansberg, Bjoern Hartmann, Sanjit A. Seshia

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出利用大型语言模型生成临床指导的康复软件,通过个性化设计提升康复干预效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06248 2025-12-09 cs.SE 89%

CFCEval: Evaluating Security Aspects in Code Generated by Large Language Models

CFCEval: 评估大型语言模型生成代码的安全性方面

Cheng Cheng, Jinqiu Yang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 CFCEval通过引入MLVBench和ELRM指标,有效评估大型语言模型生成代码的质量与安全性,提升代码评估的准确性和全面性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21371 2025-12-09 eess.SY cs.SY 89%

Evaluation of Large Language Models for Numeric Anomaly Detection in Power Systems

大型语言模型在电力系统中数值异常检测中的评估

Yichen Liu, Hongyu Wu, Bo Liu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文评估了GPT-OSS-20B在电力系统中用于数值异常检测的性能,采用多种方法并结合三西格玛准则,探讨LLM在电网应用中的潜力与局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07608 2025-12-09 cs.CL cs.AI 88%

Metric-Fair Prompting: Treating Similar Samples Similarly

度量公平提示:对待相似样本同样

Jing Wang, Jie Shen, Xing Niu, Tong Zhang, Jeremy Weiss

机构 * NLM(国家医学图书馆) Stevens Institute of Technology(史蒂文斯理工学院) AWS AI(亚马逊人工智能) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :prompting(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 度量公平提示通过促进个体公平性,提高LLM在高风险临床多选问题上的准确性。

Journal ref NeurIPS 2025 Workshop on Socially Responsible and Trustworthy Foundation Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07075 2025-12-09 cs.CL 88%

Do Large Language Models Truly Understand Cross-cultural Differences?

大型语言模型真的能理解跨文化差异吗?

Shiwei Guo, Sihang Jiang, Qianxi He, Yanghua Xiao, Jiaqing Liang, Bi Yude, Minggui He, Shimin Tao, Li Zhang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出SAGE基准,通过跨文化核心概念对齐和生成任务设计,评估LLMs的跨文化理解和推理能力,揭示其在跨文化推理中的系统性限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21491 2025-12-09 cs.IR 88%

Geospatial Question Answering on Historical Maps Using Spatio-Temporal Knowledge Graphs and Large Language Models

利用时空知识图谱和大语言模型进行历史地图的地理问题回答

Ziyi Liu, Sidi Wu, Lorenz Hurni

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本研究提出利用时空知识图谱和大语言模型开发GeoQA系统,实现对历史地图中地理问题的高效回答与可视化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18538 2025-12-09 cs.SE cs.CL 87%

From Code Foundation Models to Agents and Applications: A Comprehensive Survey and Practical Guide to Code Intelligence

从代码基础模型到代理与应用:全面综述与代码智能的实用指南

Jian Yang, Xianglong Liu, Weifeng Lv, Ken Deng, Shawn Guo, Lin Jing, Yizhi Li, Shark Liu, Xianzhen Luo, Yuyu Luo, Changzai Pan, Ensheng Shi, Yingshui Tan, Renshuai Tao, Jiajun Wu, Xianjie Wu, Zhenhe Wu, Daoguang Zan, Chenchen Zhang, Wei Zhang, He Zhu, Terry Yue Zhuo, Kerui Cao, Xianfu Cheng, Jun Dong, Shengjie Fang, Zhiwei Fei, Xiangyuan Guan, Qipeng Guo, Zhiguang Han, Joseph James, Tianqi Luo, Renyuan Li, Yuhang Li, Yiming Liang, Congnan Liu, Jiaheng Liu, Qian Liu, Ruitong Liu, Tyler Loakman, Xiangxin Meng, Chuang Peng, Tianhao Peng, Jiajun Shi, Mingjie Tang, Boyang Wang, Haowen Wang, Yunli Wang, Fanglin Xu, Zihan Xu, Fei Yuan, Ge Zhang, Jiayi Zhang, Xinhao Zhang, Wangchunshu Zhou, Hualei Zhu, King Zhu, Bryan Dai, Aishan Liu, Zhoujun Li, Chenghua Lin, Tianyu Liu, Chao Peng, Kai Shen, Libo Qin, Shuangyong Song, Zizheng Zhan, Jiajun Zhang, Jie Zhang, Zhaoxiang Zhang, Bo Zheng

专题命中 评测与基准 :foundation model(title);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文综述了代码基础模型到代理的应用,分析了代码LLM的完整生命周期,并通过实验探讨了其性能优化与实际应用中的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05156 2025-12-09 cs.AI cs.CL cs.IT cs.LG math.IT q-fin.CP 87%

Semantic Faithfulness and Entropy Production Measures to Tame Your LLM Demons and Manage Hallucinations

语义忠实与熵产度量:驯服LLM恶魔并管理幻觉

Igor Halperin

机构 * Fidelity Investments

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出语义忠实与熵产度量,通过信息论和热力学方法评估LLM的忠实度并控制幻觉,应用于公司SEC文件摘要生成。

Comments 23 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06504 2025-12-09 cs.CR 87%

When Code Crosses Borders: A Security-Centric Study of LLM-based Code Translation

当代码跨越国界:一种以安全为中心的LLM代码翻译研究

Hailong Chang, Guozhu Meng, Shuhui Xiao, Kai Chen, Kun Sun, Yilin Li

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文研究了LLM在代码翻译中的安全风险,发现28.6%-45%的翻译引入新漏洞,并提出RAG策略降低漏洞率32.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04346 2025-12-09 cs.CL cs.AI 86%

Multi-Lingual Cyber Threat Detection in Tweets/X Using ML, DL, and LLM: A Comparative Analysis

多语言推特/X中的网络威胁检测:使用机器学习、深度学习和大语言模型的比较分析

Saydul Akbar Murad, Ashim Dahal, Nick Rahimi

机构 * School of Computing Sciences and Computer Engineering(计算科学与计算机工程学院) University of Southern Mississippi(密西西比大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究比较了ML、DL和LLM在多语言推文网络威胁检测中的效果,发现双LSTM架构在多语言场景中表现最佳。

Journal ref IEEE Trans. Comput. Soc. Syst., Early Access, pp. 1-15, Nov. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07501 2025-12-09 cs.SE cs.AI 85%

AutoICE: Automatically Synthesizing Verifiable C Code via LLM-driven Evolution

AutoICE: 通过LLM驱动的进化自动合成可验证的C代码

Weilin Luo, Xueyi Liang, Haotian Deng, Yanan Liu, Hai Wan

机构 * Sun Yat-sen University, School of Computer Science and Engineering(中山大学计算机科学与工程学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 AutoICE通过LLM驱动的进化搜索方法,自动合成可验证的C代码,验证成功率高达90.36%,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06228 2025-12-09 cs.CL 85%

Policy-based Sentence Simplification: Replacing Parallel Corpora with LLM-as-a-Judge

基于政策的句子简化:用LLM作为评判者取代平行语料库

Xuanxin Wu, Yuki Arase, Masaaki Nagata

机构 * The University of Osaka(大阪大学) Institute of Science Tokyo(东京科学研究所) NTT Inc.(日本电报电话公司)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出利用LLM作为评判者自动构建政策一致的训练数据,实现无需人工标注或平行语料库的句子简化系统,实验表明其在词法简化和整体重写任务上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05485 2025-12-09 cs.CR 85%

TeleAI-Safety: A comprehensive LLM jailbreaking benchmark towards attacks, defenses, and evaluations

TeleAI-Safety: 一种全面的LLM jailbreaking基准测试,面向攻击、防御和评估

Xiuyuan Chen, Jian Zhao, Yuxiang He, Yuan Xun, Xinwei Liu, Yanshu Li, Huilin Zhou, Wei Cai, Ziyan Shi, Yuchen Yuan, Tianle Zhang, Chi Zhang, Xuelong Li

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 TeleAI-Safety提出了一种全面的LLM安全评估基准,整合多种攻击、防御和评估方法,用于系统性评估LLM的安全性及优化防御策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05994 2025-12-09 eess.AS cs.AI cs.CL cs.SD 84%

KidSpeak: A General Multi-purpose LLM for Kids' Speech Recognition and Screening

KidSpeak: 一个通用的多用途大语言模型用于儿童语音识别与筛查

Rohan Sharma, Dancheng Liu, Jingchen Sun, Shijie Zhou, Jiayu Qin, Jinjun Xiong, Changyou Chen

机构 * Department of Computer Science and Engineering, State University of New York at Buffalo(计算机科学与工程系,纽约州立大学布法罗分校)

专题命中 评测与基准 :LLM(title,abstract);foundation model(abstract);分类 cs.CL、cs.AI

AI总结 KidSpeak是首个为儿童语音识别与筛查设计的多用途大语言模型,结合语音增强技术与FASA对齐工具,实现87%的准确率,提升儿童语音数据质量13.6倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06999 2025-12-09 cs.SD cs.AI 83%

Singing Timbre Popularity Assessment Based on Multimodal Large Foundation Model

基于多模态大基础模型的歌唱音色受欢迎程度评估

Zihao Wang, Ruibin Yuan, Ziqi Geng, Hengjia Li, Xingwei Qu, Xinyi Li, Songye Chen, Haoying Fu, Roger B. Dannenberg, Kejun Zhang

机构 * Zhejiang University(浙江大学) Carnegie Mellon University(卡内基梅隆大学) Hong Kong University of Science and Technology(香港科学与技术大学) University of California, Berkeley(加州大学伯克利分校) University of Manchester(曼彻斯特大学) Innovation Center of Yangtze River Delta, Zhejiang University(长江三角洲创新中心,浙江大学)

专题命中 评测与基准 :foundation model(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出基于多模态大基础模型的歌唱音色受欢迎程度评估方法,通过引入Sing-MD数据集、VocalVerse架构和H-TPR基准,实现无参考、多维度的歌唱评估。

Comments Accepted to ACMMM 2025 oral

Journal ref Proceedings of the 33rd ACM International Conference on Multimedia (ACMMM 2025), Pages 12227-12236

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06274 2025-12-09 cs.CR cs.AI 83%

Enhancing LLM Watermark Resilience Against Both Scrubbing and Spoofing Attacks

增强LLM对 scrubbing 和 spoofing 攻击的鲁棒性

Huanming Shen, Baizhou Huang, Xiaojun Wan

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学计算机技术研究院) University of Electronic Science and Technology of China(电子科技大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出SEEK水印方案,通过等效纹理密钥机制提升LLM对scrubbing和spoofing攻击的鲁棒性,实验显示其在不同数据集上显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03619 2025-12-09 cs.CR 82%

Blackbox Dataset Inference for LLM

LLM的黑盒数据集推断

Ruikai Zhou, Kang Yang, Xun Chen, Wendy Hui Wang, Guanhong Tao, Jun Xu

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)

AI总结 本文提出了一种仅需黑盒访问目标模型的LLM数据集推断方法,通过对比本地构建的参考模型来判断模型是否使用特定数据集进行训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06751 2025-12-09 cs.CL cs.AI cs.LG 80%

Becoming Experienced Judges: Selective Test-Time Learning for Evaluators

成为经验丰富的法官:用于评估者的选择性测试时间学习

Seungyeon Jwa, Daechul Ahn, Reokyoung Kim, Dongyeop Kang, Jonghyun Choi

机构 * Seoul National University(首尔国立大学) University of Minnesota(明尼苏达大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出选择性测试时间学习框架,使评估者在推理过程中逐步改进,通过自适应元提示提升评估效果,实验证明其在多个基准上的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06096 2025-12-09 cs.CL 79%

A Systematic Assessment of Language Models with Linguistic Minimal Pairs in Chinese

对中文语言模型进行系统评估:基于语言最小配对的基准测试

Yikang Liu, Yeting Shen, Hongao Zhu, Lilong Xu, Zhiheng Qian, Siyuan Song, Kejia Zhang, Jialong Tang, Pei Zhang, Baosong Yang, Rui Wang, Hai Hu

机构 * Shanghai Jiao Tong University(上海交通大学) Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团) The University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Glasgow(格拉斯哥大学) University of California, San Diego(加州大学圣地亚哥分校) City University of Hong Kong(香港城市大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 本文提出ZhoBLiMP中文最小配对基准测试,并通过SLLN-LP度量标准评估不同中文语言模型在处理指代、量词和省略等任务上的性能。

Comments Accepted by TACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07832 2025-12-09 cs.CL cs.LG 79%

Do Generalisation Results Generalise?

泛化结果是否能泛化?

Matteo Boglioni, Andrea Sgobbi, Gabriel Tavernini, Francesco Rita, Marius Mosbach, Tiago Pimentel

机构 * ETH Zürich(苏黎世联邦理工学院) Mila - Quebec Artificial Intelligence Institute(魁北克人工智能研究所) McGill University(麦吉尔大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了大型语言模型在不同分布外测试集上的泛化能力是否具有普遍趋势,通过分析多个模型发现泛化结果的相关性依赖于具体模型的选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04650 2025-12-09 cs.CV 78%

EncQA: Benchmarking Vision-Language Models on Visual Encodings for Charts

EncQA:在图表视觉编码上评估视觉-语言模型的基准测试

Kushin Mukherjee, Donghao Ren, Dominik Moritz, Yannick Assogba

机构 * Stanford University(斯坦福大学) Apple(苹果公司)

专题命中 评测与基准 :language model(title,abstract)

AI总结 EncQA通过系统覆盖图表理解的关键视觉编码和任务,揭示了不同编码和任务间VLMs性能的显著差异,强调了针对性策略的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06750 2025-12-09 cs.CV 78%

UARE: A Unified Vision-Language Model for Image Quality Assessment, Restoration, and Enhancement

UARE:面向图像质量评估、修复和增强的统一视觉-语言模型

Weiqi Li, Xuanyu Zhang, Bin Chen, Jingfen Xie, Yan Wang, Kexin Zhang, Junlin Li, Li Zhang, Jian Zhang, Shijie Zhao

机构 * School of Electronic and Computer Engineering, Peking University, 2 ByteDance Inc(1 电子与计算机工程学院,北京大学,2 字节跳动公司)

专题命中 评测与基准 :language model(title,abstract)

AI总结 UARE是首个统一视觉-语言模型,通过统一训练框架提升图像质量评估、修复和增强性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06432 2025-12-09 cs.MA 78%

HiveMind: Contribution-Guided Online Prompt Optimization of LLM Multi-Agent Systems

HiveMind: 基于贡献的LLM多智能体系统的在线提示优化

Yihan Xia, Taotao Wang, Shengli Zhang, Zhangyuhua Weng, Bin Cao, Soung Chang Liew

专题命中 评测与基准 :LLM(title,abstract)

AI总结 HiveMind通过基于贡献的在线提示优化,提升LLM多智能体协作效率,利用DAG-Shapley算法显著降低LLM调用成本,同时保持归因准确性。

Comments This paper was accepted to AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏