arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11618 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2798 篇

2607.27268 2026-07-31 cs.SD 新提交 82%

Does EEG Foundation Models Transfer to Speech? A Benchmark on Overt and Imagined Speech Decoding

脑电基础模型能否迁移至语音?显性与想象语音解码的基准测试

Owais Mujtaba Khanday, Mohamed Baha Ben Ticha, Sanae Belfrouh, Marc Ouellet, Jose A. Gonzalez-Lopez

机构 * University of Granada, Spain(格拉纳达大学) Research Centre for Information and Communication Technologies (CITIC-UGR), Spain(信息与通信技术研究中心) University of Chouaib Doukkali, Morocco(舒艾卜·杜卡利大学) Brain, Mind, and Behavior Research Center (CIMCYC), University of Granada, Spain(大脑、心智与行为研究中心)

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract)

AI总结 本文开展首个脑电基础模型语音解码基准测试,对比LaBraM等模型与EEGNet等基线,发现通用脑电预训练未在语音任务上展现一致优势,为语音专用基础模型研究提供依据。

Comments 6 pages, 1 figure, 3 tables, submitted to IberSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26244 2026-07-30 cs.SE 新提交 82%

Do Code Language Models Use Tests? A Behavioral and Representational Study of Test-Driven Code Generation

代码语言模型是否利用测试?测试驱动代码生成的行为与表征研究

Yunhao Liang, Chengguang Gan, Ruixuan Ying, Hanjun Wei, Zhe Cui, Shiwen Ni

专题命中 评测与基准 :language model(title,abstract);large language model(abstract)

AI总结 该研究以Qwen2.5-Coder-7B和Qwen3.6-27B为对象,针对多个代码生成任务探究代码语言模型对测试的利用情况,发现测试通过语义引导和上下文扰动影响模型,仅表征变化不代表有效利用测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22885 2026-07-28 cs.CR 新提交 82%

ReCon: A Resource-Constrained Benchmark for LLM-Based Cybersecurity Compliance Across Ingestion and Retrieval Pipelines

ReCon:用于跨摄取和检索管道的基于大语言模型的网络安全合规性的资源受限基准测试

Rohit Negi, Rishik Jain, Soumyo V Chakarborty, Amit Negi, Sandeep K Shukla

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)

AI总结 研究政府、企业和机构网络安全合规问题,利用无需GPU和高内存的大语言模型进行合规检查任务基准测试,实验证明低资源大语言模型在政策文件合规检查中可提供良好一致性/准确性。

Comments 22 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22165 2026-07-27 cs.DB cs.AI cs.CL cs.LG 新提交 82%

DBA-Bench: A Production-Fidelity Benchmark for LLM-Based Database Operations Agents

DBA-Bench:基于大语言模型的数据库操作代理的生产保真度基准测试

Junming Chen, Junyang Jiang, Xu Chen, Zibo Liang, Kai Zheng

机构 * University of Electronic Science and Technology of China(电子科技大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究基于大语言模型的数据库操作代理评估问题,提出DBA-Bench基准测试,通过生产保真度等解决评估与生产操作差距,含多场景和难度标签,评估多基线组,揭示安全端到端修复困难。

Comments 14 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21912 2026-07-27 cs.MA 新提交 82%

Reliability-Contagion Feasibility in LLM Multi-Agent Networks

大语言模型多智能体网络中的可靠性传播可行性

Ruiwu Niu, Xincheng Shu, Ying Zhao

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)

AI总结 研究大语言模型多智能体网络中错误主张传播问题,制定校正感知网络模型并结合多数投票基准,推导早期入侵条件等,通过模拟和实验得出相关结果,为在可靠性和传播约束下选择连通性提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19795 2026-07-23 cs.SE 新提交 82%

Towards Automated Formal Verification of zkEVMs Using LLM-Guided Constraint Synthesis

使用大语言模型引导的约束合成实现zkEVM的自动化形式验证

Shichen Huang, Zhenghe Jiang, Yi Jiang, Ling-I Wu, Jingyang Li, Guoqiang Li

专题命中 评测与基准 :LLM(title,abstract);prompting(abstract)

AI总结 研究针对zkEVM因实现错误可能破坏加密保证的问题,提出VeriSynth框架,通过大语言模型引导从Rust代码合成验证模型,采用混合范式及集成多种技术处理状态转换,在验证基准上错误检测率超90%,远超基线。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18819 2026-07-22 cs.CV 新提交 82%

In-Context Learning for Wound Classification with Small Multimodal Language Models

使用小型多模态语言模型进行伤口分类的上下文学习

George Martvel, Oskar Gustafsson, John Pavia, Ernst Ahlberg

机构 * Jönköping University(延雪平大学) Halmstad University(哈尔姆斯塔德大学) Mölnlycke Health Care(墨尼克医疗保健公司) Centre for Reliable Machine Learning, Royal Holloway, University of London(伦敦大学皇家霍洛威学院可靠机器学习中心)

专题命中 评测与基准 :language model(title,abstract);prompting(abstract)

AI总结 研究评估小型多模态语言模型能否通过基于检索的上下文学习为伤口分类提供免训练替代方案,使用两个数据集和多种方法实验,结果显示查询条件下的上下文学习效果较好,Qwen 3.5 27B搭配kNN+MMR表现最佳,该方法可实现适应性伤口图像分类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18084 2026-07-21 cs.AI cs.CL cs.LG 新提交 82%

WorldCupArena: Fine-Grained Evaluation of Language Models and Deep-Research Agents on Football Forecasting

世界杯竞技场:语言模型和深度研究代理在足球预测上的细粒度评估

Zhaokai Wang, Tianlin Gui, Jiayuan Rao, Shangzhe Di, Yihong Tang, Dingli Liang

机构 * Shanghai Jiao Tong University(上海交通大学) McGill University(麦吉尔大学) University College London(伦敦大学学院)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 介绍世界杯竞技场这一语言模型和深度研究代理的动态基准,用于足球预测。模型赛前接收证据或自行搜索信息进行多项预测,赛后与实际结果对比。通过多指标评估104场比赛和13个系统,展示不同模型表现及与基线对比情况,且新赛程可添加用于评估未来模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06873 2026-07-09 cs.SE 新提交 82%

Mining Workflow Graphs for Black-Box Boundary Testing of Conversational LLM Agents

挖掘工作流图用于对话式大语言模型代理的黑盒边界测试

Liting Lin, Boxi Yu, Yuzhong Zhang, Lionel Briand, David-Paul Niland, Emir Muñoz

专题命中 评测与基准 :LLM(title,abstract);prompting(abstract)

AI总结 研究针对对话式大语言模型代理内部工作流失败难测问题,提出黑盒测试框架AgentEval,通过挖掘对话工作流图,利用其结构枚举测试目标,执行测试,在与白盒审计器对比测试中,能有效覆盖多个不同边界,降低重复率和误报率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06015 2026-07-08 cs.SD 新提交 82%

Music I Care About: Automated Multimodal Benchmarking of LLM Music Perception Skills on (Almost) Any Music

我关心的音乐:对(几乎)任何音乐的大语言模型音乐感知技能进行自动化多模态基准测试

Tomáš Sourada, Katia Vendrame, Jan Hajič

机构 * Charles University(查尔斯大学) Brno University of Technology(布拉格技术大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)

AI总结 针对当前音乐基准测试的局限,引入MusICA-MetaBench框架,利用结构化符号表示和预定义模板生成按需基准测试,通过ChoraleBricks数据集展示并确定规模,经与基线比较证明能测音乐感知,推动了大语言模型音乐感知跨模态评估。

Comments 9 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02684 2026-07-07 cs.SE 新提交 82%

Can Coding Agents Implement Missed Compiler Optimizations? Evaluating LLM Agents on LLVM Peephole Optimizations

编码代理能否实现错过的编译器优化?在LLVM窥孔优化上评估大语言模型代理

Hongxu Xu, Chunhao Liao, Xintong Zhou, Chengnian Sun

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)

AI总结 研究编码代理能否开发编译器优化,引入PeepholeBench框架,其任务来自LLVM的实际窥孔优化问题,通过对比衡量编码代理与人工修复,发现正确性和收益性间存在矛盾及主要失败模式,为编码代理提供了现实且具挑战性的基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23380 2026-06-24 cs.CY 新提交 82%

Affective AI Safety: The Missing Piece in LLM Safety

情感AI安全:LLM安全中缺失的一环

Carolin Ifländer, Alba Curry, Flor Miriam Plaza-del-Arco, Amanda Cercas Curry

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 本文提出情感安全作为AI安全的新类别,分类情感伤害类型,并指出现有框架未能充分应对,呼吁建立专门框架处理累积性、关系性和身份层面的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23629 2026-06-23 cs.HC 新提交 82%

Why Machines Misread Pedagogical Quality: Human-Machine Alignment in LLM-Based Pretest Question Evaluation

为什么机器误读教学质量:基于LLM的前测问题评估中的人机对齐

Pei-Yu Tseng, Mahir Akgun, Peng Liu

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 针对大规模前测问题设计挑战,提出AI辅助工作流,通过2x2实验发现人机分歧具有系统性,且评分标准修订比对齐效果更大,两者互补。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21852 2026-06-23 cs.DC 新提交 82%

Rethinking Burst Buffer Optimization: Enabling Layout Heterogeneity via Hybrid Analysis and LLM Guidance

重新思考突发缓冲区优化:通过混合分析和LLM指导实现布局异构性

Yuhan Cai, Huijun Wu, Zhuo Tang, Kehua Guo, Wenzhe Zhang, Zhenwei Wu, Zhouyang Jia, Ruibo Wang, Yong Dong

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 提出Proteus系统,通过结合静态代码结构和轻量级运行时信号重建I/O意图,在无需训练或详尽分析的情况下优化突发缓冲区的数据布局,实现高达3.24倍和2.9倍的写密集和元数据密集工作负载加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17710 2026-06-23 cs.CV cs.AI cs.CL cs.LG 新提交 82%

Vision-language models for chest radiography do not always need the image

胸部X光片的视觉-语言模型并不总是需要图像

Mahshad Lotfinia, Sebastian Ziegelmayer, Lisa Adams, Daniel Truhn, Andreas Maier, Soroosh Tayebi Arasteh

机构 * Pattern Recognition Lab, Friedrich-Alexander-Universität Erlangen-Nürnberg(弗里德里希-亚历山大-埃尔朗根-纽伦堡大学模式识别实验室) Department of Diagnostic and Interventional Radiology, TUM University Clinic, School of Medicine and Health, Klinikum rechts der Isar, Technical University of Munich(慕尼黑工业大学医学院与健康学院伊萨尔河右岸医院诊断与介入放射学系) Lab for AI in Medicine, RWTH Aachen University(亚琛工业大学医学人工智能实验室) Department of Diagnostic and Interventional Radiology, University Hospital RWTH Aachen(亚琛工业大学医院诊断与介入放射学系)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过因果审计方法,发现许多医学视觉-语言模型在胸部X光片任务中依赖文本先验而非图像,纯文本模型与多模态模型性能接近,并提出了基于图像依赖性的评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16658 2026-06-16 cs.CV 新提交 82%

Vision-Language Models as Zero-Annotation Oracles in Histopathology

视觉-语言模型作为组织病理学中的零标注预言机

Vishal Jain, Giorgio Buzzanca, Sarah Cechnicka, Maarten Naesens, Priyanka Koshy, Tri Nguyen, Jesper Kers, Candice Roufosse, Bernhard Kainz

机构 * Imperial College London(帝国理工学院) Leiden University Medical Center(莱顿大学医学中心) KU Leuven(鲁汶大学) University Hospitals Leuven(鲁汶大学医院) University Medical Center Utrecht(乌得勒支大学医学中心) Friedrich-Alexander University Erlangen-Nürnberg(埃尔朗根-纽伦堡大学)

专题命中 评测与基准 :language model(title,abstract);prompting(abstract)

AI总结 提出一种粗到细方法,利用通用视觉-语言模型作为零标注预言机进行前景分割,在特殊染色上优于监督基线,并通过伪标签蒸馏轻量学生模型。

Comments 11 pages, 1 figure, 6 tables. Code available at https://github.com/VishalJ99/vlm-wsi-auto-context

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16162 2026-06-16 cs.SE 新提交 82%

Binary Decompilation LLM with Feedback-Driven Multi-Turn Refinement

基于反馈驱动多轮精化的二进制反编译大语言模型

Peipei Liu, Jian Sun, Mingzhe Xing, Yicheng Zeng, Zhaoteng Yan, Lixiao Zhang, Li Chen, Dan Li

专题命中 评测与基准 :LLM(title,abstract)

AI总结 提出AutoDecompiler,利用强化学习进行反馈驱动的多轮二进制反编译,通过编译、执行和I/O测试反馈迭代改进代码,显著提升行为可重执行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15608 2026-06-16 cs.CV 新提交 82%

On the Adversarial Robustness of Multimodal LLM Judges

多模态大语言模型评判器的对抗鲁棒性

Zihan Wang, Guansong Pang, Zelin Liu, Wenjun Miao, Jin Zheng, Xiao Bai

机构 * School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) State Key Laboratory of Virtual Reality Technology and System, Beihang University(北京航空航天大学虚拟现实技术与系统国家重点实验室) State Key Laboratory of Software Development Environment, Jiangxi Research Institute, Beihang University(北京航空航天大学江西研究院软件开发环境国家重点实验室) School of Computing and Information Systems, Singapore Management University(新加坡管理大学计算机与信息系统学院)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)

AI总结 提出RobustMLLMJudge框架评估多模态大语言模型作为评判器时的对抗鲁棒性,并设计MGSIA攻击方法,通过语义诱导和高分流形对齐生成可迁移的分数膨胀扰动,揭示其脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24509 2026-06-24 cs.LG cs.AI cs.SI 新提交 82%

A Fair Evaluation of Graph Foundation Models for Node Property Prediction

图基础模型在节点属性预测中的公平评估

Oleg Platonov, Gleb Bazhenov, Dmitry Eremeev, Liudmila Prokhorenkova

机构 * HSE University(俄罗斯高等经济学院) Yandex Research(Yandex研究院)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文对9种图基础模型进行公平评估,发现仅基于先验数据拟合网络的最新模型在预测性能上优于调优的图神经网络,但推理成本更高。

Comments Accepted at The Workshop on Graph Foundation Models at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22657 2026-06-23 cs.LG cs.AI 新提交 82%

Foundation Models for Epileptogenic Zone Identification in Drug-Resistant Epilepsy

药物难治性癫痫中致痫区识别的基础模型

Thi Kieu Khanh Ho, Thomas Lai, Petr Klimes, Jan Cimbalnik, Martin Pail, Milan Brazdil, Birgit Frauscher, Narges Armanfard

机构 * McGill University(麦吉尔大学) Mila-Quebec AI Institute(米拉-魁北克人工智能研究所) Montreal Neurological Institute and Hospital, McGill University(蒙特利尔神经学研究所与医院,麦吉尔大学) Institute of Scientific Instruments, The Czech Academy of Sciences(捷克科学院科学仪器研究所) Brno Epilepsy Center, Department of Neurology, St Anne’s University Hospital(布尔诺癫痫中心,圣安妮大学医院神经内科) Faculty of Medicine, Masaryk University(马萨里克大学医学院) Duke University Medical Center(杜克大学医学中心) Duke Pratt School of Engineering(杜克普拉特工程学院)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出EpiiSLM双基础模型系统,通过信号基础模型和语言基础模型整合sEEG与临床信息,在接触级PPV上超越传统方法15.1%,仅需一夜发作间期睡眠数据。

Comments Keywords: drug-resistant epilepsy, epileptogenic zone, stereo-electroencephalography, signal foundation models, language foundation models

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19207 2026-08-21 cs.CL 新提交 81%

Compliance, Capability, and Conflict: Benchmarking Multimodal LLMs under System Messages

合规性、能力与冲突:基于系统消息的多模态大语言模型基准测试

Juan Yeo, Geewook Kim

机构 * NAVER Cloud(NAVER云) KAIST AI(韩国科学技术院人工智能)

专题命中 评测与基准 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.CL

AI总结 该研究构建基准VSysBench测试多模态大语言模型在系统消息下的合规性,发现施加系统消息会降低任务准确率,开放权重模型易受用户冲突影响,视觉约束最难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18911 2026-08-20 cs.LG cs.CE 新提交 81%

Converting Expert Deliberation into Financial Signals Through A Context-Aware NLP Pipeline

通过上下文感知的NLP流水线将专家审议转化为金融信号

Vivek Batra, Kristin Chen, Sanjiv Das, Samuel Judge, Harshad Khadilkar, Sukrit Mittal, Amir Nasrollahzadeh, Daniel Ostrov, Jacob Sisk

机构 * Franklin Templeton Investments(富兰克林邓普顿投资公司) Blend360(Blend360公司) Santa Clara University(圣克拉拉大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 该研究提出CDSP流水线将投资委员会会议记录转化为金融特征,经实验其结合句子嵌入与CDSP特征的模型预测准确率达73%,证实专家审议含前瞻性金融信息。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18888 2026-08-20 cs.CL 新提交 81%

Assessing Quality of Experience in Natural Language Generation of German Text

评估德语文本自然语言生成中的体验质量

Dinh Nam Pham, Shushen Manakhimova, Vivien Macketanz, Sebastian Möller

机构 * Technische Universität Berlin(柏林工业大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究针对德语NLG,构建了含人工评分的TextQ-German数据集,开发出混合等自动QoE预测模型,为NLG评估提供了公开资源与基线,助力贴合人类感知的NLG系统开发。

Comments Dataset available at https://github.com/DFKI-NLP/TextQ/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18836 2026-08-20 cs.AI 新提交 81%

Verifiable abstention makes AI leak diagnosis accountable in water distribution networks

可验证弃权使AI在供水管网泄漏诊断中具备可问责性

Tianwei Mu, Yue Wang, Mingzhe Yuan, Manhong Huang, Wenhong Wang, Xuerui Yin, Qing Luo, Min Xiao, Hui Yang, Jun Li, Dan Xue

机构 * School of Municipal Engineering and Environment, Shenyang Jianzhu University(沈阳建筑大学市政工程与环境学院) Guangzhou Institute of Industrial Intelligence(广州工业智能研究院) College of Environment, Shenyang University(沈阳大学环境学院) Shenyang Institute of Automation, Chinese Academy of Sciences(中国科学院沈阳自动化研究所) College of Environmental Science and Engineering, State Environmental Protection Engineering Center for Pollution Treatment and Control in Textile Industry, Donghua University(东华大学环境科学与工程学院(国家环境保护纺织污染防治工程技术中心)) School of Information Science and Engineering, Shenyang University of Technology(沈阳工业大学信息科学与工程学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 该研究针对供水管网泄漏诊断中AI缺乏问责性的问题,提出结合执行器智能体、监督智能体与LLM审计员的可验证弃权决策方法,提升了决策精度与挖掘正确性,为自主水基础设施运营提供可行路径。

Comments 42 pages, 5 main figures, 1 main table, 2 extended data figures, 3 supplementary figures, 15 supplementary tables. Code and data availability described in the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18660 2026-08-20 cs.LG 新提交 81%

Computational Measurement of Team-Process Phase Dynamics in Collaborative Virtual Reality

协作虚拟现实中团队过程阶段动态的计算测量

Qing Huang, Jianing Zhang, Pooja Pol

机构 * School of Business, Technical University of Applied Sciences Augsburg(奥格斯堡应用技术大学商学院) Data Science und Autonome Systeme Technologietransferzentrum (TTZ)(数据科学与自主系统技术转移中心)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 该研究提出计算框架,从协作VR游戏带时间戳对话检测团队过程阶段,经评估其可识别连贯阶段结构,为分析协作活动提供透明可迁移方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18104 2026-08-20 cs.AI 新提交 81%

Self-Evolving Agents as Dynamic Graph Transformation: A Survey and New Perspective

自进化智能体作为动态图变换:一项综述与新视角

Yuanyuan Xu, Wenjie Zhang, Yin Chen, Xuemin Lin, Ying Zhang

机构 * School of Computer Science and Engineering, The University of New South Wales(新南威尔士大学计算机科学与工程学院) Faculty of Engineering and Information Technology, University of Technology Sydney(悉尼科技大学工程与信息技术学院) School of Data Science, The Chinese University of Hong Kong-Shenzhen(香港中文大学(深圳)数据科学学院) Zhejiang Gongshang University(浙江工商大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本综述将自进化智能体建模为动态图变换,梳理相关动态图方法分类,提出动态图学习作为智能体可复用基础设施,探讨图感知评估协议,为自进化智能体设计治理提供结构性视角。

Comments Project: https://github.com/LuckyGirl-XU/Awesome-Agent-Dynamic-Graphs.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18097 2026-08-20 cs.CL 新提交 81%

FrenchNews-7: Benchmarking Cross-Publisher French News Editorial Desk Classification

FrenchNews-7:跨出版商法国新闻编辑部分类基准

Amr Sobhy

机构 * Le French News Lab(法国新闻实验室)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 本研究构建了跨出版商法语新闻编辑部分类基准FrenchNews-7,采用微调CamemBERT分类器,实验显示其在召回率上优于零样本LLM基线,为新闻分类研究提供了可靠基准。

Comments 15 pages, 5 figures, includes appendices. Model and dataset available on HuggingFace

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17979 2026-08-19 cs.CL 新提交 81%

When Writing Style Drifts: Benchmarking Authorship Verification under Distribution Shifts in Genre, Time and the AI-Era

当写作风格发生漂移:在体裁、时间与AI时代的分布偏移下对作者验证进行基准测试

Lotta Kiefer, Brisca Balthes, Christoph Leiter, Yamen Ajjour, Elena Schmidt, Steffen Eger

机构 * University of Technology Nuremberg (UTN)(纽伦堡工业大学(UTN))

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 本研究推出首个德语作者验证基准AVShift,对跨体裁、时间及AI时代分布偏移下的作者验证进行基准测试,发现微调LLM跨体裁泛化最佳,时间漂移是影响作者验证的最强因素之一,未观测到可测量的AI时代分布偏移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16733 2026-08-18 cs.AR cs.AI 新提交 81%

GoalEvolve: From Handcrafted Algorithm Priors to Goal-Driven Evolution of Physical Design Algorithms

GoalEvolve:从手工设计的算法先验到物理设计算法的目标驱动演化

Haixu Liu, Lei Zhou, Yuhao Ren, Yumao Wu, Zhiang Wang

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 GoalEvolve是一个目标驱动的物理设计算法演化框架,通过LLM教师与并行学生智能体协同,在8个ASAP7设计及Codex目标模式下,显著提升了TNS并降低了功耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16344 2026-08-18 cs.CL 新提交 81%

IndicQE-APE: A Benchmark for Quality Estimation and Automatic Post-Editing for Indic Languages

IndicQE-APE:印度语言质量估计与自动后编辑基准

Diptesh Kanojia, Archchana Sindhujan, Sourabh Deoghare, Daria Sokova, Shenbin Qian, Girish Koushik, Tharindu Ranasinghe, Constantin Orăsan, Chrysoula Zerva, Ricardo Rei, Frédéric Blain, André F. T. Martins, Marco Turchi, Matteo Negri, Rajen Chatterjee, Anoop Kunchukuttan, Mitesh M. Khapra, Pushpak Bhattacharyya

机构 * IIT Bombay(印度理工学院孟买分校) University of Oslo(奥斯陆大学) Lancaster University(兰卡斯特大学) INESC-ID Instituto de Telecomunicações(电信研究所) Instituto Superior Técnico(高等技术学院) University of Lisbon(里斯本大学) Sword Health Tilburg University(蒂尔堡大学) Zoom Communications(Zoom通信公司) Fondazione Bruno Kessler(布鲁诺·凯塞勒基金会) Apple(苹果公司) Bodhan AI IIT Madras(印度理工学院马德拉斯分校) University of Surrey(萨里大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);prompting(abstract);分类 cs.CL

AI总结 本研究构建了涵盖9个方向对的IndicQE-APE基准,对LLM、COMET指标及APE系统进行QE与APE基准测试,揭示质量信号冲突等因素对文本段排名的影响。

Comments Submitted to WMT 2026 for review

详情

展开后加载摘要…

URL PDF HTML 收藏