arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11785 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2848 篇

2607.19259 2026-07-22 cs.LG cs.AI 新提交 73%

Benchmarking Generalization in Financial Statement Fraud Detection: robust evaluation and novel tasks

财务报表欺诈检测中的泛化基准测试:稳健评估与新任务

Guy Stephane Waffo Dzuyo, Gaël Guibon, Christophe Cerisara, Luis Belmar-Letelier

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对财务报表欺诈检测中现有方法性能估计不现实的问题,提出利用大语言模型整合结构化与非结构化数据的框架,通过新基准任务评估,构建公开数据集,该方法在新任务中性能最佳,凸显文本数据和稳健评估的价值。

Comments Accepted at FinLLM@IJCAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19209 2026-07-22 cs.CY cs.AI cs.LG 新提交 73%

Assessment in Team Problem-Solving Exercises in Computing Education

计算教育中团队问题解决练习的评估

Valdemar Švábenský, Jan Vykopal, Sukrit Leelaluk, Pavel Čeleda, Fumiya Okubo, Atsushi Shimada

机构 * Faculty of Informatics(信息学院) Masaryk University(马萨里克大学) Center for ICT Infrastructure(信息与通信基础设施中心) Yamaguchi University(山阳大学) Kyushu University(九州大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究计算教育中团队问题解决练习的评估方法,通过比较聚类和大语言模型,利用原始数据集与教师评分对比,发现聚类有效可靠、计算要求低,GPT-5.2误差低,相关方法已集成到开源平台,还共享了数据和工具。

Comments Full paper accepted for the main track of the IEEE FIE 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14989 2026-07-17 cs.CL cs.AI 新提交 73%

OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios

OmniaBench:跨多样场景对通用人工智能智能体进行基准测试

Chengyu Shen, Yujie Fu, Gangtao Xin, Yanheng Hou, Wenlong Fei, Guojie Zhu, Jiawei Li, Hongcheng Gao, Runming He, Zhen Hao Wong, Meiyi Qiang, Hao Liang, Zhao Cao, Hao Jiang, Chong Chen, Wentao Zhang

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对大语言模型向通用智能体演变,现有基准测试有局限的问题,引入OmniaBench。通过多渠道获取场景知识形成分类法,构建可执行环境并合成任务,还引入能力分类法等。其数据集含多任务,对前沿模型构成挑战,能表征通用智能体能力边界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14158 2026-07-17 cs.AI cs.CL cs.MA cs.SE 新提交 73%

Orchestrating Power Grid Studies with Multi-Agent AI and MCP Servers

利用多智能体人工智能和MCP服务器编排电网研究

Jérôme Picault, Clément Goubet

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 探讨智能体人工智能和MCP在TSO环境下对电网研究的支持,结合大语言模型等要素,介绍pypowsybl - mcp接口搭建试验台,研究智能体交互方式,讨论人工参与原则与评估策略,推动电网研究环境更具交互性、可审计性和扩展性。

Comments Accepted to IJCAI AISE 2026 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14141 2026-07-17 cs.AI cs.LG 新提交 73%

Human AI Construction of Bayesian Networks for Operational Decision Support -- A Virtual Survey Approach

用于运营决策支持的贝叶斯网络的人工AI构建——一种虚拟调查方法

Kumar Rahul, Shovan Chowdhury

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究如何构建贝叶斯网络用于运营决策支持,提出利用大语言模型的新方法,通过人工智能代理估计概率并去噪,开发六步框架,以客户咨询医生意图建模为例,揭示因素影响,得出有效策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14101 2026-07-17 cs.CL cs.AI 新提交 73%

LBA: Textual Hard-Label Adversarial Attack under Low Query Budgets

LBA:低查询预算下的文本硬标签对抗攻击

Shixin Guo, Ming Zhong, Xuhong Zhang, Dandan Zhao, Zhe Wang, Bo Zhang, Shouling Ji, Hao Peng

机构 * Zhejiang Normal University(浙江师范大学) Zhejiang University(浙江大学) China Electric Power Research Institute(中国电力科学研究院)

专题命中 评测与基准 :LLM(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究在低查询预算硬标签场景下生成高质量对抗文本的难题,提出基于采样的LBA方法,整合先验与后验知识构建近似分布用于采样,实验证明该方法在多语言模型上显著优于基线,生成的对抗文本语义保留性和可理解性更佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11891 2026-07-15 cs.CL cs.AI 新提交 73%

CANDI: Contextual Alignment for Niche Domains Question Answering

CANDI:特定领域问答的上下文对齐

Megha Chakraborty, Darssan L. Eswaramoorthi, Het Riteshkumar Shah, Madhur Thareja, Michelle A Ihetu, Harshul Raj Surana, Kaushik Roy, Amit Sheth

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对专业领域大语言模型评估问题,提出CANDI-QA数据集,含两类问答对。评估多种语言模型,给出MTSS-Net框架。揭示特定领域上下文对齐挑战及当前模型局限,为上下文感知语言模型研究提供关键基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11873 2026-07-14 cs.CL cs.LG 新提交 73%

A Durability and Cross-Language Transfer Benchmark for a Validated Teaching-Feedback Classification Protocol

用于经过验证的教学反馈分类协议的耐久性和跨语言转移基准

Esteban U. Vega Barajas

机构 * Universidad de Guadalajara(瓜达拉哈拉大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 研究教学反馈分类协议的复用性问题,通过在原始西班牙数据上跨三代表示方法重新运行,并转移到英语,发现该协议具有耐久性,模型选择是部署决策而非方法特性。

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11493 2026-07-14 cs.LG cs.AI math.CT 新提交 73%

Agentic Skill Optimization over Lie Algebroids

李代数胚上的智能体技能优化

Sridhar Mahadevan

机构 * Adobe Research(Adobe研究院) University of Massachusetts, Amherst(马萨诸塞大学阿默斯特分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究智能体技能优化问题,提出LASKO框架,将技能建模为李代数胚截面,利用李括号筛选测试替代昂贵验证,在自然语言任务因果提取中实现近15倍加速,提升技能优化速度。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08625 2026-07-10 cs.AI cs.CL 新提交 73%

The complexities of patient-centred conversational artificial intelligence

以患者为中心的对话式人工智能的复杂性

João Matos, Olivia Buege, Donny Cheung, Gary S. Collins, Paula Dhiman, Nan Li, Bingyu Mao, Benjamin W. Nelson, Michail Ouroutzoglou, Paul Varghese, Jonathan Amar

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究面向消费者的健康聊天机器人开发评估问题,开发患者模拟器建模多方面内容,经图灵启发评估和多案例测试,发现沟通风格影响分诊结果,强调以患者为中心的对话式人工智能要适应沟通多样性。

Comments 36 pages (main text), 129 pages (supplementary materials)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08034 2026-07-10 cs.CL cs.AI cs.CY 新提交 73%

PLURAL: A Global Dataset for Value Alignment

PLURAL:一个用于价值对齐的全球数据集

Dhruv Agarwal, Anya Shukla, Tanya Goyal, Aditya Vashistha

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对大语言模型反映西方价值观问题,引入基于IVS的PLURAL数据集,通过两阶段管道生成偏好三元组,经三种方式评估,结果显示其含价值引导可学习信号,能为多元对齐提供资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07670 2026-07-09 cs.CL cs.LG 新提交 73%

Does Bielik Know What It Doesn't Know? Activation Dispersion Separates Entity Familiarity from Factual Reliability Across Model Scale

比埃利克模型知道它所不知道的吗?激活离散度在模型规模上区分实体熟悉度与事实可靠性

Grzegorz Brzezinka

机构 * Prosit AS(Prosit公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 研究大语言模型中实体熟悉度与事实可靠性,通过两种无监督离散度度量及有监督线性探测,在比埃利克模型上区分不同实体,发现激活离散度信号在模型规模上与事实可靠性表现不同,已知实体中区分正误更难,模型几乎不弃权。

Comments 23 pages, 6 figures and 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07500 2026-07-09 cs.LG cs.AI 新提交 73%

TimEE: End-to-end Time Series Classification via In-Context Learning

TimEE:通过上下文学习实现的端到端时间序列分类

Jaris Küken, Shi Bin Hoo, Martin Mráz, Frank Hutter, Lennart Purucker

机构 * University of Freiburg(弗莱堡大学) Zuse School ELIZA Darmstadt(达姆施塔特祖斯学校ELIZA) Prior Labs(普瑞尔实验室) ELLIS Institute Tübingen(图宾根ELLIS研究所)

专题命中 评测与基准 :foundation model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 研究针对时间序列分类两阶段范式的不足,提出TimEE模型,通过上下文学习实现端到端时间序列分类。该模型基于PFN框架在合成任务上元训练,无需针对每个数据集训练,在UCR基准测试中表现优异,为TSC提供新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06229 2026-07-08 cs.CL cs.AI cs.DB 新提交 73%

Spider 2.0-AIFunc: Extending Real-World Text-to-SQL to AI-Native SQL Workflows

Spider 2.0-AIFunc:将现实世界的文本到SQL扩展到人工智能原生SQL工作流程

Tianyang Liu, Canwen Xu, Fangyu Lei, Nikki Lijing Kuang, Jixuan Chen, Tao Yu, Julian McAuley, Zhewei Yao, Yuxiong He

机构 * UC San Diego(加州大学圣地亚哥分校) Snowflake AI Research(Snowflake人工智能研究院) University of Hong Kong(香港大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对现有文本到SQL基准无法评估模型生成人工智能原生SQL能力的问题,构建Spider 2.0-AIFunc基准,经特定管道和多轮验证,评估十个先进语言模型,发现准确率差距及传统代理框架转移无效等情况。

Comments 24 pages, 3 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05992 2026-07-08 cs.CL cs.AI 新提交 73%

PluraMath: Extending Mathematical Reasoning Evaluation Beyond High-Resource Languages

PluraMath:将数学推理评估扩展到资源丰富语言之外

Daryna Dementieva, Nikolay Babakov, Kathy Hämmerl, Ilseyar Alimova, Jindřich Libovický, Shu Okabe, Miras Baisbay, Lukas Edman, Abrorkhon Inomkhujaev, Antonia Karamolegkou, Mateusz Lango, Volkan Özer, Nikola Selic, Subhankar Swain, Tsedeniya Kinfe Temesgen, Galit Bary Weisberg, Alexander Fraser

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Munich Data Science Institute(慕尼黑数据科学研究所) Applied AI Institute(应用人工智能研究所) Charles University(查尔斯大学) Nazarbayev University(纳扎尔拜大学) Inria(法国国家信息与自动化研究所) Indian Institute of Technology, Kharagpur (IIT Kharagpur)(印度Kharagpur理工学院) German University of Digital Science(德国数字科学大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对数学推理评估基准偏向高资源语言的问题,引入PluraMath,将其扩展到18种资源不足语言,通过人工策划构建数据集,对27个推理LLMs进行基准测试,分析性能差距,开源相关内容以推动多语言基准开发。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05614 2026-07-08 cs.CL cs.AI cs.CV 新提交 73%

BaFCo: A Document Understanding Benchmark for Complex Bangla Form Comprehension

BaFCo:用于复杂孟加拉语表格理解的文档理解基准

Abu Tyeb Azad, Ishita Sur Apan, Fahim Ahmed, Sumaiya Karim Katha, Ezharuddin Jubaer, Armun Alam, Pranjal Kumar Nandi, Amin Ahsan Ali, Aman Chadha, Md Mofijul Islam, AKM Mahbubur Rahman

机构 * Wichita State University(威奇托州立大学) Center for Computational & Data Sciences(计算与数据科学中心) University of Dhaka(达卡大学) Amazon GenAI(亚马逊生成式人工智能)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对孟加拉语表格理解因高质量标注数据稀缺受限的问题,引入BaFCo基准数据集,涵盖多领域复杂表格。定义细粒度标注模式,评估多种MLLMs,发现其理解孟加拉语表格有局限,尤其在定位细粒度实体方面。

Comments Accepted at the 19th European Conference on Computer Vision (ECCV), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05410 2026-07-08 cs.CY cs.AI cs.CL cs.PL 新提交 73%

CANONIC: Governance Is Compilation

CANONIC:治理即编译

Dexter Hadley

机构 * CANONIC Foundation(CANONIC基金会) American Board of Precision Medicine(精准医学美国委员会)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 CANONIC将数字工件编译到证据账本,通过三个公理管理内容准入,经跨供应商基准测试发现虽不能排除“slop”,但能保持记录可审计,实现端到端可重现与检查。

Comments 28 pages, 4 figures. Pre-registered cross-provider evaluation harness and per-regime results at github.com/canonic-canonic/canonic-pub. Construction claims resolve to commands run at the evidence-window-close ref (see Appendix C)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18142 2026-07-08 cs.AI cs.CL cs.CY 新提交 73%

Your AI Travel Agent Would Book You a Bullfight: An Agentic Benchmark for Implicit Animal Welfare in Frontier AI Models

你的AI旅行代理会为你预订斗牛:前沿AI模型中隐含动物福利的代理基准

Jasmine Brazilek, Joel Christoph, Maheep Chaudhary, Oliver Tullio, Carol Kline, Miles Tidmarsh, Arturs Kanepajs

机构 * Compassion Aligned Machine Learning(同情对齐机器学习) Sentient Futures(感知未来) Harvard Kennedy School(哈佛肯尼迪学院) Appalachian State University Department of Management(阿巴拉契亚州立大学管理系)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出首个代理基准TAC,测试AI代理在为用户执行旅行预订等操作时是否避免涉及动物剥削的选项。评估七个前沿模型,所有模型得分低于随机水平64%,最佳模型仅53%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04033 2026-07-07 cs.LG cs.AI 新提交 73%

OmniOpt: Taxonomy, Geometry, and Benchmarking of Modern Optimizers

OmniOpt:现代优化器的分类法、几何结构及基准测试

Siyuan Li, Jiabao Pan, Yumou Liu, Zhuoli Ouyang, Xin Jin, Xinglong Xu, Jingxuan Wei, Shengye Pang, Jintao Che, Xuanhe Zhou, Conghui He, Cheng Tan

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai University(上海大学) Westlake University(西湖大学) Shanghai Jiao Tong University(上海交通大学) UCAS(中国科学技术大学) Zhejiang University(浙江大学) Southern University of Science and Technology(南方科技大学)

专题命中 评测与基准 :language model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 针对大规模模型训练的优化器选择受多种因素制约且方法零散,介绍OmniOpt,通过五阶段元管道、规范约束线性最小化预言机等构建统一分类法和跨域基准测试,为优化器选择提供操作坐标系。

Comments Survey & benchmark preprint V1 (91 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02032 2026-07-07 cs.AI cs.CL 新提交 73%

PACE: A Proxy for Agentic Capability Evaluation

PACE:智能体能力评估的代理框架

Yueqi Song, Lintang Sutawika, Jiarui Liu, Lindia Tjuatja, Jiayi Geng, Yunze Xiao, Daniel Lee, Aditya Bharat Soni, Vincent Lo, Xiang Yue, Graham Neubig

机构 * Carnegie Mellon University(卡内基梅隆大学) Salesforce AI Research(Salesforce人工智能研究)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出PACE框架,通过从非智能体评测中选取原子实例构建代理基准,以低成本高精度预测智能体基准性能,在14个模型上实现MAE<4%、Spearman>0.80。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01852 2026-07-03 cs.IR cs.AI cs.CL 新提交 73%

Evaluating Chunking Strategies for Retrieval-Augmented Generation on Academic Texts

评估学术文本中检索增强生成的文本分块策略

Valentin J. J. Kreileder, Johannes Reisinger, Andreas Fischer

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究在检索增强生成系统中,基于聚类的语义分块是否优于固定大小和递归分块,通过RAGAs框架在长结构化学术论文上评估检索和答案质量,发现聚类分块未超越简单策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00464 2026-07-02 cs.LG cs.CL 新提交 73%

MolSafeEval: A Benchmark for Uncovering Safety Risks in AI-Generated Molecules

MolSafeEval: 揭示AI生成分子安全风险的基准

Tong Xu, Xinzhe Cao, Zhihui Zhu, Keyan Ding, Huajun Chen

机构 * Zhejiang University(浙江大学) ZJU-Hangzhou Global Scientific and Technological Innovation Center(浙大-杭州全球科技创新中心) University of Oxford(牛津大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出MolSafeEval基准,通过构建分子安全知识图谱和基于大语言模型的推理,系统评估四类分子生成模型的安全风险,揭示当前方法的漏洞。

Comments Accepted by Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31966 2026-07-01 cs.MA cs.AI cs.CL cs.CV 新提交 73%

MECoBench: A Systematic Study of Multimodal Agent Collaboration in Embodied Environments

MECoBench:具身环境中多模态智能体协作的系统研究

Qingyun Liu, Jiwen Zhang, Jingyi Hu, Siyuan Wang, Zhongyu Wei

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) The Chinese University of Hong Kong(香港中文大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出MECoBench基准,通过多任务、多结构、多模式的实验,系统研究多模态大模型在具身环境中的协作机制,发现协作能提升任务完成度但需平衡收益与复杂度,通信是关键,且协作增强鲁棒性。

Comments Project website: https://q-i-n-g.github.io/MECoBench-Website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25269 2026-06-25 stat.ML cs.AI cs.LG 新提交 73%

Stabilizing black-box algorithms through task-oriented randomization

通过任务导向的随机化稳定黑盒算法

Yali Wang, Zhaojun Wang

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出一种任务导向的随机化方法,根据输入数据的生成机制自适应调整策略,以稳定黑盒输出,并分析了稳定性与探索之间的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24259 2026-06-24 cs.CL cs.AI 新提交 73%

SURGELLM: Rethinking Multi-Task Evaluation through Task-Aware Feature Gating with Class-Balanced Normalization

SURGELLM: 通过任务感知特征门控与类别平衡归一化重新思考多任务评估

Noor Islam S. Mohammad, Ulug Bayazit

机构 * Istanbul Technical University(伊斯坦布尔理工大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 针对异构NLP任务中归纳偏置不匹配、类别不平衡和缺乏外部词汇知识的问题,提出统一Transformer框架SURGELLM,包含手术特征门控、任务条件前缀令牌和实例加权归一化,在四个任务上平均F1提升0.036。

Comments Proceedings of the 6th Workshop on Trustworthy NLP (TrustNLP 2026), ACL 2026, San Diego, California, USA. Available at https://openreview.net/forum?id=WJCalficPT

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17698 2026-06-24 cs.AI cs.CL 新提交 73%

EComAgentBench: Benchmarking Shopping Agents on Long-Horizon Tasks with Distributed Hidden Intent

EComAgentBench:在分布式隐藏意图的长时任务上基准测试购物代理

Zeyao Du, Tong Li, Yanci Zhang, Haibo Zhang

机构 * Shopee

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出EComAgentBench基准,包含662个基于真实亚马逊产品的任务,要求代理在100次工具调用内从可见查询、工具门控配置文件和脚本化澄清中挖掘隐藏意图,验证候选产品并提交最终选择,通过类型化源标签评分归因失败。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23042 2026-06-23 cs.CY cs.AI cs.CL stat.AP 新提交 73%

The Model as One Rater Among Several: Measuring Political Positions in Data-Sparse Regions with a Language-Model Panel

模型作为多位评估者之一:在数据稀疏区域使用语言模型面板测量政治立场

Tarek Gara

机构 * Independent researcher(独立研究者)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出将大语言模型作为面板中的一位评估者,通过多模型投票测量政治立场,在数据稀疏区域(如中东和北非)验证了可靠性,并发现分歧可提供信息。

Comments 21 pages, 1 figure, 7 tables. Dataset, rubric, and interactive tools: https://tarekgara.com/tayyar

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22811 2026-06-23 cs.CL cs.AI 新提交 73%

Bagpiper-TTS: Natural Language Guided Universal Speech Synthesis

Bagpiper-TTS: 自然语言引导的通用语音合成

Jinchuan Tian, Haoran Wang, Siddhant Arora, Takashi Maekaku, Keita Goto, Jin Sakuma, Yusuke Shinohara, Chao-Han Huck Yang, Shinji Watanabe

机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) LY Corporation NVIDIA Research(英伟达研究院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出Bagpiper-TTS,通过自然语言提示推理用户意图生成丰富描述,再合成语音,支持多说话人、意图转语音、角色扮演、歌声合成等任务,在Seed-TTS-Eval上WER为1.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21685 2026-06-23 cs.CL cs.AI cs.DB 新提交 73%

TACO: Task-Aware Column Description Generation Using LLMs

TACO:使用LLMs的任务感知列描述生成

Ting Cai, Rakesh R. Menon, Yiru Chen, Zifan Liu, Yuan Tian, Fei Wu, Anudeep Chimakurthi, Prashanthi Ramamurthy, Sunav Choudhary, Kun Qian, Yunyao Li

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Purdue University(普渡大学) Adobe

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出TACO框架,通过三步流水线(缩写扩展、描述生成、描述修订)利用LLMs自动生成准确且信息丰富的列描述,在下游任务中性能提升高达32%。

Comments 15 pages, 11 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20961 2026-06-23 cs.LG cs.AI 新提交 73%

Is Our Benchmark Enough? An Analysis of Continual Learning for MLLMs

我们的基准测试足够吗?多模态大语言模型持续学习分析

Van-Tuan Tran, Shruthi Gowda, Merim Dzaferagic, Marco Ruffini

机构 * School of Computer Science and Statistics, Trinity College Dublin(都柏林圣三一学院计算机科学与统计学院) Department of Mathematics and Computer Science, Eindhoven University of Technology(埃因霍温理工大学数学与计算机科学系)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文质疑MR-LoRA方法对MLLM路由器的依赖,提出无训练无重放的简单原型路由方法RePRo,并指出共享专家无益,揭示MLLM-CL基准的任务高度可分离和固定顺序导致评估偏差,从而提出新基准设计。

Comments ICML 2026 Workshop "Continual Adaptation at Scale: Towards Sustainable AI"

详情

展开后加载摘要…

URL PDF HTML 收藏