arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

FinMMEval 2026任务2概述:多语言金融简答题问答

Overview of FinMMEval 2026 Task 2: Multilingual Financial Short-Answer Question Answering

Zhuohan Xie, Xueqing Peng, Georgi Georgiev, Dimitar Dimitrov, Yuyang Dai, Rania Elbadry, Vanshikaa Jani, Lingfei Qian, Fan Zhang, Jimin Huang, Jiahui Geng, Yankai Chen, Ye Yuan, Haolun Wu, Yuxia Wang, Ivan Koychev, Veselin Stoyanov, Mingzi Song, Yu Chen, Xue Liu, Preslav Nakov

arXiv 2607.19867首次发表:更新:

发表机构

Mohamed bin Zayed University of Artificial Intelligence; The Fin AI; FMI, Sofia University “St. Kliment Ohridski”; INSAIT, Sofia University “St. Kliment Ohridski”; University of Arizona; The University of Tokyo; Linköping University; McGill University; Mila, Quebec AI Institute; Meiji Gakuin University(穆罕默德·本·扎耶德人工智能大学; 金融人工智能公司; 索非亚大学“圣克莱门特·奥赫里德斯基”金融数学与信息学系; 索非亚大学“圣克莱门特·奥赫里德斯基”信息技术与自动化研究所; 亚利桑那大学; 东京大学; 林雪平大学; 麦吉尔大学; 魁北克人工智能研究所; 明治学院大学)

机构由 AI 辅助整理,请以论文原文为准。

AI 中文总结

FinMMEval 2026任务2聚焦多语言金融简答题问答,通过特定配对和格式让系统答题,最终测试集含256个项目分两层级,依ROUGE-1 F1排名,最强系统差距小,还记录了多种相关策略。

AI 中文摘要

FinMMEval 2026任务2评估基于多语言证据的简答题金融问答。每个最终测试项目将一个英语问题与英文、中文、日文、西班牙文和希腊文的财务报表及新闻配对。参与系统以JSONL格式为每个项目提交一个简洁答案。最终测试集包含256个项目,平均分为简单和专家两个层级;每个层级有四个问题模板,基于32个公司报告组实例化。提交期间不提供黄金答案,系统根据与组织者持有的参考答案的宏观平均项目级ROUGE-1 F1进行排名。最终排行榜包括12个排名提交。最强的系统紧密聚集,前四名在ROUGE-1 F1上相差不到一个百分点。提交的系统论文记录了检索增强生成、跨语言证据处理、结构化提示、答案压缩和验证策略。

英文摘要

FinMMEval 2026 Task 2 evaluates short-answer financial question answering over multilingual evidence. Each final-test item pairs an English question with financial statements and news in English, Chinese, Japanese, Spanish, and Greek. Participating systems submit one concise answer per item in JSONL format. The final-test set contains 256 items, split evenly between easy and expert tiers; each tier contains four question templates instantiated over 32 company-report groups. Gold answers were withheld during submission, and systems were ranked by macro-averaged item-level ROUGE-1 F1 against organizer-held reference answers. The final leaderboard includes 12 ranked submissions. The strongest systems are closely clustered, with the top four separated by less than one percentage point in ROUGE-1 F1. The submitted system papers document retrieval-augmented generation, cross-lingual evidence handling, structured prompting, answer compression, and validation strategies.

Comments9 pages. Task overview paper for CLEF 2026 Working Notes (CEUR Workshop Proceedings)

论文原文

arXiv 摘要页 · PDF 原文 · HTML 原文

↑