arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-09 至 2025-12-09 共收录 60 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 60 篇

2512.07666 2025-12-09 cs.CL cs.SE 91%

Bridging Code Graphs and Large Language Models for Better Code Understanding

连接代码图与大型语言模型以实现更好的代码理解

Zeqi Chen, Zhaoyang Chu, Yi Gui, Feng Guo, Yao Wan, Chuan Shi

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

AI总结 CGBridge通过引入外部Bridge模块,提升LLMs对代码结构语义的理解,显著提高代码生成和翻译任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06272 2025-12-09 cs.CL cs.CE 90%

Golden Touchstone: A Comprehensive Bilingual Benchmark for Evaluating Financial Large Language Models

黄金触点:一种全面的双语基准,用于评估金融大语言模型

Xiaojun Wu, Junxi Liu, Huanyi Su, Zhouchi Lin, Yiyan Qi, Chengjin Xu, Jiajun Su, Jiajie Zhong, Fuwei Wang, Saizhuo Wang, Fengrui Hua, Jia Li, Jian Guo

机构 * IDEA Research(IDEA研究机构) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(香港科学与技术大学) Nanjing University(南京大学) South China Normal University(华南师范大学) DataArcTech Ltd.(DataArcTech有限公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);instruction tuning(abstract)

AI总结 本研究提出Golden Touchstone双语基准,用于全面评估金融大语言模型的性能,通过对比分析揭示模型在处理复杂金融信息时的优势与局限。

Comments Published in Findings of EMNLP 2025

Journal ref In Findings of the Association for Computational Linguistics: EMNLP 2025, pages 22544-22560, Suzhou, China. Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07261 2025-12-09 cs.SE 90%

Automatic Syntax Error Repair for Discrete Controller Synthesis using Large Language Model

利用大语言模型实现离散控制器综合的自动语法错误修复

Yusei Ishimizu, Takuto Yamauchi, Sinan Chen, Jinyu Cai, Jialong Li, Kenji Tei

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文提出利用大语言模型自动修复离散控制器综合模型中的语法错误,通过设计提示策略提高修复准确性和效率,实验显示其比人类开发者快3.46倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.04671 2025-12-09 cs.CL cs.LG q-bio.PE 90%

PhyloLM : Inferring the Phylogeny of Large Language Models and Predicting their Performances in Benchmarks

PhyloLM : 推断大语言模型的系统发育并预测其在基准测试中的性能

Nicolas Yax, Pierre-Yves Oudeyer, Stefano Palminteri

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

AI总结 PhyloLM通过系统发育算法推断大语言模型的系统发育关系并预测其在基准测试中的性能。

Comments The project code is available at https://github.com/Nicolas-Yax/PhyloLM . Published as https://iclr.cc/virtual/2025/poster/28195 at ICLR 2025. A code demo is available at https://colab.research.google.com/drive/1agNE52eUevgdJ3KL3ytv5Y9JBbfJRYqd

Journal ref ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18274 2025-12-09 cs.HC cs.AI 89%

Clinician-Directed Large Language Model Software Generation for Therapeutic Interventions in Physical Rehabilitation

面向物理康复治疗的临床指导大型语言模型软件生成

Edward Kim, Yuri Cho, Jose Eduardo E. Lima, Julie Muccini, Jenelle Jindal, Alison Scheid, Erik Nelson, Seong Hyun Park, Yuchen Zeng, Alton Sturgis, Caesar Li, Jackie Dai, Sun Min Kim, Yash Prakash, Liwen Sun, Isabella Hu, Hongxuan Wu, Daniel He, Wiktor Rajca, Cathra Halabi, Maarten Lansberg, Bjoern Hartmann, Sanjit A. Seshia

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出利用大型语言模型生成临床指导的康复软件,通过个性化设计提升康复干预效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06248 2025-12-09 cs.SE 89%

CFCEval: Evaluating Security Aspects in Code Generated by Large Language Models

CFCEval: 评估大型语言模型生成代码的安全性方面

Cheng Cheng, Jinqiu Yang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 CFCEval通过引入MLVBench和ELRM指标,有效评估大型语言模型生成代码的质量与安全性,提升代码评估的准确性和全面性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21371 2025-12-09 eess.SY cs.SY 89%

Evaluation of Large Language Models for Numeric Anomaly Detection in Power Systems

大型语言模型在电力系统中数值异常检测中的评估

Yichen Liu, Hongyu Wu, Bo Liu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文评估了GPT-OSS-20B在电力系统中用于数值异常检测的性能,采用多种方法并结合三西格玛准则,探讨LLM在电网应用中的潜力与局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07608 2025-12-09 cs.CL cs.AI 88%

Metric-Fair Prompting: Treating Similar Samples Similarly

度量公平提示:对待相似样本同样

Jing Wang, Jie Shen, Xing Niu, Tong Zhang, Jeremy Weiss

机构 * NLM(国家医学图书馆) Stevens Institute of Technology(史蒂文斯理工学院) AWS AI(亚马逊人工智能) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :prompting(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 度量公平提示通过促进个体公平性,提高LLM在高风险临床多选问题上的准确性。

Journal ref NeurIPS 2025 Workshop on Socially Responsible and Trustworthy Foundation Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07075 2025-12-09 cs.CL 88%

Do Large Language Models Truly Understand Cross-cultural Differences?

大型语言模型真的能理解跨文化差异吗?

Shiwei Guo, Sihang Jiang, Qianxi He, Yanghua Xiao, Jiaqing Liang, Bi Yude, Minggui He, Shimin Tao, Li Zhang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出SAGE基准,通过跨文化核心概念对齐和生成任务设计,评估LLMs的跨文化理解和推理能力,揭示其在跨文化推理中的系统性限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21491 2025-12-09 cs.IR 88%

Geospatial Question Answering on Historical Maps Using Spatio-Temporal Knowledge Graphs and Large Language Models

利用时空知识图谱和大语言模型进行历史地图的地理问题回答

Ziyi Liu, Sidi Wu, Lorenz Hurni

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本研究提出利用时空知识图谱和大语言模型开发GeoQA系统,实现对历史地图中地理问题的高效回答与可视化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18538 2025-12-09 cs.SE cs.CL 87%

From Code Foundation Models to Agents and Applications: A Comprehensive Survey and Practical Guide to Code Intelligence

从代码基础模型到代理与应用:全面综述与代码智能的实用指南

Jian Yang, Xianglong Liu, Weifeng Lv, Ken Deng, Shawn Guo, Lin Jing, Yizhi Li, Shark Liu, Xianzhen Luo, Yuyu Luo, Changzai Pan, Ensheng Shi, Yingshui Tan, Renshuai Tao, Jiajun Wu, Xianjie Wu, Zhenhe Wu, Daoguang Zan, Chenchen Zhang, Wei Zhang, He Zhu, Terry Yue Zhuo, Kerui Cao, Xianfu Cheng, Jun Dong, Shengjie Fang, Zhiwei Fei, Xiangyuan Guan, Qipeng Guo, Zhiguang Han, Joseph James, Tianqi Luo, Renyuan Li, Yuhang Li, Yiming Liang, Congnan Liu, Jiaheng Liu, Qian Liu, Ruitong Liu, Tyler Loakman, Xiangxin Meng, Chuang Peng, Tianhao Peng, Jiajun Shi, Mingjie Tang, Boyang Wang, Haowen Wang, Yunli Wang, Fanglin Xu, Zihan Xu, Fei Yuan, Ge Zhang, Jiayi Zhang, Xinhao Zhang, Wangchunshu Zhou, Hualei Zhu, King Zhu, Bryan Dai, Aishan Liu, Zhoujun Li, Chenghua Lin, Tianyu Liu, Chao Peng, Kai Shen, Libo Qin, Shuangyong Song, Zizheng Zhan, Jiajun Zhang, Jie Zhang, Zhaoxiang Zhang, Bo Zheng

专题命中 评测与基准 :foundation model(title);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文综述了代码基础模型到代理的应用,分析了代码LLM的完整生命周期,并通过实验探讨了其性能优化与实际应用中的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05156 2025-12-09 cs.AI cs.CL cs.IT cs.LG math.IT q-fin.CP 87%

Semantic Faithfulness and Entropy Production Measures to Tame Your LLM Demons and Manage Hallucinations

语义忠实与熵产度量:驯服LLM恶魔并管理幻觉

Igor Halperin

机构 * Fidelity Investments

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出语义忠实与熵产度量,通过信息论和热力学方法评估LLM的忠实度并控制幻觉,应用于公司SEC文件摘要生成。

Comments 23 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06504 2025-12-09 cs.CR 87%

When Code Crosses Borders: A Security-Centric Study of LLM-based Code Translation

当代码跨越国界:一种以安全为中心的LLM代码翻译研究

Hailong Chang, Guozhu Meng, Shuhui Xiao, Kai Chen, Kun Sun, Yilin Li

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文研究了LLM在代码翻译中的安全风险,发现28.6%-45%的翻译引入新漏洞,并提出RAG策略降低漏洞率32.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04346 2025-12-09 cs.CL cs.AI 86%

Multi-Lingual Cyber Threat Detection in Tweets/X Using ML, DL, and LLM: A Comparative Analysis

多语言推特/X中的网络威胁检测:使用机器学习、深度学习和大语言模型的比较分析

Saydul Akbar Murad, Ashim Dahal, Nick Rahimi

机构 * School of Computing Sciences and Computer Engineering(计算科学与计算机工程学院) University of Southern Mississippi(密西西比大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究比较了ML、DL和LLM在多语言推文网络威胁检测中的效果,发现双LSTM架构在多语言场景中表现最佳。

Journal ref IEEE Trans. Comput. Soc. Syst., Early Access, pp. 1-15, Nov. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07501 2025-12-09 cs.SE cs.AI 85%

AutoICE: Automatically Synthesizing Verifiable C Code via LLM-driven Evolution

AutoICE: 通过LLM驱动的进化自动合成可验证的C代码

Weilin Luo, Xueyi Liang, Haotian Deng, Yanan Liu, Hai Wan

机构 * Sun Yat-sen University, School of Computer Science and Engineering(中山大学计算机科学与工程学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 AutoICE通过LLM驱动的进化搜索方法,自动合成可验证的C代码,验证成功率高达90.36%,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06228 2025-12-09 cs.CL 85%

Policy-based Sentence Simplification: Replacing Parallel Corpora with LLM-as-a-Judge

基于政策的句子简化:用LLM作为评判者取代平行语料库

Xuanxin Wu, Yuki Arase, Masaaki Nagata

机构 * The University of Osaka(大阪大学) Institute of Science Tokyo(东京科学研究所) NTT Inc.(日本电报电话公司)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出利用LLM作为评判者自动构建政策一致的训练数据,实现无需人工标注或平行语料库的句子简化系统,实验表明其在词法简化和整体重写任务上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05485 2025-12-09 cs.CR 85%

TeleAI-Safety: A comprehensive LLM jailbreaking benchmark towards attacks, defenses, and evaluations

TeleAI-Safety: 一种全面的LLM jailbreaking基准测试,面向攻击、防御和评估

Xiuyuan Chen, Jian Zhao, Yuxiang He, Yuan Xun, Xinwei Liu, Yanshu Li, Huilin Zhou, Wei Cai, Ziyan Shi, Yuchen Yuan, Tianle Zhang, Chi Zhang, Xuelong Li

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 TeleAI-Safety提出了一种全面的LLM安全评估基准,整合多种攻击、防御和评估方法,用于系统性评估LLM的安全性及优化防御策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05994 2025-12-09 eess.AS cs.AI cs.CL cs.SD 84%

KidSpeak: A General Multi-purpose LLM for Kids' Speech Recognition and Screening

KidSpeak: 一个通用的多用途大语言模型用于儿童语音识别与筛查

Rohan Sharma, Dancheng Liu, Jingchen Sun, Shijie Zhou, Jiayu Qin, Jinjun Xiong, Changyou Chen

机构 * Department of Computer Science and Engineering, State University of New York at Buffalo(计算机科学与工程系,纽约州立大学布法罗分校)

专题命中 评测与基准 :LLM(title,abstract);foundation model(abstract);分类 cs.CL、cs.AI

AI总结 KidSpeak是首个为儿童语音识别与筛查设计的多用途大语言模型,结合语音增强技术与FASA对齐工具,实现87%的准确率,提升儿童语音数据质量13.6倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06999 2025-12-09 cs.SD cs.AI 83%

Singing Timbre Popularity Assessment Based on Multimodal Large Foundation Model

基于多模态大基础模型的歌唱音色受欢迎程度评估

Zihao Wang, Ruibin Yuan, Ziqi Geng, Hengjia Li, Xingwei Qu, Xinyi Li, Songye Chen, Haoying Fu, Roger B. Dannenberg, Kejun Zhang

机构 * Zhejiang University(浙江大学) Carnegie Mellon University(卡内基梅隆大学) Hong Kong University of Science and Technology(香港科学与技术大学) University of California, Berkeley(加州大学伯克利分校) University of Manchester(曼彻斯特大学) Innovation Center of Yangtze River Delta, Zhejiang University(长江三角洲创新中心,浙江大学)

专题命中 评测与基准 :foundation model(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出基于多模态大基础模型的歌唱音色受欢迎程度评估方法,通过引入Sing-MD数据集、VocalVerse架构和H-TPR基准,实现无参考、多维度的歌唱评估。

Comments Accepted to ACMMM 2025 oral

Journal ref Proceedings of the 33rd ACM International Conference on Multimedia (ACMMM 2025), Pages 12227-12236

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06274 2025-12-09 cs.CR cs.AI 83%

Enhancing LLM Watermark Resilience Against Both Scrubbing and Spoofing Attacks

增强LLM对 scrubbing 和 spoofing 攻击的鲁棒性

Huanming Shen, Baizhou Huang, Xiaojun Wan

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学计算机技术研究院) University of Electronic Science and Technology of China(电子科技大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出SEEK水印方案,通过等效纹理密钥机制提升LLM对scrubbing和spoofing攻击的鲁棒性,实验显示其在不同数据集上显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03619 2025-12-09 cs.CR 82%

Blackbox Dataset Inference for LLM

LLM的黑盒数据集推断

Ruikai Zhou, Kang Yang, Xun Chen, Wendy Hui Wang, Guanhong Tao, Jun Xu

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)

AI总结 本文提出了一种仅需黑盒访问目标模型的LLM数据集推断方法,通过对比本地构建的参考模型来判断模型是否使用特定数据集进行训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06751 2025-12-09 cs.CL cs.AI cs.LG 80%

Becoming Experienced Judges: Selective Test-Time Learning for Evaluators

成为经验丰富的法官:用于评估者的选择性测试时间学习

Seungyeon Jwa, Daechul Ahn, Reokyoung Kim, Dongyeop Kang, Jonghyun Choi

机构 * Seoul National University(首尔国立大学) University of Minnesota(明尼苏达大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出选择性测试时间学习框架,使评估者在推理过程中逐步改进,通过自适应元提示提升评估效果,实验证明其在多个基准上的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06096 2025-12-09 cs.CL 79%

A Systematic Assessment of Language Models with Linguistic Minimal Pairs in Chinese

对中文语言模型进行系统评估:基于语言最小配对的基准测试

Yikang Liu, Yeting Shen, Hongao Zhu, Lilong Xu, Zhiheng Qian, Siyuan Song, Kejia Zhang, Jialong Tang, Pei Zhang, Baosong Yang, Rui Wang, Hai Hu

机构 * Shanghai Jiao Tong University(上海交通大学) Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团) The University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Glasgow(格拉斯哥大学) University of California, San Diego(加州大学圣地亚哥分校) City University of Hong Kong(香港城市大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 本文提出ZhoBLiMP中文最小配对基准测试,并通过SLLN-LP度量标准评估不同中文语言模型在处理指代、量词和省略等任务上的性能。

Comments Accepted by TACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07832 2025-12-09 cs.CL cs.LG 79%

Do Generalisation Results Generalise?

泛化结果是否能泛化?

Matteo Boglioni, Andrea Sgobbi, Gabriel Tavernini, Francesco Rita, Marius Mosbach, Tiago Pimentel

机构 * ETH Zürich(苏黎世联邦理工学院) Mila - Quebec Artificial Intelligence Institute(魁北克人工智能研究所) McGill University(麦吉尔大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了大型语言模型在不同分布外测试集上的泛化能力是否具有普遍趋势,通过分析多个模型发现泛化结果的相关性依赖于具体模型的选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04650 2025-12-09 cs.CV 78%

EncQA: Benchmarking Vision-Language Models on Visual Encodings for Charts

EncQA:在图表视觉编码上评估视觉-语言模型的基准测试

Kushin Mukherjee, Donghao Ren, Dominik Moritz, Yannick Assogba

机构 * Stanford University(斯坦福大学) Apple(苹果公司)

专题命中 评测与基准 :language model(title,abstract)

AI总结 EncQA通过系统覆盖图表理解的关键视觉编码和任务,揭示了不同编码和任务间VLMs性能的显著差异,强调了针对性策略的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06750 2025-12-09 cs.CV 78%

UARE: A Unified Vision-Language Model for Image Quality Assessment, Restoration, and Enhancement

UARE:面向图像质量评估、修复和增强的统一视觉-语言模型

Weiqi Li, Xuanyu Zhang, Bin Chen, Jingfen Xie, Yan Wang, Kexin Zhang, Junlin Li, Li Zhang, Jian Zhang, Shijie Zhao

机构 * School of Electronic and Computer Engineering, Peking University, 2 ByteDance Inc(1 电子与计算机工程学院,北京大学,2 字节跳动公司)

专题命中 评测与基准 :language model(title,abstract)

AI总结 UARE是首个统一视觉-语言模型,通过统一训练框架提升图像质量评估、修复和增强性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06432 2025-12-09 cs.MA 78%

HiveMind: Contribution-Guided Online Prompt Optimization of LLM Multi-Agent Systems

HiveMind: 基于贡献的LLM多智能体系统的在线提示优化

Yihan Xia, Taotao Wang, Shengli Zhang, Zhangyuhua Weng, Bin Cao, Soung Chang Liew

专题命中 评测与基准 :LLM(title,abstract)

AI总结 HiveMind通过基于贡献的在线提示优化,提升LLM多智能体协作效率,利用DAG-Shapley算法显著降低LLM调用成本,同时保持归因准确性。

Comments This paper was accepted to AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06014 2025-12-09 cs.CV 78%

Benchmarking CXR Foundation Models With Publicly Available MIMIC-CXR and NIH-CXR14 Datasets

基于公开的MIMIC-CXR和NIH-CXR14数据集评估CXR基础模型

Jiho Shin, Dominic Marshall, Matthieu Komorowski

机构 * Imperial College London(帝国理工学院伦敦分校)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本文评估了两种CXR基础模型在不同数据集上的性能,发现MedImageInsight在多数任务表现更优,而CXR-Foundation具有良好的跨数据集稳定性,强调了标准化评估的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04686 2025-12-09 cs.CV 78%

Towards Cross-View Point Correspondence in Vision-Language Models

面向视觉-语言模型的跨视图点对应研究

Yipu Wang, Yuheng Ji, Yuyang Liu, Enshen Zhou, Ziqiang Yang, Yuxuan Tian, Ziheng Qin, Yue Liu, Huajie Tan, Cheng Chi, Zhiyuan Ma, Daniel Dajun Zeng, Xiaolong Zheng

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Beihang University(北航大学) Jilin University(吉林大学) National University of Singapore(新加坡国立大学) Peking University(北京大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Huazhong University of Science And Technology(华中科技大学)

专题命中 评测与基准 :language model(title,abstract)

AI总结 本文提出跨视图点对应任务和 CrossPoint-Bench 基准,通过 CroPond 模型在 CrossPoint-Bench 上取得超越 Gemini-2.5-Pro 的准确率,推动跨视图对应研究发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07186 2025-12-09 cs.CV cs.AI 77%

START: Spatial and Textual Learning for Chart Understanding

START: 空间与文本学习用于图表理解

Zhuoming Liu, Xiaofeng Gao, Feiyang Niu, Qiaozi Gao, Liu Liu, Robinson Piramuthu

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Amazon AGI(亚马逊人工智能实验室) MIT(麻省理工学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 START通过空间与文本学习提升图表理解能力,引入图表元素定位和图表到代码生成,增强多模态大语言模型对图表结构和数据细节的理解。

Comments WACV2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏