arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-06 至 2026-01-06 共收录 71 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 71 篇

2601.02002 2026-01-06 cs.IR cs.AI cs.CL 91%

Exploring Approaches for Detecting Memorization of Recommender System Data in Large Language Models

探索用于检测大型语言模型中推荐系统数据记忆的方法

Antonio Colacicco, Vito Guida, Dario Di Palma, Fedelucio Narducci, Tommaso Di Noia

机构 * Politecnico di Bari(巴里理工大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文提出三种方法探索大型语言模型中推荐系统数据记忆的检测,发现自动优化提示是提取记忆样本最有效的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02060 2026-01-06 cs.PL cs.AI cs.SE 89%

Perish or Flourish? A Holistic Evaluation of Large Language Models for Code Generation in Functional Programming

perish 或 flourish? 对于函数式编程中代码生成的大型语言模型的全面评估

Nguyet-Anh H. Lang, Eric Lang, Thanh Le-Cong, Bach Le, Quyet-Thang Huynh

机构 * Hanoi University of Science and Technology(河内科学技术大学) The University of Melbourne(墨尔本大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出FPEval框架,评估大型语言模型在函数式编程语言中的代码生成能力,发现模型性能随进步而提升,但纯函数式语言错误率较高,且生成代码风格问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00867 2026-01-06 cs.CR cs.AI cs.CY cs.HC 89%

The Silicon Psyche: Anthropomorphic Vulnerabilities in Large Language Models

硅之心:大型语言模型中的人格化脆弱性

Giuseppe Canale, Kashyap Thimmaraju

机构 * CPF3.org(CPF3组织) Flowguard Institute(Flowguard研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出LLMs继承人类心理脆弱性,通过心理测量框架揭示其对权威操纵等攻击的易受性,呼吁开发心理防火墙以保护AI安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04214 2026-01-06 cs.CR 89%

Can Large Language Models Automate the Refinement of Cellular Network Specifications?

大语言模型能否自动化细胞网络规范的细化?

Jianshuo Dong, Yuanjie Li, Jun Liu, Hewu Li, Han Qiu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文研究了大语言模型在自动化细胞网络规范细化中的应用,通过CR-Eval基准测试验证了模型的有效性,并展示了LLM专业化在提升性能方面的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14716 2026-01-06 cs.LG cs.AI cs.CL 89%

A Systematic Survey on Large Language Models for Algorithm Design

大型语言模型在算法设计中的系统性调研

Fei Liu, Yiming Yao, Ping Guo, Zhiyuan Yang, Zhe Zhao, Xi Lin, Xialiang Tong, Kun Mao, Zhichao Lu, Zhenkun Wang, Mingxuan Yuan, Qingfu Zhang

机构 * City University of Hong Kong(香港城市大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Xi'an Jiaotong University(西安交通大学) Huawei Cloud EI Service Product Dept.(华为云EI服务产品部) Southern University of Science(南方科技大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文系统性地综述了大型语言模型在算法设计中的应用,提出分类法分析其角色并指出未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22535 2026-01-06 cs.AI cs.CL 88%

OFFSIDE: Benchmarking Unlearning Misinformation in Multimodal Large Language Models

OFFSIDE: 多模态大语言模型中误信信息消除的基准测试

Hao Zheng, Zirui Pang, Ling li, Zhijie Deng, Yuhan Pu, Zhaowei Zhu, Xiaobo Xia, Jiaheng Wei

机构 * Harbin Institute of Technology(哈尔滨工业大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) BIAI, ZJUT & D5Data.ai(BIAI、浙江工业大学及D5Data.ai) National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 OFFSIDE通过足球转会谣言数据集,评估多模态大语言模型中误信信息消除的挑战与方法,揭示现有技术的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02186 2026-01-06 cs.CL 88%

Toward Global Large Language Models in Medicine

迈向医学领域的全球大语言模型

Rui Yang, Huitao Li, Weihao Xuan, Heli Qi, Xin Li, Kunyu Yu, Yingjian Chen, Rongrong Wang, Jacques Behmoaras, Tianxi Cai, Bibhas Chakraborty, Qingyu Chen, Lionel Tim-Ee Cheng, Marie-Louise Damwanza, Chido Dzinotyiwei, Aosong Feng, Chuan Hong, Yusuke Iwasawa, Yuhe Ke, Linah Kitala, Taehoon Ko, Jisan Lee, Irene Li, Jonathan Chong Kai Liew, Hongfang Liu, Lian Leng Low, Edison Marrese-Taylor, Yutaka Matsuo, Isheanesu Misi, Yilin Ning, Jasmine Chiat Ling Ong, Marcus Eng Hock Ong, Enrico Petretto, Hossein Rouhizadeh, Abiram Sandralegar, Oren Schreier, Iain Bee Huat Tan, Patrick Tan, Daniel Shu Wei Ting, Junjue Wang, Chunhua Weng, Matthew Yu Heng Wong, Fang Wu, Yunze Xiao, Xuhai Xu, Qingcheng Zeng, Zhuo Zheng, Yifan Peng, Douglas Teodoro, Nan Liu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出GlobMed数据集和GlobMed-LLMs模型,通过多语言医学任务评估,提升低资源语言医疗信息处理能力。

Comments 182 pages, 65 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12595 2026-01-06 cs.CV 88%

Vision-Enhanced Large Language Models for High-Resolution Image Synthesis and Multimodal Data Interpretation

增强视觉能力的大型语言模型用于高分辨率图像合成和多模态数据解释

Karthikeya KV

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本研究提出了一种增强视觉能力的大型语言模型,通过整合修正流机制和混合序列建模方法,实现高分辨率图像合成和多模态数据解释的高效生成与高质量输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06142 2026-01-06 cs.CV 88%

SDEval: Safety Dynamic Evaluation for Multimodal Large Language Models

SDEval: 多模态大语言模型的安全动态评估

Hanqing Wang, Yuan Tian, Mingyu Liu, Zhenhao Zhang, Xiangyang Zhu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 SDEval通过动态调整安全基准分布和复杂度,提升多模态大语言模型的安全评估效果,缓解数据污染并揭示模型安全局限。

Comments AAAI 2026 poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00836 2026-01-06 physics.soc-ph cs.CY 88%

ESG Beliefs of Large Language Models: Evidence and Impact

大语言模型的ESG信念:证据与影响

Tong Li, Luping Yu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 研究发现大语言模型具有系统性的ESG信念,其对ESG的重视程度高于人类投资者,且影响分析师对高ESG公司的乐观态度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01862 2026-01-06 cs.CL cs.IR 87%

Judging with Personality and Confidence: A Study on Personality-Conditioned LLM Relevance Assessment

带个性与自信的判断:关于基于个性的LLM相关性评估的研究

Nuo Chen, Hanpei Fang, Piaohong Wang, Jiqun Liu, Tetsuya Sakai, Xiao-Ming Wu

机构 * The Hong Kong Polytechnic University(香港理工大学) Waseda University(早稻田大学) City University of Hong Kong(香港城市大学) The University of Oklahoma(俄克拉荷马大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究探讨了基于人格的LLM相关性评估,发现不同人格特质影响置信度和相关性判断,通过随机森林分类器提升评估性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00930 2026-01-06 cs.IR cs.AI 87%

AlignUSER: Human-Aligned LLM Agents via World Models for Recommender System Evaluation

AlignUSER: 通过世界模型对齐LLM代理以评估推荐系统

Nicolas Bougie, Gian Maria Marconi, Tony Yip, Narimasa Watanabe

机构 * Woven by Toyota(丰田织物)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 AlignUSER通过世界模型驱动的代理学习,利用人类交互数据提升推荐系统评估的准确性与真实用户行为的对齐程度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22458 2026-01-06 cs.CL cs.AI 86%

Evaluating LLM-based Agents for Multi-Turn Conversations: A Survey

评估基于大语言模型的代理在多轮对话中的性能:一项调查

Shengyue Guan, Jindong Wang, Jiang Bian, Bin Zhu, Jian-guang Lou, Haoyi Xiong

机构 * Microsoft(微软)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种基于PRISMA框架的系统方法,用于评估多轮对话中基于LLM的代理,通过两个分类系统定义评估内容和方法,涵盖任务完成、响应质量等关键维度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01751 2026-01-06 cs.IR cs.AI cs.CL 86%

Query-Document Dense Vectors for LLM Relevance Judgment Bias Analysis

用于LLM相关性判断偏差分析的查询-文档密集向量

Samaneh Mohtadi, Gianluca Demartini

机构 * The University of Queensland, Brisbane, Australia(昆士兰大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种基于聚类的框架,用于分析LLM在相关性判断中的系统性偏差,通过语义空间嵌入识别分歧模式,提升IR评估的可靠性。

Comments Accepted for presentation at the ECIR 2026 Full Papers track

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09082 2026-01-06 cs.CL cs.AI 86%

CoSER: A Comprehensive Literary Dataset and Framework for Training and Evaluating LLM Role-Playing and Persona Simulation

CoSER:一个综合的文学数据集和框架,用于训练和评估LLM角色扮演和人设模拟

Xintao Wang, Heng Wang, Yifei Zhang, Xinfeng Yuan, Rui Xu, Jen-tse Huang, Siyu Yuan, Haoran Guo, Jiangjie Chen, Shuchang Zhou, Wei Wang, Yanghua Xiao

机构 * Fudan University(复旦大学) StepFun Johns Hopkins University(约翰霍普金斯大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);language agent(abstract)

AI总结 CoSER通过高质量文学数据集和开放模型,训练和评估LLM角色扮演能力,其70B模型在多个基准测试中超越GPT-4o。

Comments Accepted by ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00912 2026-01-06 cs.IR cs.AI 85%

The Discovery Gap: How Product Hunt Startups Vanish in LLM Organic Discovery Queries

发现鸿沟:产品猎奇初创企业如何在LLM有机发现查询中消失

Amit Prakash Sharma

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究发现,初创企业在LLM有机发现查询中难以被识别,传统SEO信号比AI优化更有效。

Comments 20 pages, 7 figures. Based on M.Tech thesis research, Indian Institute of Technology Patna, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24052 2026-01-06 cs.SD cs.AI cs.CL cs.MM 84%

AHA: Aligning Large Audio-Language Models for Reasoning Hallucinations via Counterfactual Hard Negatives

AHA: 通过反事实硬负样本对齐大音频-语言模型以缓解推理幻觉

Yanxi Chen, Wenhui Zhu, Xiwen Chen, Zhipeng Wang, Xin Li, Peijie Qiu, Hao Wang, Xuanzhao Dong, Yujian Xiong, Anderson Schneider, Yuriy Nevmyvaka, Yalin Wang

机构 * Arizona State University(亚利桑那州立大学) Clemson University(克莱姆斯大学) Washington University in St.Louis(圣路易斯华盛顿大学) Rice University(Rice 大学) Morgan Stanley(摩根大通)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 AHA通过反事实硬负样本对齐大音频-语言模型,有效减少推理幻觉,提升时间推理能力,并在多个基准测试中取得显著成效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25743 2026-01-06 cs.LG cs.CL 84%

Rotation Control Unlearning: Quantifying and Controlling Continuous Unlearning for LLM with The Cognitive Rotation Space

旋转控制反学习:量化和控制LLM连续反学习的连续反学习的认知旋转空间

Xiang Zhang, Kun Wei, Xu Yang, Jiahua Li, Su Yan, Cheng Deng

机构 * School of Electronic Engineering, Xidian University(电子工程学院)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出旋转控制反学习方法,通过认知旋转空间量化和控制连续反学习过程,有效解决累积灾难性效用损失问题,并在无保留数据集的情况下实现SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09665 2026-01-06 cs.SI cs.CL 83%

Tales of the 2025 Los Angeles Fire: Hotwash for Public Health Concerns in Reddit via LLM-Enhanced Topic Modeling

2025年洛杉矶火灾故事:通过LLM增强的专题建模在Reddit上进行公共健康担忧的热洗

Sulong Zhou, Qunying Huang, Shaoheng Zhou, Yun Hang, Xinyue Ye, Aodong Mei, Kathryn Phung, Yuning Ye, Uma Govindswamy, Zehan Li

机构 * Department of Landscape Architecture and Urban Planning & Urban Artificial Intelligence Lab, Texas A&M University(景观建筑与城市规划系及城市人工智能实验室,德克萨斯农工大学) Geography, University of Wisconsin-Madison(地理系,威斯康星大学麦迪逊分校) Google(谷歌) Department of Environmental and Occupational Health Sciences, School of Public Health, University of Texas Health Science Center at Houston(环境与职业健康科学系,公共卫生学院,德克萨斯健康科学中心休斯顿分部) McWilliams School of Biomedical Informatics, University of Texas Health Science Center at Houston(麦克威廉斯生物医学信息学学院,德克萨斯健康科学中心休斯顿分部)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究通过LLM增强的专题建模分析2025年洛杉矶野火期间Reddit上的公众言论,识别出公共健康担忧和心理健康风险,构建了分层框架用于危机话语分析。

Comments Fix typos in Method Section. Add data/code availability

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01366 2026-01-06 cs.AI 83%

KGCE: Knowledge-Augmented Dual-Graph Evaluator for Cross-Platform Educational Agent Benchmarking with Multimodal Language Models

KGCE:基于多模态语言模型的跨平台教育代理基准评估知识增强双图评估器

Zixian Liu, Sihao Liu, Yuqi Zhao

机构 * Faculty of the School of Computer Science, Central China Normal University(中央财经大学计算机学院)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 KGCE提出一种基于多模态语言模型的跨平台教育代理基准评估框架,通过知识库增强和双图评估方法提升对特定学校软件任务的执行效率和评估精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02337 2026-01-06 cs.CL 81%

Robust Persona-Aware Toxicity Detection with Prompt Optimization and Learned Ensembling

基于提示优化和学习集成的鲁棒人格感知毒性检测

Berk Atil, Rebecca J. Passonneau, Ninareh Mehrabi

机构 * Pennsylvania State University(宾夕法尼亚州立大学) Resolution

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究提出了一种基于提示优化和学习集成的鲁棒人格感知毒性检测方法,通过系统评估和元集成技术提升不同人格下的毒性检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01844 2026-01-06 cs.AI 81%

Clinical Knowledge Graph Construction and Evaluation with Multi-LLMs via Retrieval-Augmented Generation

基于多语言模型的临床知识图谱构建与评估:通过检索增强生成

Udiptaman Das, Krishnasai B. Atmakuri, Duy Ho, Chi Lee, Yugyung Lee

机构 * University of Missouri–Kansas City(密苏里大学-堪萨斯城分校) California State University, Fullerton(加州州立大学弗雷斯诺分校)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出基于多语言模型的临床知识图谱构建与评估框架,通过检索增强生成策略实现从自由文本到可解释、临床相关知识图谱的端到端构建与持续优化。

Comments 13 pages, 5 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01825 2026-01-06 cs.CL 81%

CSCBench: A PVC Diagnostic Benchmark for Commodity Supply Chain Reasoning

CSCBench: 一种用于商品供应链推理的PVC诊断基准

Yaxin Cui, Yuanqiang Zeng, Jiapeng Yan, Keling Lin, Kai Ji, Jianhui Zeng, Sheng Zhang, Xin Luo, Binzhu Su, Chaolai Shen, Jiahao Yu

机构 * Xiamen SmartChain Innovations Co., Ltd.(厦门智能链创新有限公司) Xiamen ITG Digital Technology Co., Ltd.(厦门ITG数字科技有限公司) Xiamen C&D Co., Ltd.(厦门C&D有限公司) Xiamen Xiangyu Co., Ltd.(厦门翔宇有限公司)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 CSCBench通过PVC 3D评估框架,为商品供应链推理提供诊断基准,评估LLMs在过程、品种和认知轴上的表现,发现其在品种轴上尤其存在显著下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01062 2026-01-06 cs.LG cs.AI cs.CV 81%

SPoRC-VIST: A Benchmark for Evaluating Generative Natural Narrative in Vision-Language Models

SPoRC-VIST:评估视觉语言模型生成自然叙述能力的基准

Yunlin Zeng

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 SPoRC-VIST基准通过合成到现实训练策略评估视觉语言模型生成多说话者播客对话的自然性和深度。

Comments 14 pages, 3 figures. Accepted to WVAQ 2026, WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02215 2026-01-06 cs.SE cs.AI 79%

LLM-Empowered Functional Safety and Security by Design in Automotive Systems

基于大语言模型的汽车系统功能安全与安全设计

Nenad Petrovic, Vahid Zolfaghari, Fengjunjie Pan, Alois Knoll

机构 * European Chips Joint Undertaking(欧洲芯片联合计划) Federal Ministry of Research, Technology and Space of Germany(德国联邦科研、技术和空间 ministry)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 本文提出利用大语言模型提升汽车系统功能安全与安全设计的方法,通过事件链模型和MDE方法实现安全拓扑设计和代码分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01373 2026-01-06 cs.SD cs.AI eess.AS 79%

UltraEval-Audio: A Unified Framework for Comprehensive Evaluation of Audio Foundation Models

UltraEval-Audio: 一个用于音频基础模型全面评估的统一框架

Qundong Shi, Jie Zhou, Biyuan Lin, Junbo Cui, Guoyang Zeng, Yixuan Zhou, Ziyang Wang, Xin Liu, Zhen Luo, Yudong Wang, Zhiyuan Liu

机构 * ModelBest Inc.(ModelBest公司) Tsinghua University(清华大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

AI总结 UltraEval-Audio提出一个统一框架,解决音频模型评估的统一性、编解码器评估和中文基准问题,提供多语言支持和实时排行榜。

Comments 13 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01094 2026-01-06 cs.HC cs.AI cs.IR 79%

SoulSeek: Exploring the Use of Social Cues in LLM-based Information Seeking

SoulSeek:探索在基于大语言模型的信息检索中利用社会线索的使用

Yubo Shu, Peng Zhang, Meng Wu, Yan Chen, Haoxuan Zhou, Guanming Liu, Yu Zhang, Liuxin Zhang, Qianying Wang, Tun Lu, Ning Gu

机构 * Fudan University(复旦大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 SoulSeek通过整合社会线索到基于大语言模型的信息检索中,提升用户感知和反思性信息行为,揭示当前LLM搜索的局限性,并提出设计改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14133 2026-01-06 cs.CL 79%

Performance Gap in Entity Knowledge Extraction Across Modalities in Vision Language Models

视觉语言模型中实体知识提取跨模态性能差距

Ido Cohen, Daniela Gottesman, Mor Geva, Raja Giryes

机构 * Tel Aviv University(特拉维夫大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 研究视觉语言模型在跨模态实体知识提取中的性能差异,揭示信息流动限制及模型推理效率问题。

Comments Accepted to ACL 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00868 2026-01-06 cs.LG cs.AI 79%

SmartFlow Reinforcement Learning and Agentic AI for Bike-Sharing Optimisation

SmartFlow 强化学习与代理AI用于自行车共享优化

Aditya Sreevatsa K, Arun Kumar Raveendran, Jesrael K Mani, Prakash G Shigli, Rajkumar Rangadore, Narayana Darapaneni, Anwesh Reddy Paduri

机构 * Department of Data Science, Machine Learning \& Artificial Intelligence, PES University, Bengaluru, Karnataka - 560100, India 1 Sunrise Setting Ltd, 12a Fore Street, St. Marychurch, Torquay, Devon, TQ1 4NE, UK 2 European Alliance for Innovation (EAI), Gent, Belgium

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 SmartFlow 通过整合强化学习与代理AI,实现城市自行车共享系统的高效再平衡,显著减少网络不平衡并提升运营效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00998 2026-01-06 cs.CV 78%

DVGBench: Implicit-to-Explicit Visual Grounding Benchmark in UAV Imagery with Large Vision-Language Models

DVGBench: 面向无人机影像的隐式到显式视觉 grounding 评估基准

Yue Zhou, Jue Chen, Zilun Zhang, Penghui Huang, Ran Ding, Zhentao Zou, PengFei Gao, Yuchen Wei, Ke Li, Xue Yang, Xue Jiang, Hongxin Yang, Jonathan Li

机构 * Hinton STAI Institute(Hinton STAI研究所) Key Laboratory of Geographic Information Science (Ministry of Education), East China Normal University(地理信息科学重点实验室(教育部)) School of Geospatial Artificial Intelligence, East China Normal University(地理空间人工智能学院) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学) Information Engineering University(信息工程大学)

专题命中 评测与基准 :language model(title,abstract)

AI总结 DVGBench 是一个面向无人机影像的隐式到显式视觉 grounding 评估基准,通过设计 DroneVG-R1 模型提升 LVLM 的推理能力。

Comments 20 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏