arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32208 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32208 篇

2604.12064 2026-04-15 cs.CR cs.SE 89%

LLM-Redactor: An Empirical Evaluation of Eight Techniques for Privacy-Preserving LLM Requests

LLM-Redactor: 对八种隐私保护LLM请求技术的实证评估

Justice Owusu Agyemang, Jerry John Kponyo, Elliot Amponsah, Godfred Manu Addo Boakye, Kwame Opuni-Boachie Obour Agyekum

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 本文评估了八种隐私保护LLM请求技术,发现组合A+B+C在保护PII和专有代码方面效果最佳,提出基于威胁模型的决策规则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20555 2026-03-16 cs.CR 89%

PILOT: Command-line Interface Fuzzing via Path-Guided, Iterative Large Language Model Prompting

PILOT:通过路径引导、迭代式大语言模型提示进行命令行界面模糊测试

Momoko Shiraishi, Yinzhi Cao, Takahiro Shinagawa

专题命中 评测与基准 :large language model(title);language model(title);prompting(title);LLM(abstract)

AI总结 PILOT通过引导路径和迭代式大语言模型提示生成命令行参数和输入文件,提升模糊测试覆盖率并发现51个零日漏洞。

Comments Accepted at the 47th IEEE Symposium on Security and Privacy (IEEE S&P 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00082 2025-12-02 cs.CV 89%

Exploring Diagnostic Prompting Approach for Multimodal LLM-based Visual Complexity Assessment: A Case Study of Amazon Search Result Pages

探索用于多模态大语言模型视觉复杂性评估的诊断提示方法:亚马逊搜索结果页面案例研究

Divendar Murtadak, Yoon Kim, Trilokya Akula

专题命中 评测与基准 :prompting(title,abstract);LLM(title,comments);large language model(abstract);language model(abstract)

AI总结 本研究通过对比诊断提示与传统提示方法,发现其在提升多模态大语言模型对亚马逊搜索结果页面视觉复杂性评估的可靠性方面有显著改进,但仍有待进一步优化。

Comments 9 pages, 4 figures, 9 tables. Study on diagnostic prompting for multimodal LLM-based visual complexity assessment of Amazon search result pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11076 2025-06-16 cs.SE 89%

DCE-LLM: Dead Code Elimination with Large Language Models

Minyu Chen, Guoqiang Li, Ling-I Wu, Ruibang Liu

专题命中 评测与基准 :LLM(title,abstract);large language model(title);language model(title)

Comments Accepted by regular paper in NAACL 2025, with 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05080 2025-04-01 cs.CL cs.AI cs.LG 89%

ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery

Ziru Chen, Shijie Chen, Yuting Ning, Qianheng Zhang, Boshi Wang, Botao Yu, Yifei Li, Zeyi Liao, Chen Wei, Zitong Lu, Vishal Dey, Mingyi Xue, Frazier N. Baker, Benjamin Burns, Daniel Adu-Ampratwum, Xuhui Huang, Xia Ning, Song Gao, Yu Su, Huan Sun

专题命中 评测与基准 :language agent(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

Comments ICLR 2025. 60 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.05658 2023-11-20 cs.RO cs.AI cs.CL cs.CV cs.LG 89%

TidyBot: Personalized Robot Assistance with Large Language Models

Jimmy Wu, Rika Antonova, Adam Kan, Marion Lepert, Andy Zeng, Shuran Song, Jeannette Bohg, Szymon Rusinkiewicz, Thomas Funkhouser

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to Autonomous Robots (AuRo) - Special Issue: Large Language Models in Robotics, 2023 and IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), 2023. Project page: https://tidybot.cs.princeton.edu

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.09419 2023-05-02 cs.AI cs.CL cs.LG 89%

A Comprehensive Survey on Pretrained Foundation Models: A History from BERT to ChatGPT

Ce Zhou, Qian Li, Chen Li, Jun Yu, Yixin Liu, Guangjing Wang, Kai Zhang, Cheng Ji, Qiben Yan, Lifang He, Hao Peng, Jianxin Li, Jia Wu, Ziwei Liu, Pengtao Xie, Caiming Xiong, Jian Pei, Philip S. Yu, Lichao Sun

专题命中 评测与基准 :foundation model(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

Comments 99 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14982 2024-02-06 cs.CL cs.AI 89%

LAraBench: Benchmarking Arabic AI with Large Language Models

Ahmed Abdelali, Hamdy Mubarak, Shammur Absar Chowdhury, Maram Hasanain, Basel Mousi, Sabri Boughorbel, Yassine El Kheir, Daniel Izham, Fahim Dalvi, Majd Hawasly, Nizi Nazar, Yousseif Elshahawy, Ahmed Ali, Nadir Durrani, Natasa Milic-Frayling, Firoj Alam

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI;foundation model(comments)

Comments Foundation Models, Large Language Models, Arabic NLP, Arabic Speech, Arabic AI, GPT3.5 Evaluation, USM Evaluation, Whisper Evaluation, GPT-4, BLOOMZ, Jais13b

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22068 2026-08-25 cs.AI cs.CE 新提交 89%

Decision-Support and Modeling with Large Language Models for Geothermal Well Arrays

面向地热井阵列的大型语言模型决策支持与建模

Edwin Ouko, Emmanuel Lujan, Alan Edelman, Robert Metcalfe

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本研究评估ChatGPT等前沿LLMs在地热领域的应用潜力,提出用NotebookLM加速生成地热基准,分析地热井阵列等技术的机遇,还展示了LLMs助力地热数值模型自动并行化的案例。

Comments 10 pages, 8 figures. Presented at the 50th Workshop on Geothermal Reservoir Engineering, Stanford University, February 10-12, 2025

Journal ref Proceedings of the 50th Workshop on Geothermal Reservoir Engineering, Stanford University, SGP-TR-229 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05346 2026-08-25 cs.AI 版本更新 89%

Beyond Benchmarking: Scenario-Based Evaluation of Large Language Models for Personalized Learning

超越基准测试:面向个性化学习的大语言模型场景化评估

Bo Yuan, Jiazi Hu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本研究提出场景化评估框架,以Gemini为外部评估器结合Bradley-Terry模型等,发现不同LLMs在个性化学习场景中教学行为存在差异,为AI增强教育提供有意义的模型行为信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00020 2026-08-20 cs.AR cs.AI 版本更新 89%

Large Language Model for Verilog Code Generation: Literature Review and the Road Ahead

用于Verilog代码生成的大型语言模型:文献综述与未来方向

Guang Yang, Wei Zheng, Xiang Chen, Dong Liang, Peng Hu, Yukui Yang, Shaohang Peng, Zhenghan Li, Jiahui Feng, Xiao Wei, Kexin Sun, Deyuan Ma, Haotian Cheng, Yiheng Shen, Xing Hu, Terry Yue Zhuo, David Lo

机构 * Zhejiang University \& Northwestern Polytechnical University China Northwestern Polytechnical University China Nantong University China Zhejiang University China Monash University Australia Singapore Management University Singapore Zhejiang University \& Northwestern Polytechnical University Northwestern Polytechnical University Nantong University Zhejiang University Monash University Singapore Management University

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文综述了LLMs在Verilog代码生成中的应用,分析了现有方法的有效性、局限性及未来研究方向。

Comments Accept in ACM Computing Surveys

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14622 2026-08-18 cs.AI 新提交 89%

A Human-Centred Approach to Benchmarking LLMs for Parenting Advice

以人为中心的基准测试大型语言模型(LLM)育儿建议方法

Yunke Zhao, Isobel Voysey, Alastair van Heerden, Rob Hughes, Jun Zhao

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文以育儿专家的多维度评分为标准,采用LLM作为评判者,评估15个LLM在100个育儿场景中英、中文的表现,发现聚合分数掩盖弱点、模型隐性影响育儿风格等,为相关应用提供见解。

Comments 15 pages. Submitted for review

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00177 2026-08-17 cond-mat.mtrl-sci cs.CL 89%

LLM4Mat-Bench: Benchmarking Large Language Models for Materials Property Prediction

Andre Niyongabo Rubungo, Kangming Li, Jason Hattrick-Simpers, Adji Bousso Dieng

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments Accepted at NeurIPS 2024-AI4Mat Workshop. The Benchmark and code can be found at https://github.com/vertaix/LLM4Mat-Bench

Journal ref 2025 Mach. Learn.: Sci. Technol. 6 020501

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16009 2026-08-10 cs.AI 版本更新 89%

MEDLEY-BENCH: Benchmarking Behavioural Metacognition and Belief Revision Under Social Pressure in Large Language Models

MEDLEY-BENCH:在AI元认知中规模购买评估但不控制

Farhad Abtahi, Abdolamir Karbalaie, Eduardo Illueca-Fernandez, Fernando Seoane

机构 * Department of Clinical Science, Intervention and Technology (CLINTEC), Karolinska Institutet(临床科学、干预与技术部门(CLINTEC),Karolinska研究所) Department of Clinical Physiology, Karolinska University Hospital(临床生理学部门,Karolinska大学医院) Department of Biomedical Engineering and Health Systems, KTH Royal Institute of Technology(生物医学工程与健康系统部门,KTH皇家理工学院) Department of Textile Technology, University of Borås(纺织技术部门,Borås大学) Department of Medical Technologies, Karolinska University Hospital(医学技术部门,Karolinska大学医院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 MEDLEY-BENCH评估了12种模型家族中35个模型在五个领域130个模糊实例上的行为元认知能力,发现评估能力随模型规模增加而增强,但控制能力不增加,揭示了元认知能力与规模无关的结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05208 2026-08-10 cs.CV cs.LG 版本更新 89%

Symbolic Graphics Programming with Large Language Models

基于大语言模型的符号图形编程

Yamei Chen, Haoquan Zhang, Yangyi Huang, Zeju Qiu, Kaipeng Zhang, Yandong Wen, Weiyang Liu

机构 * The Chinese University of Hong Kong(香港中文大学) Westlake University(西湖大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.LG

AI总结 本文针对大语言模型生成符号图形程序(SGP)能力不足的问题,提出带可验证奖励的强化学习方法,在Qwen-2.5-7B上实现与前沿系统相当的SVG生成性能,揭示SGP是跨模态 grounding 的有效视角。

Comments Accepted by Transactions on Machine Learning Research. (32 pages, 12 figures.) This version refines the paper structure, adds experimental results. Project page: https://spherelab.ai/SGP-Gen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03259 2026-08-07 cs.CL 版本更新 89%

Zero-Shot Multi-Disease Labeling of Chest, Abdomen, and Pelvis CT Reports Using Open-Weight Large Language Models: The Effect of Labeling Conventions

评估大型语言模型在跨器官系统CT放射报告零样本疾病标注中的效果

Michael E. Garcia-Alcoser, Mobina Ghojoghnejad, Fakrul Islam Tushar, David Kim, Kyle J. Lafata, Geoffrey D. Rubin, Joseph Y. Lo

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

AI总结 本研究评估了大型语言模型在CT报告零样本疾病标注中的效果,发现轻量级LLMs在多器官系统标注中表现优于规则方法,但需注意二元标签的局限性。

Comments 19 pages, 6 figures, 4 tables. Under review in Radiology: Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22256 2026-08-07 cs.SE cs.AI 版本更新 89%

Agentic Software Issue Resolution with Large Language Models: A Survey

基于大语言模型的代理软件问题解决:综述

Zhonghao Jiang, David Lo, Zhongxin Liu

机构 * The State Key Laboratory of Blockchain and Data Security, Zhejiang University(区块链与数据安全国家重点实验室,浙江大学) School of Computing and Information Systems, Singapore Management University(计算与信息系统学院,新加坡管理大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文综述了基于大语言模型的代理软件问题解决的最新研究,探讨了其方法、挑战及未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04828 2026-08-06 cs.CL 新提交 89%

Skill-Use: Can LLMs Actually Use Skills in Agentic Harnesses?

技能使用:智能体框架中的大语言模型(LLM)真的能使用技能吗?

Jinyi Han, Yuanjian Xu, Ying Liao, Xinyi Wang, Zishang Jiang, Zixiang Di, Fanyang Lu, Zhichao Hu, Yanghua Xiao

机构 * East China Normal University(华东师范大学) Hong Kong University of Science and Technology(香港科技大学) Fudan University(复旦大学) Tencent Hunyuan(腾讯混元)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究推出Skill-Use基准,评估智能体在渐进式披露下的技能使用,发现8个LLM在两个框架下的SU分数仅0.613,技能使用是依赖框架的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25186 2026-08-06 cs.CL 版本更新 89%

CardioBench: A Real-World Data Benchmark for Evaluating Large Language Models in Clinically Authentic Cardiovascular Care Scenarios

MyoCardBench:用于评估临床真实心血管护理场景中大型语言模型的真实世界数据基准

Xiao Li, Mouxiao Bian, Zhaodi Wu, Sijie Ren, Juechen Chen, Lu Lu, Jingru Ding, Yun Zhong, Jie Xu, Yixiu Liang, Junbo Ge

机构 * Shanghai Institute of Cardiovascular Diseases(上海市心血管病研究所) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Minhang Hospital, Fudan University(复旦大学附属闵行医院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 该研究开发MyoCardBench真实世界基准评估大语言模型在心血管护理场景的性能,涵盖多任务数据集,经专家注释审核。7个模型在零样本设置下输出,GPT-5.4表现最佳。此基准为评估模型提供框架,助于发现优势与不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03512 2026-08-05 cs.AI 新提交 89%

Reversing Arrows in Large Language Models

反转大语言模型中的箭头

Sefika Efeoglu, Adrian Paschke

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.AI

AI总结 本研究首次系统探究大语言模型的反向关系方向性,用含5457个实例的基准评估5种开源模型,发现其反向关系分类存在不对称性,关系描述与实体表示会影响性能。

Comments The preprint is under review in a venue

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03154 2026-08-05 cs.CL 新提交 89%

ANCHOR-RE: An Agentic Neuro-Symbolic Framework for Grounded Biomedical Relation Extraction

ANCHOR-RE:用于接地生物医学关系抽取的智能体神经符号框架

Shufan Ming, Yikun Han, Gibong Hong, Rui Zhang, Halil Kilicoglu

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 该研究提出ANCHOR-RE框架,将本体引导推理等集成到LLM推理中,在多个BioRE基准及2026年生物医学文章数据集上,该框架性能优于直接LLM提示及部分现有方法,是实用的无训练生物医学文献挖掘方法。

Comments Submitted to Journal of Biomedical Informatics (under review)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01292 2026-08-04 cs.CL 新提交 89%

CrossLex: A Source-Grounded Benchmark for Cross-Jurisdictional Legal Reasoning in Large Language Models

CrossLex:面向大语言模型跨司法辖区法律推理的、基于法律来源的基准测试集

Xiaocui Yang, Xican Tan, Shoujie Chen, Shihan Xiao, Keke Tong, Xinyu Zhou

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL

AI总结 本文提出基于中、加州、德三国法律来源的CrossLex基准测试集,定义三项任务并提出联合评估指标,发现大语言模型在跨司法辖区法律推理上存在不足,旨在推动相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14191 2026-08-04 cs.CR cs.CL 89%

S-Eval: Towards Automated and Comprehensive Safety Evaluation for Large Language Models

Xiaohan Yuan, Jinfeng Li, Dongxia Wang, Yuefeng Chen, Xiaofeng Mao, Longtao Huang, Jialuo Chen, Hui Xue, Xiaoxia Liu, Wenhai Wang, Kui Ren, Jingyi Wang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments Accepted by ISSTA 2025

Journal ref Proceedings of the ACM on Software Engineering, Vol. 2, ISSTA, pp. 2136-2157, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28137 2026-07-31 cs.CY cs.AI 新提交 89%

Asymmetric Communication: Large Language Models and Language Games

非对称通信:大语言模型与语言游戏

Enzo Fenoglio

专题命中 评测与基准 :language model(title,abstract);large language model(title);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文通过提出非对称通信框架,纠正了AI讨论对大语言模型的错误属性投射,将相关现象重新归类为接收方一侧的现象,为AI治理提供了启示,明确对齐是制度约束工程,责任归人类机构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25620 2026-07-29 cs.AI cs.HC 新提交 89%

Beyond Epistemia: Epistemic Schizologia and Large Language Models as Techno-Semiotic Machines

超越认知:认知分裂症与作为技术符号机器的大语言模型

Federico Cabitza, Gianluca Colombo

机构 * Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 研究大语言模型输出致“认知症”现象,挑战其解释框架。借鉴相关哲学,将大语言模型视为技术符号机器,指出“认知症”是“认知分裂症”后果,强调相关单元是整个实践,为新设计方案奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25375 2026-07-29 cs.CL 新提交 89%

Inspect India Evals: An Open Benchmarking Framework for Evaluating Large Language Models in the Indian Linguistic and Cultural Context

印度评估:一个在印度语言和文化背景下评估大语言模型的开放基准框架

Abhishek Kumar Singh, Shrey Nag, Sachita, Lipi Goel, Rajeshwar Singh Janwar

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 Inspect India Evals是在印度语言文化背景下评估大语言模型的开放框架,基于Inspect AI平台构建,含六个基准。测试五个模型,Sarvam-M 24B和Gemma 2 27B表现最佳,各模型在多语言安全测试中表现一致,DPI安全得分有差异,框架公开可扩展。

Comments 19 pages, 9 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24515 2026-07-29 cs.CL 版本更新 89%

Systematic Analysis of Large Language Models and Transformer-Based Machine Translation for English-Tamil and Tamil-English Across Diverse Datasets

跨不同数据集对英语-泰米尔语和泰米尔语-英语的大语言模型和基于Transformer的机器翻译的系统分析

Sriharshaa S, Sangeetha Sivanesan, Jaya Nirmala S

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

AI总结 研究针对泰米尔语等低资源语言机器翻译挑战,在多数据集上评估多种模型,用BLEU等指标分析其性能,通过注意力分析增强可解释性,证明上下文提示可实现少样本翻译并与监督方法比较,揭示数据集及领域匹配对模型性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23538 2026-07-28 cs.CL 新提交 89%

Guiding Language Models to Be More Empathetic: Culturally Sensitive Mental Health Advice Generation Through Human-LLM Collaboration

引导语言模型更具同理心:通过人机协作生成具有文化敏感性的心理健康建议

Fatema Tuj Johora Faria, Mukaffi Bin Moin, Md. Mahfuzur Rahman, Khan Md Hasib, Jubayer Al Mahmud, M. F. Mridha

机构 * Ahsanullah University of Science and Technology(阿山努拉科技大学) Bangladesh University of Business and Technology(孟加拉国商业与技术大学) The University of New South Wales(新南威尔士大学) Jashore University of Science and Technology(贾绍尔科技大学) American International University - Bangladesh(孟加拉国美国国际大学)

专题命中 评测与基准 :language model(title,abstract);LLM(title);large language model(abstract);prompting(abstract)

AI总结 研究探索大语言模型在低资源语言中生成同理心心理健康建议的能力,提出角色扮演反思性思维链咨询框架和基于Grok 4的评估框架,通过人机协作及特定策略,提升心理健康建议质量,使其更符合专业咨询。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17636 2026-07-28 cs.CL 版本更新 89%

Measuring Negative Campaigning across Languages with Large Language Models: A Study of 18 Million Tweets in 19 Countries

使用大语言模型衡量跨语言的负面竞选活动:对19个国家1800万条推文的研究

Victor Hartman, Petter Törnberg

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 该研究利用大语言模型对19个国家1800万条推文进行分析,评估其用于负面竞选跨语言分类的可行性。通过此方法进行跨国研究,基于战略激励框架得出不同类型政党负面竞选程度不同的结论,为相关研究提供新证据并展示了大语言模型的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20471 2026-07-24 cs.AI 新提交 89%

Benchmarking the Personalization Capabilities of Large Language Models

大型语言模型个性化能力的基准测试

Ashutosh Srivastava, Siddharth Yedlapati, Vinay Aggarwal, Yaman Kumar Singla, Shashwat Dixit, Jitendra Ajmera, Balaji Krishnamurthy

机构 * Adobe Media & Data Science Research(Adobe媒体与数据科学研究)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 研究大型语言模型个性化能力,将贝叶斯说服框架应用于生成式智能体并实例化到销售场景,发布SDR-Bench语料库,发现个性化存在平台期,通过现场部署验证框架,还公开了SDR-Arena和SDR-Bench以支持相关可重复研究。

详情

展开后加载摘要…

URL PDF HTML 收藏