arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1423 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 1423 篇

2608.03508 2026-08-14 cs.CV 版本更新 85%

From Multi-Resolution Cells to Gigapixel Whole Slide Images Foundation Model for Computational Pathology

从多分辨率细胞到千兆像素全切片图像:用于计算病理学的基础模型

Basit Alawode, Moshira Ali Abdalla, Dwarikanath Mahapatra, Muzammal Naseer, Sajid Javed

专题命中 评测与基准 :foundation model(title,abstract);large language model(abstract);language model(abstract)

AI总结 针对现有计算病理学模型泛化性受限的问题,提出多分辨率金字塔Transformer(MRPT),经多分辨率自监督预训练后,在34个数据集的多项任务中性能优于同类模型与多模态大语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25005 2026-08-14 cs.SE 版本更新 85%

Error Understanding in Program Code: A Systematic Study of LLM-DL Combinations for Multi-label Classification

利用LLM-DL进行程序代码错误理解的多标签分类

Md Faizul Ibne Amin, Yutaka Watanobe, Md. Mostafizer Rahman, Daniel M. Muepu, Md. Shahajada Mia

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 本文提出一种结合预训练语义编码器与高效递归解码器的多标签错误分类框架,通过实验验证其在编程教育和软件工程领域的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23999 2026-08-11 cs.CR 版本更新 85%

ContainmentBench: Trace-Based Evaluation of Post-Exposure Containment in Tool-Using LLM Agents

ContainmentBench:基于跟踪的工具使用大型语言模型代理注入后遏制评估

Wenhao Lan, Shan Li, Meiqi Wu, Xinhua Lai, Junbin Yang, Haihua Shen

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究针对工具使用的大型语言模型代理注入后遏制评估问题,引入ContainmentBench基准,分别测量端点策略合规性等。通过对Qwen2.5 - 7B - Instruct研究发现,终端策略标签不充分,评估应分别报告多方面证据,还给出不同策略的工作流程完成率等结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11183 2026-08-06 cs.CL cs.AI cs.LG 版本更新 85%

Amplitude-Only FFN Intervention for Tool-Structured LLM Inference Method: Gated Evaluation Protocol, and Cross-Model Empirical Results

用于工具结构化大语言模型推理方法的仅幅度前馈网络干预:门控评估协议及跨模型实证结果

Sheng Xu, Zhen Chen, Junhua Wang, Boyuan Huang, Ke Jia, Jiadun Zhu, Yiming Xu

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究推理时FFN干预改善大语言模型结构化输出,提出无损的幅度门控方法,定义细粒度干预系统和评估协议。在多个模型上实验,AG在工具结构化任务中效果最佳,不同AG变体各有优劣,确定工具结构化推理是FFN级推理优化首要目标。

Comments 30 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12281 2026-07-21 cs.CV 版本更新 85%

Cognitive-YOLO: LLM-Driven Architecture Synthesis from First Principles of Data for Object Detection

认知YOLO:基于数据第一性原理的大语言模型驱动的架构合成用于目标检测

Jiahao Zhao

机构 * Xi’an University of Posts and Telecommunications(西安邮电大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 针对通用目标检测算法在垂直场景的问题,认知YOLO利用大语言模型与自主智能体协作,构建“分析-合成-编译”管道,合成轻量级模型,显著压缩参数数量,在mAP@0.5:0.95上表现良好,平衡了模型紧凑性和特征表示能力。

Comments 11 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14835 2026-07-20 cs.IR 版本更新 85%

LLM-Based Re-Ranking for Real Estate Search

基于大语言模型的房地产搜索重排

Nkateko Ntimane, Rafael Guedes, Tiago Cunha, Pedro Nogueira

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 针对拉丁美洲住房市场搜索难题及用户期望变化,提出基于大语言模型的重排器,依用户对话意图重排候选房源,构建评估数据集并验证,提升了搜索重排质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10002 2026-07-07 cs.CL cs.AI cs.LG 版本更新 85%

SpreadsheetArena: Decomposing Preference in LLM Generation of Spreadsheet Workbooks

电子表格竞技场:在大型语言模型生成电子表格工作簿中分解偏好

Srivatsa Kundurthy, Clara Na, Michael Handley, Zach Kirshner, Chen Bo Calvin Zhang, Manasi Sharma, Emma Strubell, John Ling

专题命中 评测与基准 :LLM(title,abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究端到端电子表格生成任务,介绍SpreadsheetArena平台通过大型语言模型生成的工作簿的盲选成对偏好投票评估模型,指出该任务挑战机遇,发布数据集以助进一步研究。

Comments 35 pages. ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03463 2026-07-07 cs.SE 版本更新 85%

The Impact of Critique on LLM-Based Model Generation from Natural Language: The Case of Activity Diagrams

批判对基于大语言模型的自然语言模型生成的影响:以活动图为例

Parham Khamsepour, Mark Cole, Ish Ashraf, DaYuan Tan, Sandeep Puri, Mehrdad Sabetzadeh, Shiva Nejati

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究基于大语言模型从自然语言描述自动化生成模型,提出LADEX流程,经批判-改进循环,设计变体研究其影响,用两种匹配器评估,实验表明循环可提升结构有效性等,算法结构检查更能实现结构一致性。

Comments Accepted in the Empirical Software Engineering (EMSE) Journal (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20878 2026-07-07 cs.CR 版本更新 85%

Supporting Students in Navigating LLM-Generated Insecure Code

支持学生应对大语言模型生成的不安全代码

Jaehwan Park, Seonhye Park, Kyungchan Lim, Hyoungshick Kim, Doowon Kim

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究针对大语言模型生成不安全代码的问题,提出Bifröst框架,通过对抗配置的代码生成模型、VS Code扩展和自动化漏洞报告,为教师提供反馈,助于引导讨论,经学生实验观察到该框架能改变学生对不安全代码的态度。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01827 2026-07-07 cs.SE 版本更新 85%

PSearch: Search-based Patch Generation in the Era of LLM-based Automated Program Repair

PSearch:基于大语言模型的自动程序修复时代中基于搜索的补丁生成

Haichuan Hu, Ye Shang, Weifeng Sun, Quanjun Zhang

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 针对现有基于大语言模型的自动程序修复方法靠试错生成补丁、难以有效评估搜索方向潜力和分配预算的问题,提出Psearch框架,以迭代补丁评估和优化为核心,能集成不同搜索算法,实验证明其有效性。

Comments accepted to ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08787 2026-06-23 cs.CV 版本更新 85%

Lost in Volume: The CT-SpatialVQA Benchmark for Evaluating Semantic-Spatial Understanding of 3D Medical Vision-Language Models

迷失于体积:CT-SpatialVQA基准用于评估3D医学视觉-语言模型的语义-空间理解

Mashrafi Monon, Umaima Rahman, Asif Hanif, Numan Saeed, Mohammad Yaqub

机构 * Mohamed Bin Zayed University of Artificial Intelligence(莫扎德人工智能大学) New York University Abu Dhabi(纽约大学阿布扎克分校)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 本文提出CT-SpatialVQA基准,评估3D医学视觉-语言模型对3DCT数据的语义-空间理解能力,发现现有模型在语义-空间推理任务中表现不佳,需更深入整合体积证据以确保临床可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00241 2026-06-17 cs.LG cs.AI cs.CL cs.CV 版本更新 85%

Mordal: Automated Pretrained Model Selection for Vision Language Models

Mordal: 面向视觉语言模型的自动化预训练模型选择

Shiqi He, Insu Jang, Mosharaf Chowdhury

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出Mordal框架,通过减少候选模型数量和评估时间,自动化搜索用户定义任务的最佳视觉语言模型,相比网格搜索降低GPU耗时8.9-11.6倍,加权Kendall's τ平均提升69%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22028 2026-06-12 cs.CV cs.RO 版本更新 85%

From Seeing to Experiencing: Scaling Navigation Foundation Models with Reinforcement Learning

从看见到体验:通过强化学习扩展导航基础模型

Honglin He, Yukai Ma, Brad Squicciarini, Wayne Wu, Bolei Zhou

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Coco Robotics(Coco机器人)

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract);post-training(abstract)

AI总结 提出S2E框架,结合离线视频预训练和模拟环境强化学习,通过锚点引导分布匹配和残差注意力模块,提升导航基础模型的交互性和安全性。

Comments 27 pages, 20 figures, 9 tables, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25420 2026-08-17 cs.CL cs.AI cs.CY 版本更新 84%

SomaliBench Eval: Measuring English-to-Somali Refusal Gaps in Open-Weight Language Models

SomaliBench Eval:衡量开源语言模型中英语到索马里语的拒绝差距

Khalid Yusuf Dahir

机构 * Independent researcher(独立研究人员)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI;LLM(comments)

AI总结 通过构建索马里语有害意图基准并评估四个开源模型,发现英语到索马里语的拒绝率存在显著差距,且多数非拒绝输出为不流畅的无效内容。

Comments v2: prose rewritten; classification-pipeline correction (34 judge-declined rows manually labeled); paired bootstrap and McNemar statistics; LLM-use disclosure added

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06108 2026-08-21 cs.AI 版本更新 84%

Evaluating Investment Logic in Large Language Models: A Real-World Benchmark Towards Personalzied Financial Agents

评估大语言模型的投资逻辑:面向个性化金融智能体的真实世界基准

Yuanhong Jiang, Jingjie Zou, Rui Jiang, Zhenghong Lin, Xusheng Yu, Qiqi Huang, Shuai Jia, Shijie Dai

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.AI

AI总结 该研究推出原生过程基准InvestLogicBench,含151位真实投资者的201247项决策,评估发现金融LLMs逻辑合理性高但事件接地性低,指出需以P→E→R→D→O轨迹评估个性化决策智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10485 2026-08-18 cs.CR cs.LG cs.SE 版本更新 84%

From Lab to Reality: A Practical Evaluation of Deep Learning Models and LLMs for Vulnerability Detection

从实验室到现实:深度学习模型与LLM在漏洞检测中的实用评估

Chaomeng Lu, Bert Lagaisse

机构 * DistriNet Group-T, KU Leuven(DistriNet集团-T,根特大学)

专题命中 评测与基准 :LLM(title_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 系统评估深度学习模型和大型语言模型在真实世界漏洞检测中的表现,发现它们在分布外数据集上性能急剧下降,揭示了学术基准与现实部署之间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09164 2026-08-14 cs.AI 版本更新 84%

CIDER: A Dataset of Contextual Disclosure Boundaries for Privacy Preference Alignment

CIDER:用于隐私偏好对齐的上下文披露边界数据集

Bingcan Guo, Eryue Xu, Jijie Zhou, Zhiping Zhang, Tianshi Li

机构 * University of Washington(华盛顿大学) UIUC(伊利诺伊大学厄巴纳-香槟分校) Northeastern University(东北大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文推出包含169名用户标注的CIDER数据集,用于评估LLM隐私偏好对齐,发现上下文个性化可提升预测准确率,GPT-5.4和Claude Sonnet 4.6表现更优。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16666 2026-08-07 cs.CL 版本更新 84%

Robust Native Language Identification through Agentic Decomposition

基于智能体分解的鲁棒原生语言识别

Ahmet Yavuz Uluslu, Tannon Kew, Tilia Ellendorff, Gerold Schneider, Rico Sennrich

机构 * University of Zurich(苏黎世大学)

专题命中 评测与基准 :LLM(summary_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文针对LLM原生语言识别易依赖表面线索的问题,提出受法医语言学启发的智能体分解流程,通过专用智能体积累分类证据、协调智能体综合预测,在基准数据集上提升了NLI的鲁棒性与性能一致性。

Comments Accepted at EMNLP* 2025

Journal ref Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP 2025), pp. 8398-8414

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07673 2026-07-22 cs.LG 版本更新 84%

How Benchmark Prediction from Fewer Data Misses the Mark

从较少数据进行基准预测如何失准

Guanhua Zhang, Florian E. Dorner, Moritz Hardt

机构 * Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) Tübingen AI Center(图宾根人工智能中心) ETH Zurich(苏黎世联邦理工学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究大语言模型基准预测方法,通过对11种方法在19个基准上评估,发现现有方法依赖模型相似性,新模型出现时效果不佳。提出受增强逆倾向加权启发的新方法,虽能改进但提升有限,揭示基准预测在评估前沿失效的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09570 2026-07-15 cs.CL cs.HC 版本更新 84%

UXBench: Benchmarking User Experience in AI Assistants

UXBench:AI助手中的用户体验基准测试

Mengze Hong, Xia Zeng, Zeyang Lei, Sheng Wang, Chen Jason Zhang, Di Jiang, Taiming Fu, Jinfeng Huang, Mengqiao Liu, Qinghe Chang, Haosheng Zou, Qiongyi Zhou, Sijun He, Simonjmdeng, Haojing Huang, Zijian Li, Lucas Mu Li, Fubao Zhang, Mona Zhou, Wei Ma, Yuan Hua, Qi Zhu, Shuo Jiang, Chenxuan Ma, Yuanmeng Zhang, Jian Song, Minlong Peng, Di Liang, Davey Chen

机构 * Hong Kong Polytechnic University(香港理工大学) Tencent(腾讯)

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(abstract);分类 cs.CL

AI总结 提出首个基于真实用户反馈的用户中心基准UXBench,包含三个任务和7400个测试实例,评估26个前沿语言模型,发现用户反馈预测是可学习的能力,并揭示了LLM作为评判者的系统偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06622 2026-07-07 cs.CL 版本更新 84%

UnpredictaBench: A Benchmark for Evaluating Distributional Randomness in LLMs

UnpredictaBench:评估大语言模型分布随机性的基准

Amirhossein Abaskohi, Amirhossein Dabiriaghdam, Liang Luo, Ellie Dingqiao Wen, Lele Wang, Giuseppe Carenini, Peter West

机构 * University of British Columbia(不列颠哥伦比亚大学) Independent Researcher(独立研究者)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出UnpredictaBench基准,通过KS@N指标评估LLM从目标分布(统计分布、随机程序、自然语言场景)采样的能力,发现模型表现差异大且无模型超过40%准确率,表明分布采样能力仍有显著提升空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00392 2026-07-07 cs.SE cs.AI 版本更新 84%

Beyond Task Completion: A Verification-vs.-Conformance Gap in Tool-Evolving Agents

EvolveTool-Bench:评估LLM生成的工具库作为软件 artifact 的质量

Alibek Kaliyev, Artem Maryanskyy

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) Uber Technologies(优步科技公司)

专题命中 评测与基准 :LLM(title_cn,summary_cn);分类 cs.AI

AI总结 本文提出EvolveTool-Bench,通过评估LLM生成的工具库在软件工程流程中的质量,揭示任务完成率之外的软件质量风险,强调需将工具库视为首要软件 artifact。

Comments 11 pages, 4 figures; accepted at KDD 2026 Workshop on Agentic AI Evaluation and Trustworthiness

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01338 2026-06-19 cs.CL 版本更新 84%

Benchmarking Local LLMs for Natural-Language-to-SQL Querying in Biopharmaceutical Manufacturing: An Empirical Benchmark on Consumer-Grade Hardware

在生物制药制造中本地LLM的自然语言到SQL查询基准测试:消费级硬件上的实证基准

Sagar Bhetwal, Rajan Bastakoti, Nirajan Acharya, Gaurav Kumar Gupta, Ambika Baniya Bhandari

机构 * Department of Computer Science, University of the Cumberlands(大学的计算机科学系) Department of Computer Science, DePaul University(德保罗大学计算机科学系) Youngstown State University(亚当斯州立大学)

专题命中 评测与基准 :LLM(title_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究评估了四种本地部署的开源大语言模型在生物制药制造数据库上的自然语言到SQL生成性能,发现代码调优的通用模型优于领域特定模型,但当前性能仍需人工监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02904 2026-06-18 cs.HC cs.CL q-bio.NC 版本更新 84%

ScholaWrite: A Dataset of End-to-End Scholarly Writing Process

ScholaWrite: 端到端学术写作过程数据集

Khanh Chi Le, Linghe Wang, Minhwa Lee, Ross Volkov, Luan Tuyen Chau, Dongyeop Kang

机构 * University of Minnesota(明尼苏达大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出ScholaWrite数据集,通过Chrome扩展记录Overleaf上的按键,捕捉从初稿到终稿的多月写作过程,包含5篇计算机科学预印本的近6.2万次文本修改及认知写作意图标注,揭示人类写作与LLM辅助之间的差距。

Comments Equal contribution: Khanh Chi Le, Linghe Wang, Minhwa Lee | project page: https://minnesotanlp.github.io/scholawrite/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22119 2026-06-16 cs.AI 版本更新 84%

Emergent Strategic Reasoning Risks in AI: A Taxonomy-Driven Evaluation Framework

AI中涌现的策略推理风险:基于分类法的评估框架

Tharindu Kumarage, Lisa Bauer, Yao Ma, Dan Rosen, Yashasvi Raghavendra Guduri, Anna Rumshisky, Kai-Wei Chang, Aram Galstyan, Rahul Gupta, Charith Peris

机构 * Amazon Nova Responsible AI(亚马逊诺瓦负责任人工智能)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出ESRRSim框架,基于7类20子类的风险分类法,通过双评估标准自动评估LLM的策略推理风险,发现检测率在14.45%-72.72%之间,且模型代际提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07294 2026-06-12 cs.CE cs.AI 版本更新 84%

Fin-RATE: A Real-world Financial Analytics and Tracking Evaluation Benchmark for LLMs on SEC Filings

Fin-RATE:面向SEC文件的金融分析与追踪评估基准

Yidong Jiang, Junrong Chen, Eftychia Makri, Jialin Chen, Peiwen Li, Ali Maatouk, Leandros Tassiulas, Eliot Brenner, Bing Xiang, Rex Ying

机构 * Tongji University(同济大学) University of California, San Diego(加州大学圣地亚哥分校) Yale University(耶鲁大学) Goldman Sachs(高盛集团)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对LLM在金融领域分析复杂监管文件的需求,提出基于SEC文件的Fin-RATE基准,通过三种任务路径评估模型,发现跨文档和跨时间分析时性能显著下降。

Journal ref Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26498 2026-06-09 cs.LG q-bio.QM 版本更新 84%

Do Larger Models Really Win in Drug Discovery? A Benchmark Assessment of Model Scaling in AI-Driven Molecular Property and Activity Prediction

大模型真的在药物发现中胜出吗?AI驱动的分子性质和活性预测中模型规模的基准评估

Jinjiang Guo, Sheng Ding

机构 * Global Health Drug Discovery Institute(全球健康药物发现研究所) School of Pharmaceutical Sciences(药学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文通过26个ADME、毒性及生物活性端点评估,发现传统机器学习在多数任务中表现最佳,大模型在部分困难分割中竞争力有限,模型性能依赖于任务与验证场景的适配性,而非单纯规模。

Comments Improved benchmark design and reproducibility, replaced restricted datasets with public benchmarks in primary analyses, and added sensitivity analyses supporting the interpretation of model scaling and evaluation protocol effects in molecular prediction

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.05583 2026-06-09 cs.CL math.OC 版本更新 84%

Toward automatic generation of control structures for process flow diagrams with large language models

面向工艺流程图控制结构自动生成的大语言模型方法

Edwin Hirtreiter, Lukas Schulze Balhorn, Artur M. Schweidtmann

机构 * University of Zurich(苏黎世大学)

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.CL

AI总结 提出一种基于Transformer的端到端方法,将控制结构预测视为翻译任务,利用SFILES 2.0表示PFD拓扑,通过预训练和微调实现自动生成,在生成数据上达到74.8%-89.2%的Top-5准确率。

Journal ref AIChE Journal, Volume 70, Issue 1, January 2024, e18259

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11496 2026-08-18 cs.GT cs.AI cs.CL cs.MA 版本更新 84%

Sequential LLM Release Facilitates Manipulation in Regulated Markets

毒苹果效应:通过AI代理技术扩展战略操纵中介市场

Eilam Shapira, Moshe Tennenholtz, Roi Reichart

机构 * Faculty of Data and Decision Sciences, Technion – Israel Institute of Technology, Haifa, Israel(以色列理工学院数据与决策科学学院,海法,以色列)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了AI代理技术扩展对博弈论场景中经济影响,发现技术扩展可显著改变均衡收益与监管结果,提出'毒苹果'效应通过释放未被使用的新技术操纵监管设计,损害对手与监管公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03904 2026-08-18 cs.CL cs.AI 版本更新 84%

I-CALM: Incentivizing Confidence-Aware Abstention for LLM Selective Answering

I-CALM:激励基于自信的回避以缓解大语言模型幻觉

Haotian Zong, Binze Li, Yufei Long, Sinyin Chang, Jialong Wu, Gillian K. Hadfield

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究通过仅提示干预减少大语言模型幻觉风险,提出I-CALM框架通过引导自信、奖励回避和加入规范原则提升事实性问题的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏