☰
Exploring the Potential of Large Language Models in Fine-Grained Review Comment Classification
2026/9/30 2:19:48 网站建设 项目流程

文章总结与翻译

一、文章主要内容

本文聚焦大型语言模型(LLMs)在代码审查评论细粒度分类中的应用潜力,旨在解决传统监督机器学习方法依赖大量人工标注数据、泛化能力有限的问题,具体内容如下:

  1. 研究背景:代码审查(CR)是软件开发中的关键质量保障环节,但现代轻量级审查中存在20%-44%的“无用”评论,浪费开发者时间。传统方法多将评论分为5个高层类别,且依赖人工标注数据,难以处理17个细粒度类别(部分高价值类别数据占比不足1%)的不平衡问题。
  2. 研究设计
    • 分类策略:对比两种分类策略——“扁平策略”(单步直接分类为17个类别)和“分层策略”(两步分类:先分5个高层组,再分对应子类别)。
    • 输入上下文:测试“仅评论”和“代码+评论”两种输入形式,探究代码上下文对分类效果的影响。
    • 模型与数据集:选用Qwen 2(7B、72B)和Llama 3(8B、70B、405B)系列模型,基于OpenStack Nova项目的1828条人工标注评论数据集,与现有最优方法(CodeBERT+LSTM)对比。
  3. 核心结果
    • RQ1(LLMs能否分类评论):LLMs可有效分类17个类别,性能远超随机猜测和多数类基线。其中Llama 3.1-405B采用扁平策略+代码上下

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询