アノテーションと教師あり学習の関係|ラベル品質がモデル精度を決める仕組み

アノテーションと教師あり学習の関係|ラベル品質がモデル精度を決める仕組み

アノテーションを見積もるときは、ラベルの正解率をどこまで求めるかを決める必要があります。99%と95%では費用が変わりますが、その差がモデルの精度にどう影響するかは、学習の仕組みを知らないと判断できません。

この記事では、アノテーションで付けた正解ラベルが教師あり学習の中でどう使われるかを、仕組みから順に説明します。読み終えると、ラベルの誤りが「学習データにあるとき」と「テストデータにあるとき」で別の問題を起こすこと、そしてどの誤りにどれだけ費用をかけるべきかを判断する軸が分かります。アノテーション全体の工程はデータアノテーション完全ガイドにまとめています。

1. 教師あり学習の基礎:正解ラベルは「答え合わせ」に使われる

教師あり学習は、入力データと正解ラベルの組を大量に与え、入力から正解を予測する規則をモデルに学ばせる方法です。画像と「不良品」というラベルの組、問い合わせ文と「返金依頼」という分類の組がその例です。正解ラベルを付ける作業がアノテーションで、ラベル付きデータの集まりを教師データと呼びます。

損失関数がラベルとの差を測る

学習は答え合わせの繰り返しです。モデルが入力に対して予測を出し、正解ラベルとの差を損失関数という数式で数値にします。学習アルゴリズムはこの数値が小さくなる方向へ、モデル内部のパラメータを少しずつ調整します。数万件、数百万件の組でこれを繰り返すと、入力の特徴と正解の対応がモデルに残ります。

通常の教師あり学習では、与えられたラベルを正解として扱います。誤ったラベルの影響を抑える学習方法もありますが、基本的にはラベルとの違いを小さくするようにパラメータを調整するため、ラベルの正確さが重要です。

学習・検証・テストの3つに分ける

教師データは、通常3つに分けて使います。

  • 学習データ:パラメータの調整に使う。全体の7〜8割を割り当てることが多いです
  • 検証データ:学習の途中で精度を確かめ、学習の打ち切りや設定の選択に使う
  • テストデータ:学習が終わったモデルの最終的な精度を測る。学習中には一切見せない。評価データと呼ぶこともあります

この分割は、モデルが学習データを丸暗記しただけなのか、見たことのないデータにも通用するのかを区別するためのものです。3つとも同じアノテーション作業から生まれるので、ラベルの誤りは3つすべてに入り込みます。どこに入った誤りが何を起こすかは、第3章で分けて説明します。

2. アノテーションが教師データになる流れ

アノテーションは、データにラベルを付ける手作業だけを指すのではありません。教師データができるまでには、何を正解とするかを決める工程が前にあり、検証結果を見てその定義を直す工程が後ろにあります。

業務課題からラベル定義、アノテーション、データセット分割、学習、検証を経て、検証結果がラベル定義の改訂へ戻る循環を示す図

業務課題をラベルの定義に落とし込む

出発点は「モデルに何を判定させたいか」です。外観検査なら、どの傷を不良とみなすか、どの程度の汚れは許容するかを決めます。この判断基準を文書にしたものがアノテーションガイドラインで、アノテーターはこれに従ってラベルを付けます。

ガイドラインが曖昧だと、同じ画像にアノテーターごとに違うラベルが付きます。モデルにとっては、同じ入力に異なる正解が示されている状態です。損失関数はどちらの正解にも合わせようとするため、学習が安定しません。定義の決め方と改訂の手順は、アノテーションガイドラインの作り方で解説しています。

ラベルを付け、検品し、データセットにまとめる

アノテーターがガイドラインに沿ってラベルを付け、レビュアーが検品します。検品を通ったデータを、学習・検証・テストの3つに分けてデータセットとして固めます。分けるときは、同じ製品や同じ人物のデータが学習側とテスト側に両方入らないようにします。入ってしまうと、テストの精度が実際より高く出ます。

検証結果をラベル定義に返す

学習と検証を終えたら、モデルが間違えたデータを見ます。間違いが特定の条件に集中していれば、原因として、その条件のラベル定義の曖昧さや、学習データのサンプル不足などが考えられます。必要に応じてガイドラインを改訂し、追加のアノテーションを行います。教師データは一度作れば終わり、というものではありません。モデルの検証結果を受けて直し、増やしていきます。

改善には検証データを使い、最終的な精度は、改善に使っていないテストデータで確認します。

3. ラベル品質とモデル精度の関係

ラベルの誤りはひとまとめに「ノイズ」と呼ばれますが、どこに、どんな形で入っているかで影響が変わります。費用をかける優先順位を決めるために、まず誤りを3種類に分けます。

  • 誤ラベル:正解が「犬」の画像に「猫」と付いている。単純な作業ミスや、似た対象の見誤りで起こります
  • 境界のブレ:バウンディングボックスの位置や、セグメンテーションの輪郭がアノテーターごとに数ピクセルずれる。定義が「どこまでを対象に含めるか」を決めていないときに起こります
  • 網羅漏れ:画像に3台の車があるのに2台しか囲まれていない。小さい対象や、背景に近い対象で起こります

これらが学習データに入ったときと、テストデータに入ったときで、起きる問題は別です。

学習データの誤りは、ランダムな作業ミスなら多数の正しい例に埋もれるが、夜間の画像だけ見落とすような特定条件に偏った誤りは「夜間には歩行者がいない」という規則としてそのまま学習される。テストデータの誤りは、モデルの正しい予測を不正解に数えて測れる精度に上限を作り、モデル間の順位を入れ替える。この2つを左右で対比した図

学習データの誤り:ランダムか、偏っているか

学習データにある誤りは、その分布によって影響の大きさが変わります。

アノテーターの集中力の切れなど、条件と無関係にランダムに起きる誤りは、データ量があれば学習である程度薄まります。Rolnickらが2017年に発表した研究では、手書き数字の画像データセットで、正しいラベルの例1件あたりにランダムなラベルの例を100件混ぜても、テスト精度が90%を超える結果が示されています。ただし同じ研究は、この状態で学習するには、正しいラベルが薄まった倍率に応じてデータ量を大きく増やす必要があるとも述べています。つまり、ランダムな誤りに耐えられても、同じ精度を得るには、より多くのデータとアノテーションが必要です。

注意が必要なのは、特定の条件に偏った誤りです。たとえば「夜間の画像では歩行者を見落としやすい」というアノテーターの傾向があると、モデルもその傾向を学習し、夜間の歩行者を見落としやすくなる可能性があります。同じ偏りを含むデータを増やしても、その影響が解消されるとは限りません。ガイドラインの曖昧さから来る誤りはこの型になりやすく、アノテーター間の判断のばらつきを日次で測る仕組みが要る理由もここにあります。アノテーターの判断をそろえる方法は、アノテーターの教育・トレーニング方法で解説しています。

テストデータの誤り:測れる精度に上限ができる

テストデータのラベルが間違っていると、モデルが正しく予測してもテストでは「不正解」と数えられます。ラベルの5%が誤っていれば、完璧なモデルでも測定上の精度は95%前後で止まります。逆に、モデルがラベルと同じ間違いをすれば、その分は「正解」に数えられます。つまり、テストデータに誤りがあると、モデルの実際の精度を正しく測れません。

問題はそれだけではありません。Northcuttらが2021年に発表した研究は、広く使われている10種類の公開データセットのテストデータを調べ、平均で少なくとも3.3%のラベル誤りがあることを報告しました。画像認識のベンチマークとして最も使われてきたImageNetの検証データでは、少なくとも6%です。また、ImageNetで元々誤ラベルだったデータの比率を高め、修正後のラベルで評価したところ、ResNet-18がResNet-50を上回る条件がありました。

実務に置き換えると、次のような場面がこれに当たります。

  • 委託先AとBの試作モデルを比較したが、精度差が1ポイントしかない。テストデータに数%の誤りがある場合、この差だけで優劣を決めず、ラベルの誤りが比較結果に与える影響を確認する必要があります
  • モデルを改良して精度が上がらなくなった。改良の限界ではなく、テストデータの誤りが上限を作っている可能性があります

テストデータは、学習データより厳しい品質基準で作る価値があります。件数は学習データより少ないことが多いため、ダブルチェックや専門家レビューを全件にかけても、費用の増加は抑えられます。学習データは量と速度、テストデータは正確さと、目的に応じて品質基準を分けて見積もると、費用の配分が決めやすくなります。品質基準ごとの費用の考え方は、アノテーション費用の内訳と見積もりの立て方にまとめています。

4. 教師なし・半教師あり学習との違い

ラベル付けの費用を抑えるために、ラベルなしで学習できる方法を検討することがあります。方法ごとにラベルの要否と役割が違うので、整理しておきます。

学習方法学習に使うラベル主な用途アノテーションの位置づけ
教師あり学習全データに必要分類、物体検出、文字起こしなど正解が定まる課題学習データとテストデータの両方を作る
教師なし学習不要クラスタリング、異常検知、次元圧縮学習には不要。結果の解釈と評価には人の判断が要る
半教師あり学習一部のデータに必要ラベル付きが少なく、ラベルなしが大量にある課題少量の高品質なラベルと、テストデータを作る
自己教師あり学習不要(データ自体から擬似的な課題を作る)大規模モデルの事前学習教師ありの微調整や、正解との比較による評価でラベルを使う

教師なし学習は、データの中の構造を見つける方法です。似た画像をまとめる、いつもと違う振る舞いを検出するといった用途に向きます。ただし「このまとまりは何を意味するのか」「検出したものは本当に異常なのか」を判断するのは人であり、その判断が業務上妥当かを確かめる際には、正解付きのデータが役立ちます。

半教師あり学習は、少量のラベル付きデータで学んだ規則を、大量のラベルなしデータに広げる方法です。ただし、ラベルに誤りがあると、その影響が大量のラベルなしデータにも及びます。そのため、ラベル付きデータは件数が少なくても、1件ずつ正確に作る必要があります。

自己教師あり学習は、生成AIや基盤モデルの事前学習で使われている方法で、文章の続きを予測するといった課題をデータ自身から作って学びます。この段階ではアノテーションは要りません。ただし、教師ありの微調整を行う場合や、業務上の正解と比較して精度を測る場合には、正解付きのデータが必要になります。

ラベルなしで学習する方法でも、業務上の正解と比較して精度を確かめる場合には、評価用データへのアノテーションが必要です。学習用のラベル付けを減らせても、評価用データにどのようなラベルが必要かは、別に検討することが大切です。

5. まとめ

通常の教師あり学習では、与えられたラベルを正解として、予測との差が小さくなるように学習します。そのため、アノテーションの品質はモデルが学ぶ規則の品質に大きく影響します。

ラベルの誤りは、学習データとテストデータのどちらに含まれるかによって、引き起こす問題が異なります。学習データでは、ランダムな誤りはデータ量で薄まる一方、特定条件に偏った誤りはモデルの予測にも影響が残る場合があります。テストデータでは、誤りの分だけ測れる精度に上限ができ、数%の誤りでもモデル間の優劣を誤って判断するおそれがあります。品質基準を一律に決める必要はありません。学習データは条件の偏りを抑えることに、テストデータは1件ごとの正確さに重点を置くと、費用の配分が決まります。

ラベルの正解率をどこまで求めるべきかは、対象となるデータと誤りの種類によって変わります。見積もりを依頼する前に、テストデータを学習データと分けて品質要件を書き、アノテーター間の判断のばらつきをどう測るかを決めておくと、委託先との会話が具体的になります。

Nextremerでは、ラベル定義の設計からアノテーターの教育、検品体制の構築まで、教師あり学習に使う教師データの作成を支援しています。データアノテーションの全体像はデータアノテーション完全ガイドで、教師データ作成のご相談はデータアノテーションサービスをご覧ください。

執筆者

  • 喜多 俊之

    喜多 俊之

    株式会社Nextremer 取締役CTO

    2013年に東北大学大学院理学研究科を修了後、三井情報株式会社へ入社。SI部門やR&D部門のエンジニアとして、時系列予測やデータ分析、機械学習に携わる。2017年より大手メーカーのグループ企業にて機械学習エンジニアとして幅広い業種・規模のシステム開発に参画。2019年より現職にて画像認識や対話システムなど機械学習システムの開発を担うR&D部門にてマネージャーを務める。

データアノテーションサービスの詳細を見る→