企業は、次の方法を実践することで、クラスタリングの落とし穴を回避できます。
- 結果の検証:クラスターを実際のデータと比較し、実用的な意味があることを確認します。
- 複数のアルゴリズムのテスト:様々なクラスタリング方法をテストし、データに最適なものを特定します。
- 定期的な更新:データの変化に伴い、精度を維持するためにクラスタリング分析を定期的に更新します。
- 専門分野の知識の活用:クラスターが有意義かつ実行可能であることを確認するために、各分野の専門家と協力します。
クラスター分析の実行方法
ステップ1:分析方法の選択
一般的に、クラスター分析の最初のステップは、データのサイズと変数の種類に応じて分析方法を選択することです。
例えば、階層的クラスタリングは、小規模なデータセットに適しています。一方、k平均法によるクラスタリングは、中規模のデータセットや、クラスター数が事前にわかっている場合に適しています。
大規模なデータセットでは通常、様々な種類の変数を混在させるために、2段階の手順が必要になります。
ステップ2:ケース数の決定
分析方法を決定したら、均質なグループやクラスターに細分化するケース数を選択して、プロセスを開始します。ケース(観察対象)として、分析したいあらゆるテーマ、人物、物体を指定できます。
ステップ3:分析する変数の選択
含める変数を選択します。1,000個、10,000個、25,000個など、変数の数は多岐にわたります。選択した変数の数とタイプに応じて、使用するアルゴリズムのタイプが決まります。
ステップ4:変数の標準化の決定
すべての変数がケース間の距離または類似性に等しく寄与するように、変数を何らかの方法で標準化するかどうかを決定します。ただし、分析は、標準化された変数と標準化されていない変数の両方で実行できます。
ステップ5:選択したアルゴリズムの適用
アプローチは、分析方法ごとに異なります。
- k平均法によるクラスタリングの場合、クラスター数を選択すると、クラスタリングアルゴリズムはクラスター平均を繰り返し推定し、クラスター平均までの距離が最小となるクラスターに、各ケースを割り当てます。
- 階層的クラスタリングの場合、2つのケースがどれだけ離れているか、またはどれだけ類似しているかを定量化する統計を選択します。
ステップ6:クラスター数の確定
最後に、アルゴリズムはグループを形成する方法を選択し、データを表すために必要なクラスター数を決定します。クラスターの類似性を調査し、それに応じて分割します。
クラスター分析結果の活用方法
通常は、クラスタリング方法に関連するビジュアライゼーションを行います。ビジュアライゼーションは、分析結果を検証するための一般的な方法です。k平均法の場合、通常、観測データのグループ間の距離を示すx軸とy軸を使用します。
このようなビジュアライゼーションを使用すれば、グループ化を明確に把握できます。階層的クラスタリングの場合、カットツリーの分割を示すデンドログラムを使用して視覚化します。
クラスター分析が正確であることを確認する方法
まず、クラスターの傾向を評価します。クラスタリングアルゴリズムに取り組む前に、データセットが意味のあるクラスターを形成する可能性があるかどうか、またランダムに分散されているかどうかを確認することが重要です。
一般的な方法の1つは、ホプキンス統計量を使用して、データが均一に分布している可能性を測定することです。値が0に近いほど、データにおけるクラスター傾向が強いことを示唆し、値が0.5付近の場合はランダム性を示します。
さらに、クラスター傾向の視覚的評価(VAT)などのビジュアライゼーションツールは、非類似度マトリックスを並べ替えて、潜在的なクラスターを視覚的に強調するのに役立ちます。これらのテストでデータが自然にグループ化されていることが示された場合は、クラスタリングを続行できます。そうでない場合は、クラスタリングから有益なインサイトを引き出せない可能性があります。
次に、最適なクラスター数を決定します。クラスターが少なすぎると、データが単純化しすぎてしまう可能性があります。一方、クラスターが多すぎると、過剰適合につながる可能性があります。そのため、適切なクラスター数(k)を選択することが重要です。
エルボー法は、よく使用される手法の1つです。クラスター内の二乗和をクラスター数に対してプロットし、クラスタリングのパフォーマンスの向上が横ばいになり始めるポイント(エルボー)を特定します。もう1つの有効な指標は、シルエットスコアです。これは、各データポイントが割り当てられたクラスターが、他のクラスターと比較してどの程度適合しているのかを評価します。シルエットスコアが高いほど、クラスターがより明確で、分離されていることを示します。
さらに、ギャップ統計では、観測されたクラスター内分散を、帰無分布で予想される分散と比較し、ギャップが最大となる場所を強調表示することで、最適なkを特定できます。
最後に、クラスタリング品質を評価します。クラスターが内部的にまとまりがあり、外部的に分離されていることを確認することが重要です。
その主な方法として、-1から1までのシルエット係数が広く使用されています。スコアが1に近いほど、クラスターが適切に定義されていることを意味します。ダン指数は、2つのクラスターの観測データ間の最小距離(クラスター間距離)と、1つのクラスター内の最大距離(クラスター内距離)の比率を計算します。ダン指数の値が高いほど、クラスターの品質が高いことを示します。一方、Davies–Bouldin指数は、各クラスターと最も類似したクラスター間の平均類似度を測定します。値が低いほど、クラスタリング品質が優れていることを示します。
正確なクラスター分析を確実に行うには、次の3つのステップに従う必要があります。
- クラスター傾向の評価:統計テスト(ホプキンス統計量など)とビジュアライゼーションツール(VATなど)を使用して、データが自然にクラスターを形成するかどうかを判断します。
- 最適なクラスター数の決定:エルボー法、シルエットスコア、ギャップ統計などの方法を使用して、過度な単純化や過剰適合を回避することで、適切なクラスター数(k)を特定します。
- クラスタリング品質の評価:シルエット係数、ダン指数、Davies–Bouldin指数などの指標を使用して、クラスターがコンパクトで適切に分離されていることを確認します。
クラスター分析を始める
クラスター分析の大きな利点の1つは、データのパターンや関係を明らかにし、リアルタイムのインサイトにもとづいて的確な意思決定を行い、行動できることです。
クラスター分析を始める最初のステップは、データを効果的に分析および解釈するのに役立つ、実績のあるツールを導入することです。
Adobe Analyticsなら、リアルタイムでデータを分析し、インサイトへと転換できます。カスタマージャーニーの各段階でデータを収集し、リアルタイムのインサイトを獲得することで、最適な施策を導き出すことができます。AIを使用して、包括的なデータにもとづいた予測的なインサイトを獲得し、データをリアルタイムで視覚化および活用できます。
Adobe Analyticsの詳細については、アドビの担当者までお問い合わせいただくか、動画をご覧ください。