第 8 章 AI・データ活用
データから未来を予測する。この章では次の 7 個の知識点を、解説・インタラクティブ教材・練習問題で学びます。
ビッグデータと AI
ビッグデータは、大量(Volume)・多様(Variety)・高頻度(Velocity)の 3 つの V を満たすデータ。AI(Artificial Intelligence:人工知能)は人間の知能を機械で表現しようとする技術で、あらかじめ決められた処理をするだけでなく、状況に応じて判断する。ビッグデータを AI に学習させると、精度の高い予測(おすすめ動画など)ができる。
機械学習とディープラーニング
AI ⊃ 機械学習 ⊃ ディープラーニング。機械学習は、大量のデータからコンピュータが学習してパターン(学習済みモデル)を見つける技術。学習に使うデータの特徴を数値にしたものが特徴量。ディープラーニングは、人間の脳の神経回路をまねたニューラルネットワークを何層も重ねたもので、特徴量の設計まで自動で行える。
教師あり学習・教師なし学習・強化学習
教師あり学習:問題と正解をセットで与えて学習し、未知のデータの正解を予測する(家賃の予測、犬猫の判別)。教師なし学習:正解を与えず、データの性質からグループ分けや構造の発見をする(顧客のグループ化)。強化学習:行動に得点(報酬)を与え、得点が最大になる行動を試行錯誤で学ぶ(囲碁、ロボット)。
教師あり学習の手法(回帰と分類)
教師あり学習には 2 種類。回帰:売上金額のような数値を予測する(代表は線形回帰)。分類:犬か猫か・買うか買わないかのようなグループを予測する(ロジスティック回帰・決定木/ランダムフォレスト・サポートベクトルマシン(SVM))。画像や音声から特徴や規則性を取り出すのがパターン認識。
教師なし学習の手法(クラスタリングと次元削減)
教師なし学習には 2 種類。クラスタリング:似た特徴をもつデータを同じグループ(クラスタ)にまとめる(代表は k-means 法)。次元削減:たくさんある特徴量を、情報をなるべく失わずに少ない数にまとめる(身長×体重の 2 次元 →「体格」の 1 次元)。
データ活用の流れとデータクレンジング
データ活用は ① 収集 → ② 加工 → ③ 分析 → ④ 可視化。収集では一次データ(自分で集める)と二次データ(他人が集めたもの)、Web からはスクレイピング。行と列に整った構造化データと、文章・画像などの非構造化データがある。生データはデータレイクに置き、データクレンジング(表記揺れの統一・外れ値/異常値・欠損値の処理)を経てデータウェアハウスへ。可視化には棒・折れ線グラフ、箱ひげ図、レーダーチャートなど。全体を担うのがデータサイエンティスト。
自然言語処理
自然言語処理は、人間の言葉をコンピュータで解析する技術。形態素解析(意味をもつ最小単位に分けて品詞を付ける)→ 構文解析(文節の係り受けを調べる)→ 意味解析(単語の意味から正しい解釈を選ぶ)→ 文脈解析(複数の文にまたがって指示語などを解釈する)の順に進む。n-gram は文字列を N 文字ずつずらして区切る方法で、検索漏れを防げる。