Panorama Appliance
- オンプレのカメラネットワークにコンピュータビジョンを追加できる
- カメラネットワークの通信がパブリックインターネットに露出したらダメだけど何らかの機械学習素リューションが欲しいみたいなケースで便利
- SagemMakerの適当なモデルをデプロイしてリアルタイムに動画解析できる
- 線形回帰とロジスティック回帰の違い
混同行列
- TN, TT, FN, FPの4章限がある
- 評価指標
- 正解率(Accuracy)
- 正しく評価された割合
- (TP + TN) / (TP + TN + FP + FN)
- 適合率(Precision)
- Positive判定のうち、正解の割合
- TP / (TP + FP)
- 再現率(Recall)
- 実際のPositiveのうち、正解できた割合
- TP / (TP + FN)
- F1スコア
- 適合率と再現率の調和平均
- モデル全体の性能評価に便利ぽい
- F2スコア
その他
- 保険金請求の準拠性審査。請求は文章で、複雑な関連情報が含まれる。SageMakerの組み込みアルゴリズムで教師ありモデルを構築したい。下流の教師あり学習タスクの入力に使える特徴量抽出をしたい。
- 【⭕️】Object2Vecでトレーニングセットから特徴量を抽出する。
- 【❌】Word2Vecでやる
- 単語レベルの埋め込みになるため、複雑な文章であまり良い方法じゃないらしい
- 【❌】one-hotエンコーディングでやる
- カスタマーレビューからのインサイトをまとめたい。レビューから変更を加えるべき製品や機能の優先順位を決めたい。SageMakerの組み込みアルゴリズムのどれを使う?
- 【⭕️】seq2seqアルゴリズム
- 【❌】潜在的ディリクレ配分(LDA)
- テキストのグループ化に使う教師なしアルゴリズム
- この問題だとグループ化済みだった
- 【❌】
- IoTGreengrass
- 混同配列
- 再現率
- 偽陰性を最小にしたい(NGを見逃すのを最小にしたい)
- 適合率
- 偽陽性を最小にしたい(OKとしたけど実際はNGなのを最小にしたい)
- Glueの再帰的パーティショニング
- S3の整理をしてくれる感じ?
- EMRにロードするのに良い感じにグループ化してくれる?
- 重回帰モデル
- 複数の変数で1つの目的変数を予測・説明するモデル
- 特徴量の間で相関係数が非常に高いと、マルチコ(多重共線性)という問題が発生する
- モデルの出力が不安定になる(線形過程が無効になるリスクが上がる)
- 回避するには
- Pollyの発音を変えたい
- カスタム語彙が設定できる
- レキシコンというフォーマットがあるぽい
- Personalize
- レコメンデーション
- 最新のイベントも考慮に入れたい場合、イベントトラッカー機能を有効にする
- 時系列予測モデルの用語
- Personalize以前はEMRでApache Spark MLを実行してレコメンデーションモデルを構築してたぽい
- 過学習対策
- 正則化項を追加する
- 全結合層でのドロップアウトを増やす
- 次元圧縮
- ニューラルネットワークなら、レイヤーを減らして単純化する
- 学習率を小さくする(より早く収束させる)
- 早期停止
- ライブラリによるが、過学習を観測した瞬間に学習を停止する感じぽい
- 正偏差と負偏差
- 正偏差
- 山が左によってる感じ
- データセットの補正には対数変換
- 負偏差
- 山が右によってる感じ
- 平均値 < 中央値 < 最頻値
- データセットの補正には指数変換
- SageMakerでカスタムモデルを使う時、ECRでDockerイメージを管理し、モデルアーティファクトはS3に保存して管理
- Forecastを使うのに必要な前処理
- CSVファイルだけサポートしている。TSVとか不可
- データセットとして、ターゲット時系列セット、アイテムメタデータセットを用意する
- EMRのアーキテクチャ
- マスターノード
- コアノード
- タスクノード
- 処理の実態
- スポットインスタンスで捨てても大丈夫なノード
- データセットに偏りがある時の対策2つ
- データ増幅
- 重み付け
- 損失関数に重みを追加して、少数派クラスの影響力を高める
- バイナリ分類ならPosクラスが少ないなら偽陰性の重みを増やす
- Glueのロードジョブでpythonスクリプトかける
- PySpark Python拡張言語機能というらしい
- ビデオ通話の背景みたいなのにセマンティックセグメンテーション使う
- ベイジアンモデル
- 完全ベイジアンネットワーク:特徴のいくつかは統計的に従属している
- k-fold交差検証
- データセットをk個に分割し、k-1個で学習、1個で評価を繰り返す
- 全体の平均性能を評価できる
- ハイパーパラメータチューニングにも使える
- 層化k-fold