まずは基礎から学んでいく。
Tokenization
- 文字を分割して整数の列に変換する
具体例としては以下 吾輩は猫である
吾輩→12 は→679 猫→666 である
Embedding
数値だけだと猫と犬が近いなどがわからない。 だから、ベクトルに変換しておく [0.1, 0.8, ...,0.9] 学習時にこの値を少しずつ調整する Tokenizeしたときの数値、単語、このベクトルをEmbedding Matrixという表として持っておく
Attention
食べただけでも他の文脈が必要。周りのTokenを読んで重要なTokenを計算する。 Query / Key / Valueが重要とのこと