新人エンジニア研修講師
第12章 次元の拡大と縮小の意味
こんにちは。ゆうせいです。 第11章では、2次元の図を使って、行列がどのような変換を行うのかを見てきました。ただし、そこで扱ったのは、2次元から2次元への変換だけでした。第12章では、次元そのものが変わる場合を扱います。 […]
第11章 2次元で見る線形変換:回転、伸縮、射影
こんにちは。ゆうせいです。 第10章までで、線形代数の計算方法は一通り揃いました。ここからは第III部に入ります。計算の手順ではなく、その計算が何をしているのかという意味を扱います。第11章のテーマは、線形変換です。行列 […]
第10章 形を合わせる:転置、reshape、ブロードキャスト
こんにちは。ゆうせいです。 第9章までで、線形代数の主要な計算は一通り揃いました。第10章は、少し性格の異なる章です。理論というより、実務のための章です。ディープラーニングのコードを書き始めると、最も頻繁に遭遇するのが、 […]
第9章 行列と行列の積:バッチ処理の仕組み
こんにちは。ゆうせいです。 第8章では、行列とベクトルの積が全結合層そのものであることを確認しました。ただし、そこで扱ったのは入力が1件だけの場合です。実際の学習では、データを1件ずつ処理することは、まずありません。32 […]
第8章 行列とベクトルの積:全結合層の正体
こんにちは。ゆうせいです。 第7章で、多数のニューロンの計算をまとめたいという動機を確認しました。第8章では、そのまとめ方を具体的に扱います。行列とベクトルの積です。この連載の中心となる章であり、ここを理解すれば、ニュー […]
第7章 ニューロンをまとめるという考え方
こんにちは。ゆうせいです。 第6章で、ニューロン1個の計算が内積であることを確認しました。しかし、実際のニューラルネットワークには、1つの層に何百、何千というニューロンが並んでいます。GPT-2という言語モデルでは、1つ […]
第6章 内積:似ている度合いを測る
こんにちは。ゆうせいです。 第5章では、ベクトルの足し算とスカラー倍を扱いました。この二つの演算では、ベクトルどうしを計算しても、結果はベクトルのままでした。第6章で扱う内積は、性質が異なります。ベクトルとベクトルを計算 […]
第5章 ベクトルの足し算とスカラー倍:情報を混ぜる、情報を強める
こんにちは。ゆうせいです。 第4章までで、データが数値の並びになることを確認しました。第5章から、いよいよ計算に入ります。最初に扱うのは、ベクトルの足し算とスカラー倍です。この二つは、線形代数で最も単純な演算であり、計算 […]
第4章 画像も文章も数値の並びになる
こんにちは。ゆうせいです。 第3章までで、スカラー、ベクトル、行列、テンソルという入れ物が揃いました。第4章では、その入れ物に、実際のデータを詰めていきます。写真、文章、音声、表計算のデータ。これらは、私たちから見ればま […]
第3章 行列とテンソル:数値の並びを積み重ねる
こんにちは。ゆうせいです。 第2章では、スカラーとベクトルを扱いました。数値1個と、数値が1列に並んだもの。ここまでは、比較的すんなり理解できたのではないでしょうか。第3章では、その並びをさらに積み重ねていきます。ベクト […]
第2章 スカラーとベクトル:数値1個と、数値の並び
こんにちは。ゆうせいです。 第1章では、ディープラーニングにおける線形代数の役割を、大きな地図として確認しました。第2章から、具体的な道具を一つずつ手に取っていきます。最初に扱うのは、スカラーとベクトルです。この二つは、 […]
第1章 なぜディープラーニングに線形代数が必要なのか
こんにちは。ゆうせいです。 本記事から、全16章にわたって、ディープラーニングに線形代数が必要な理由を解説していきます。ディープラーニングを学び始めると、必ずと言っていいほど「線形代数を勉強してください」と言われます。し […]
ロス関数とは何か:情報量からクロスエントロピー誤差までを順を追って理解する
こんにちは。ゆうせいです。 ニューラルネットワークが学習するとき、その裏側では必ずロス関数というものが働いています。しかし、代表的なロス関数であるクロスエントロピー誤差の式を初めて見ると、対数が並んでいて、なぜこの形なの […]
機械学習ではなぜlogを取るのか:五つの理由を整理する
こんにちは。ゆうせいです。 機械学習を学んでいると、あちこちで対数が登場します。交差エントロピー誤差の式にlogがあります。尤度を最大化するとき、対数尤度を使います。前処理でデータを対数変換することもあります。損失のグラ […]
第14章 出力層:ロジット、Softmax、そして温度パラメータ
こんにちは。ゆうせいです。 第13章までで、Transformerブロックの中身がすべて揃いました。GPT-2(small)では、そのブロックが12回繰り返されます。第14章では、12個のブロックを通過した後、最終的に「 […]
第13章 MLP層とGELU:トークンごとの情報を加工する
こんにちは。ゆうせいです。 第12章までで、Transformerブロックの前半、すなわち注意機構とその周辺の仕組みが揃いました。第13章では、ブロックの後半にあたるMLP層を扱います。Transformer Expla […]
第12章 レイヤー正規化:値のばらつきを揃えて学習を安定させる
こんにちは。ゆうせいです。 第11章では、残差接続が深いモデルの学習を可能にすることを確認しました。しかし、残差接続だけでは十分ではありません。もう一つ、学習を安定させる柱があります。レイヤー正規化(Layer Norm […]
第11章 残差接続:入力をそのまま足し合わせる仕組み
こんにちは。ゆうせいです。 第10章までで、マルチヘッドアテンションによる出力が得られました。この出力は、そのまま次の処理に渡されるわけではありません。注意機構に入る前の入力が、出力に足し合わされてから、先に進みます。こ […]
第10章 マルチヘッドアテンションと出力射影:複数の視点で同時に見る
こんにちは。ゆうせいです。 第9章で、自己注意という仕組みが一通り完成しました。しかし、実際のTransformerでは、この自己注意を一つだけ動かしているわけではありません。同じ処理を複数、並列に動かしています。これが […]
第9章 Softmaxと重み付き和:文脈をベクトルに取り込む
こんにちは。ゆうせいです。 第8章までで、どのトークンがどのトークンにどれだけ注目すべきかを表すスコア行列が完成しました。しかし、この段階のスコアは、まだ確率ではありません。マイナスの値も含まれ、合計も1になっていません […]
第8章 因果マスク:未来を見えなくする仕組み
こんにちは。ゆうせいです。 第7章では、スケーリングによってスコアの大きさが調整されることを確認しました。第8章では、そのスコア行列に対して、GPT-2のような文章生成モデル特有の処理を加えます。因果マスク(Causal […]
第7章 スケーリング:なぜルートd_kで割るのか
こんにちは。ゆうせいです。 第6章では、QueryとKeyの内積によって、注意スコアが計算されることを確認しました。自己注意の数式を見ると、この内積の結果を、そのまま次の処理に渡してはいません。必ず、ある値で割り算をして […]
第6章 内積による類似度の計算:どのトークンに注目するかを決める
こんにちは。ゆうせいです。 第5章では、各トークンからQuery、Key、Valueという三つのベクトルが生成されることを確認しました。第6章では、いよいよそれらを使った計算に入ります。あるトークンのQueryと、他のす […]
第5章 Query、Key、Valueの生成:自己注意の三つの役割
こんにちは。ゆうせいです。 第4章までで、入力された文章は、各トークンが768次元のベクトルとして表現された状態になりました。ここから、Transformerの中核である自己注意の処理に入ります。Transformer […]
第4章 位置エンコーディング:語順の情報を加える
こんにちは。ゆうせいです。 第3章では、トークンIDが768次元の埋め込みベクトルに変換されることを確認しました。ここで、重大な問題が残っています。埋め込みだけでは、単語がどの順番で並んでいたかという情報が、完全に失われ […]
第3章 トークン埋め込み:単語を意味のベクトルに変える
こんにちは。ゆうせいです。 第2章では、文章がトークンに分割され、それぞれに番号(トークンID)が割り当てられることを確認しました。しかし、この番号には、意味がまったく含まれていません。IDが3797の単語とIDが379 […]
第2章 トークン化:文章を数値の単位に分ける
こんにちは。ゆうせいです。 第1章では、Transformer Explainerで可視化されている処理の全体像を確認しました。第2章では、その入口にあたるトークン化を扱います。Transformer Explainer […]
第1章 全体像:Transformer Explainerで何が見えるのか
こんにちは。ゆうせいです。 本記事から、全14章にわたって、Transformer Explainerというツールで可視化されている要素技術を、一つずつ解説していきます。Transformer Explainerは、GP […]
画像認識モデルResNetとは?名前の由来と残差接続の仕組みを初心者向けに解説
こんにちは。ゆうせいです。 画像認識の分野で広く使われているディープラーニング(深層学習)のモデルに、ResNet(レズネット)と呼ばれるネットワークがあります。ResNetは、登場以来多くの画像認識タスクにおいて高い性 […]
GitHubとは?新人エンジニアが「最終版ファイル地獄」から抜け出すためのGit入門
こんにちは。ゆうせいです。 今回は、新人エンジニア向けに「Git」と「GitHub」の基本を解説します。 いきなりですが、あなたのパソコンの中に、こんなファイル名はありませんか? 設計書_最新版.docx 設計書_最新版 […]
