|
| 1 | +ニューラルネットワーク |
| 2 | +========================== |
| 3 | + |
| 4 | +ニューラルネットワークを構成する最小の要素であるユニットは, |
| 5 | + |
| 6 | +.. math:: |
| 7 | +
|
| 8 | + u_j = \sum_{i=1}^I w_{ji} x_i + b_j,\quad |
| 9 | + z_j = f(u_j) |
| 10 | +
|
| 11 | + i \in \{1, 2, \ldots, I\},\quad |
| 12 | + j \in \{1, 2, \ldots, J\} |
| 13 | +
|
| 14 | +である.ここで, :math:`x_i` は入力, :math:`w_{ji}` は重み, :math:`b_j` はバイアス, :math:`f` は活性化関数である.ベクトル,行列を用いて表すと, |
| 15 | + |
| 16 | +.. math:: |
| 17 | +
|
| 18 | + \mathbf{u} = \mathbf{W} \mathbf{x} + \mathbf{b},\quad |
| 19 | + \mathbf{z} = f(\mathbf{u}) |
| 20 | +
|
| 21 | +となる.ここで, |
| 22 | + |
| 23 | +.. math:: |
| 24 | +
|
| 25 | + \mathbf{u} \equiv \begin{bmatrix} u_1 \\ u_2 \\ \vdots \\ u_J \end{bmatrix},\quad |
| 26 | + \mathbf{x} \equiv \begin{bmatrix} x_1 \\ x_2 \\ \vdots \\ x_I \end{bmatrix},\quad |
| 27 | + \mathbf{b} \equiv \begin{bmatrix} b_1 \\ b_2 \\ \vdots \\ b_J \end{bmatrix},\quad |
| 28 | + \mathbf{z} \equiv \begin{bmatrix} z_1 \\ z_2 \\ \vdots \\ z_J \end{bmatrix} |
| 29 | +
|
| 30 | + \mathbf{W} \equiv \begin{bmatrix} w_{11} & w_{12} & \cdots & w_{1I} \\ w_{21} & w_{22} & \cdots & w_{2I} \\ \vdots & \vdots & \ddots & \vdots \\ w_{J1} & w_{J2} & \cdots & w_{JI} \end{bmatrix},\quad |
| 31 | + \mathbf{f}(\mathbf{u}) \equiv \begin{bmatrix} f(u_1) \\ f(u_2) \\ \vdots \\ f(u_J) \end{bmatrix} . |
| 32 | +
|
| 33 | +活性化関数は,様々な種類があり,代表的なものには以下がある.最も基本的なものとしてReLU関数, |
| 34 | + |
| 35 | +.. math:: |
| 36 | +
|
| 37 | + f(u) = \max(u,0) |
| 38 | +
|
| 39 | +があり,歴史的にはsigmoid関数, |
| 40 | + |
| 41 | +.. math:: |
| 42 | +
|
| 43 | + f(u) = \frac{1}{1 + e^{-u}} |
| 44 | +
|
| 45 | +が用いらてきた.また,tanh関数 |
| 46 | + |
| 47 | +.. math:: |
| 48 | +
|
| 49 | + f(u) = \tanh(u) \equiv \frac{e^u - e^{-u}}{e^u + e^{-u}} |
| 50 | +
|
| 51 | +やleaky ReLU関数などもよく用いられる. |
| 52 | + |
| 53 | +.. math:: |
| 54 | +
|
| 55 | + f(u) = \begin{cases} u & (u \geq 0) \\ \alpha u & (u < 0) \end{cases} |
| 56 | +
|
| 57 | +なお, :math:`\alpha` は小さな正の定数である.次に,ユニットを多層化した順伝搬型ネットワークを考える.任意の :math:`L` 層のネットワークは, |
| 58 | + |
| 59 | +.. math:: |
| 60 | +
|
| 61 | + \mathbf{u}^{(l+1)} = \mathbf{W}^{(l+1)} \mathbf{z}^{(l)} + \mathbf{b}^{(l+1)} |
| 62 | +
|
| 63 | + \mathbf{z}^{(l+1)} = f(\mathbf{u}^{(l+1)}) |
| 64 | +
|
| 65 | + l \in \{1, 2, \ldots, L-1\} |
| 66 | +
|
| 67 | +である.特に, :math:`l=1` のときは入力層, :math:`l=L-1` のときは出力層,その間の層は隠れ層と呼ばれる.また,ネットワークの最終的な出力は, |
| 68 | + |
| 69 | +.. math:: |
| 70 | +
|
| 71 | + \mathbf{y} \equiv \mathbf{z}^{(L)} |
| 72 | +
|
| 73 | +と表記する.重みやバイアスはネットワークのパラメータであり,明示的に :math:`\mathbf{y}(\mathbf{x}; \mathbf{w})` のように書くこともある. |
| 74 | + |
| 75 | + |
0 commit comments