跳到主要内容

東京大学 情報理工学系研究科 電子情報学専攻 2024年8月実施 専門 第4問

Author

祭音Myyura (assisted by GPT-5)

Description

DD 次元ベクトルを入力としスカラー値を出力するモデルを学習する問題を考える。 以下,\top はベクトルおよび行列の転置,R\mathbb{R} は実数全体の集合,RD\mathbb{R}^DDD 次元実数の列ベクトル全体の集合,RD×D\mathbb{R}^{D\times D}DD 次の実数正方行列全体の集合を表す。

訓練データとして,NN 個の DD 次元ベクトル x1,,xNx_1,\ldots,x_N と,それぞれ対応する出力 y1,,yNy_1,\ldots,y_N が与えられる。ここで xiRDx_i\in\mathbb{R}^D および yiRy_i\in\mathbb{R} である (1iN)(1\leq i\leq N)。各入力ベクトルを行として縦に並べて構成した行列を

X=[x1,,xN]X=\begin{bmatrix}x_1, \dots, x_N\end{bmatrix}^\top

と書く。さらに,出力をまとめて

y=[y1,,yN]y=\begin{bmatrix}y_1, \dots, y_N\end{bmatrix}^\top

と書く。これらをもとに DD 次元のパラメータ βRD\beta\in\mathbb{R}^D を学習する。任意の入力データ xRDx\in\mathbb{R}^D が与えられたとき,その出力を

y^=βx\hat{y}=\beta^\top x

と推定する。このとき,以下の設問に答えよ。

(1) ii 番目の訓練データの入力 xix_i に対し,学習した β\beta による推定結果を

y^i=βxi(1iN)\hat{y}_i=\beta^\top x_i \qquad (1\le i\le N)

とする。真の出力 yiy_i と推定結果の誤差を

ei=yiy^ie_i=y_i-\hat y_i

と書く。このとき,誤差 eie_i の二乗和

E=i=1Nei2E=\sum_{i=1}^N e_i^2

β,X,y\beta,X,y を用いて表せ。


(2) EE を最小化するパラメータ β\beta一意に求まる必要十分条件を求めよ。また,その際に得られる β\beta を書け。 なお,変数 aRDa\in\mathbb{R}^D,定数 bRDb\in\mathbb{R}^D,定数行列 CRD×DC\in\mathbb{R}^{D\times D} に対し,次を用いてよい:

a(ba)=b,a(aCa)=(C+C)a.\frac{\partial}{\partial a}(b^\top a)=b,\qquad \frac{\partial}{\partial a}(a^\top C a)=(C+C^\top)a.

(3) EE を最小化するパラメータ β\beta が一意に求まらない場合,入力データ XX がどのような特性を持つか,定性的に述べよ。


(4) ii 番目の訓練データに対し重み wi>0w_i>0 が与えられるとする (1iN)(1\le i\le N)。この重要度を考慮した誤差二乗和を

Ew=i=1Nwiei2E_w=\sum_{i=1}^N w_i e_i^2

とする。EwE_w を最小化する β\beta一意に求まる必要十分条件を求めよ。また,その際に得られる β\beta を書け(必要に応じて新たな変数を定義してよい)。


(5) 変数が下記の値をとるとき,EwE_w を最小化する β\beta を求めよ。

x1=[1,0,1],y1=2,w1=1,x2=[0,1,1],y2=3,w2=1,x3=[2,0,1],y3=3,w3=2,x4=[1,1,0],y4=1,w4=1.\begin{aligned} x_1&=[1,0,1]^\top, & y_1&=2, & w_1&=1,\\ x_2&=[0,1,1]^\top, & y_2&=3, & w_2&=1,\\ x_3&=[2,0,1]^\top, & y_3&=3, & w_3&=2,\\ x_4&=[1,1,0]^\top, & y_4&=1, & w_4&=1. \end{aligned}

Kai

(1)

誤差 ei=yiy^i=yiβxie_i = y_i - \hat{y}_i = y_i - \beta^\top x_i

誤差ベクトル eRNe \in \mathbb{R}^N をまとめると:

e=yXβe = y - X\beta

したがって、誤差二乗和 EE

E=i=1Nei2=ee=(yXβ)(yXβ)E = \sum_{i=1}^N e_i^2 = e^\top e = (y - X\beta)^\top (y - X\beta)

(2)

まず EEβ\beta で偏微分する。

E=(yXβ)(yXβ)=yy2βXy+βXXβE = (y - X\beta)^\top (y - X\beta) = y^\top y - 2\beta^\top X^\top y + \beta^\top X^\top X \beta

よって,

Eβ=2Xy+2XXβ\frac{\partial E}{\partial \beta} = -2X^\top y + 2X^\top X\beta

極値条件(Eβ=0\frac{\partial E}{\partial \beta}=0)より:

XXβ=XyX^\top X \beta = X^\top y

これが 正規方程式 (Normal Equation) である。

  • XXX^\top X正則 であれば,一意な解が存在する。

すなわち:

det(XX)0\boxed{ \det(X^\top X) \ne 0 }

このとき最小二乗解は:

β=(XX)1Xy\boxed{ \beta = (X^\top X)^{-1} X^\top y }

(3)

一意に解が求まらない場合は,

det(XX)=0\det(X^\top X) = 0

すなわち XXX^\top X非可逆である。これは:

  • 入力データ (X) の列ベクトルが線形従属している場合(多重共線性)

ことを意味する。

(4)

重み付き誤差:

Ew=i=1Nwiei2E_w = \sum_{i=1}^N w_i e_i^2

行列表記に直すと:

Ew=(yXβ)W(yXβ)E_w = (y - X\beta)^\top W (y - X\beta)

ただし,

W=diag(w1,w2,,wN)W = \operatorname{diag}(w_1, w_2, \ldots, w_N)

偏微分して 00 におく:

Ewβ=2XWy+2XWXβ=0\frac{\partial E_w}{\partial \beta} = -2 X^\top W y + 2 X^\top W X \beta = 0

したがって:

XWXβ=XWyX^\top W X \beta = X^\top W y

一意解の条件

det(XWX)0\boxed{ \det(X^\top W X) \ne 0 }

すなわち,XX の列が線形独立であり,各 wi>0w_i>0 のとき,一意な最小値を持つ。

β=(XWX)1XWy\boxed{ \beta = (X^\top W X)^{-1} X^\top W y }

(5)

x1=[1,0,1],y1=2,w1=1,x2=[0,1,1],y2=3,w2=1,x3=[2,0,1],y3=3,w3=2,x4=[1,1,0],y4=1,w4=1.\begin{aligned} x_1&=[1,0,1]^\top, & y_1&=2, & w_1&=1,\\ x_2&=[0,1,1]^\top, & y_2&=3, & w_2&=1,\\ x_3&=[2,0,1]^\top, & y_3&=3, & w_3&=2,\\ x_4&=[1,1,0]^\top, & y_4&=1, & w_4&=1. \end{aligned}
X=[101011201110],y=[2331],W=diag(1,1,2,1)X= \begin{bmatrix} 1&0&1\\ 0&1&1\\ 2&0&1\\ 1&1&0 \end{bmatrix}, \quad y=\begin{bmatrix}2\\3\\3\\1\end{bmatrix}, \quad W=\operatorname{diag}(1,1,2,1)
XWX=[1015121514],XWy=[15411].X^\top W X= \begin{bmatrix} 10&1&5\\ 1&2&1\\ 5&1&4 \end{bmatrix}, \quad X^\top W y= \begin{bmatrix} 15\\ 4\\ 11 \end{bmatrix}.

よって

β=(XWX)1XWy=[5/1310/1327/13]\beta=(X^\top W X)^{-1} X^\top W y =\begin{bmatrix} 5/13 \\ 10/13 \\ 27/13 \\ \end{bmatrix}