京都大学 情報学研究科 システム科学専攻 2018年8月実施 専門科目 確率統計
Author
uogxtc , 祭音Myyura
Description
問題1
確率変数 Z i = ( X i , Y i ) , i = 1 , … , n Z_i = (X_i, Y_i), i = 1, \ldots, n Z i = ( X i , Y i ) , i = 1 , … , n は独立に次のように定義される確率分布に従う。
各 X i , Y i X_i, Y_i X i , Y i は 0 0 0 または 1 1 1 を値にとり、 P ( X i = 1 ) = α P(X_i = 1) = \alpha P ( X i = 1 ) = α , P ( Y i = 1 ∣ X i ) = β X i P(Y_i = 1 | X_i) = \beta X_i P ( Y i = 1∣ X i ) = β X i とする(一般に X i X_i X i と Y i Y_i Y i は独立ではない)。
ただし n n n は正の整数、 0 < α < 1 0 < \alpha < 1 0 < α < 1 , 0 < β < 1 0 < \beta < 1 0 < β < 1 は未知パラメータである。
このとき以下の設問に答えなさい。
(1) 同時確率 P ( X i = x , Y i = y ) P(X_i = x, Y_i = y) P ( X i = x , Y i = y ) を ( x , y ) (x, y) ( x , y ) の取りうるすべての値について求めなさい。ただし α , β \alpha, \beta α , β を用いること。
(2) Z i , i = 1 , … , n Z_i, i = 1, \ldots, n Z i , i = 1 , … , n をすべて用いて、 α , β \alpha, \beta α , β の最尤推定量 α ^ n , β ^ n \hat{\alpha}_n, \hat{\beta}_n α ^ n , β ^ n を求めなさい。
(3) 制約条件 α + β = 1 \alpha + \beta = 1 α + β = 1 を仮定する。このとき、 Z i , i = 1 , … , n Z_i, i = 1, \ldots, n Z i , i = 1 , … , n をすべて用いて、 α \alpha α の最尤推定量 α ^ n \hat{\alpha}_n α ^ n を求めなさい。
(4) 設問 (3) の α ^ n \hat{\alpha}_n α ^ n は極限 n → ∞ n \to \infty n → ∞ においてある値に確率収束する。その値を求めなさい。
問題2
袋の中に N N N (N = 1 , 2 , … N = 1, 2, \ldots N = 1 , 2 , … ) 個のボールがあり、そのうち m m m (m ∈ { 0 , 1 , … , N } m \in \{0, 1, \ldots, N\} m ∈ { 0 , 1 , … , N } ) 個は赤色、残りは白色である。
袋から、ランダムかつ同時に n n n (n ∈ { 1 , … , N } n \in \{1, \ldots, N\} n ∈ { 1 , … , N } ) 個取り出した際にその中で赤色であるボールの個数を確率変数 X X X (X ∈ { 0 , 1 , … , n } X \in \{0, 1, \ldots, n\} X ∈ { 0 , 1 , … , n } ) で表すことにする。以下の設問 (1), (2) に答えなさい。
(1) X = k X = k X = k (k = 0 , 1 , … , n k = 0, 1, \ldots, n k = 0 , 1 , … , n ) となる確率 P ( X = k ) P(X = k) P ( X = k ) を求めなさい。
(2) 確率変数 X X X の期待値を求めなさい。
袋の中に白いボールが多数入っている。
その個数が分からないので未知パラメータ N N N とおき、これを以下の手続きで見積もることにした。まず、袋の中からランダムかつ同時に m m m 個を取り出し赤く塗った。それらを袋に戻しよくかき混ぜた。
その後、今度は袋の中からランダムかつ同時に n n n 個のボールを取り出したところ、そのうち k k k (k ∈ { 0 , 1 , … , n } k \in \{0, 1, \ldots, n\} k ∈ { 0 , 1 , … , n } ) 個が赤く塗られていた。
N , m , n N, m, n N , m , n は正の整数である。以下の設問 (3) ~ (5) に答えなさい。
(3) N N N に関する尤度 L ( N ) L(N) L ( N ) を求めなさい。
(4) 設問 (3) の L ( N ) L(N) L ( N ) について、 L ( N ) / L ( N − 1 ) L(N)/L(N-1) L ( N ) / L ( N − 1 ) (ただし N = 2 , 3 , … N = 2, 3, \ldots N = 2 , 3 , … )を計算しなさい。
(5) N N N の最尤推定値を求めなさい。ただし k ≥ 1 k \geq 1 k ≥ 1 とする。
Kai
問題1
(1)
The posterior is given by
Pr ( X i = x , Y i = y ) = Pr ( Y i = y ∣ X i = x ) Pr ( X i = x ) , \Pr(X_i=x,Y_i=y)=\Pr(Y_i=y\mid X_i=x)\Pr(X_i=x), Pr ( X i = x , Y i = y ) = Pr ( Y i = y ∣ X i = x ) Pr ( X i = x ) ,
and we easily obtain that
P r ( X i = 1 , Y i = 1 ) = β α , P r ( X i = 1 , Y i = 0 ) = ( 1 − β ) α , P r ( X i = 0 , Y i = 1 ) = 0 , P r ( X i = 0 , Y i = 0 ) = 1 − α , \begin{aligned}
&\mathrm{Pr}(X_{i}=1,Y_{i}=1)=\beta\alpha,\\
&\mathrm{Pr}(X_{i}=1,Y_{i}=0)=(1-\beta)\alpha,\\
&\mathrm{Pr}(X_{i}=0,Y_{i}=1)=0,\\
&\mathrm{Pr}(X_{i}=0,Y_{i}=0)=1-\alpha,
\end{aligned} Pr ( X i = 1 , Y i = 1 ) = β α , Pr ( X i = 1 , Y i = 0 ) = ( 1 − β ) α , Pr ( X i = 0 , Y i = 1 ) = 0 , Pr ( X i = 0 , Y i = 0 ) = 1 − α ,
which is exactly
Pr ( X i = x , Y i = y ) = ( β α ) x y [ ( 1 − β ) α ] x ( 1 − y ) 0 ( x − 1 ) y ( 1 − α ) ( 1 − x ) ( 1 − y ) \begin{aligned}
\Pr(X_{i}=x,Y_{i}=y)=(\beta\alpha)^{xy}\left[(1-\beta)\alpha\right]^{x(1-y)}0^{(x-1)y}(1-\alpha)^{(1-x)(1-y)}
\end{aligned} Pr ( X i = x , Y i = y ) = ( β α ) x y [ ( 1 − β ) α ] x ( 1 − y ) 0 ( x − 1 ) y ( 1 − α ) ( 1 − x ) ( 1 − y )
(2)
The likelihood is
L = ∏ i = 1 n Pr ( Z i ) , L=\prod_{i=1}^n\Pr(Z_i), L = i = 1 ∏ n Pr ( Z i ) ,
and the log-likelihood is
log L = ∑ i = 1 n { X i Y i log ( α β ) + X i ( 1 − Y i ) log [ ( 1 − β ) α ] + ( X i − 1 ) Y i log 0 + ( 1 − X i ) ( 1 − Y i ) log ( 1 − α ) } \log L=\sum_{i=1}^{n} \Big\{ X_{i}Y_{i}\log(\alpha\beta)+X_{i}(1-Y_{i})\log[(1-\beta)\alpha]
+(X_{i}-1)Y_{i}\log0+(1-X_{i})(1-Y_{i})\log(1-\alpha) \Big\} log L = i = 1 ∑ n { X i Y i log ( α β ) + X i ( 1 − Y i ) log [( 1 − β ) α ] + ( X i − 1 ) Y i log 0 + ( 1 − X i ) ( 1 − Y i ) log ( 1 − α ) }
Let ∂ log L ∂ α = 0 \frac{\partial\log L}{\partial\alpha}=0 ∂ α ∂ l o g L = 0 and we get
( 1 − α ) ∑ i = 1 n X i − α ∑ i = 1 n ( 1 − X i ) ( 1 − Y i ) = 0 , (1-\alpha)\sum_{i=1}^nX_i-\alpha\sum_{i=1}^n(1-X_i)(1-Y_i)=0, ( 1 − α ) i = 1 ∑ n X i − α i = 1 ∑ n ( 1 − X i ) ( 1 − Y i ) = 0 ,
α ^ n = ∑ i = 1 n X i ∑ i = 1 n ( 1 − Y i + X i Y i ) . \hat{\alpha}_n=\frac{\sum_{i=1}^nX_i}{\sum_{i=1}^n(1-Y_i+X_iY_i)}. α ^ n = ∑ i = 1 n ( 1 − Y i + X i Y i ) ∑ i = 1 n X i .
Similarly, ∂ log L ∂ β = 0 \frac{\partial\log L}{\partial\beta}=0 ∂ β ∂ l o g L = 0 gives
( 1 − β ) ∑ i = 1 n X i Y i − β ∑ i = 1 n X i ( 1 − Y i ) = 0 , (1-\beta)\sum_{i=1}^nX_iY_i-\beta\sum_{i=1}^nX_i(1-Y_i)=0, ( 1 − β ) i = 1 ∑ n X i Y i − β i = 1 ∑ n X i ( 1 − Y i ) = 0 ,
β ^ n = ∑ i = 1 n X i Y i ∑ i = 1 n X i . \hat{\beta}_n=\frac{\sum_{i=1}^nX_iY_i}{\sum_{i=1}^nX_i}. β ^ n = ∑ i = 1 n X i ∑ i = 1 n X i Y i .
(3)
Substitute β \beta β by 1 − α 1- \alpha 1 − α in the log-likelihood and we have
log L = ∑ i = 1 n { X i Y i log ( α ( 1 − α ) ) + X i ( 1 − Y i ) log ( α 2 ) + ( X i − 1 ) Y i log 0 + ( 1 − X i ) ( 1 − Y i ) log ( 1 − α ) } . \log L=\sum_{i=1}^{n} \Big\{ X_{i}Y_{i}\log(\alpha(1-\alpha))+X_{i}(1-Y_{i})\log(\alpha^{2})\\+(X_{i}-1)Y_{i}\log 0+(1-X_{i})(1-Y_{i})\log(1-\alpha) \Big\}. log L = i = 1 ∑ n { X i Y i log ( α ( 1 − α )) + X i ( 1 − Y i ) log ( α 2 ) + ( X i − 1 ) Y i log 0 + ( 1 − X i ) ( 1 − Y i ) log ( 1 − α ) } .
Let ∂ log L ∂ α = 0 \frac{\partial\log L}{\partial\alpha}=0 ∂ α ∂ l o g L = 0 and then we get
α ^ n = 2 ∑ X i − ∑ X i Y i n + ∑ X i − ∑ Y i + ∑ X i Y i . \hat{\alpha}_n=\frac{2\sum X_i-\sum X_iY_i}{n+\sum X_i-\sum Y_i + \sum X_iY_i}. α ^ n = n + ∑ X i − ∑ Y i + ∑ X i Y i 2 ∑ X i − ∑ X i Y i .
(4)
When n → ∞ n \to \infty n → ∞ ,
∑ X i → n E [ X i = 1 ] = α n ∑ Y i → n E [ Y i = 1 ] = α β n ∑ X i Y i → n E [ X i = 1 , Y i = 1 ] = α β n \begin{aligned}
&\sum X_{i}\to n\mathbb{E}[X_i=1]=\alpha n\\
&\sum Y_{i}\to n\mathbb{E}[Y_i=1]=\alpha\beta n\\
&\sum X_{i}Y_{i}\to n\mathbb{E}[X_i=1,Y_i=1]=\alpha \beta n
\end{aligned} ∑ X i → n E [ X i = 1 ] = α n ∑ Y i → n E [ Y i = 1 ] = α β n ∑ X i Y i → n E [ X i = 1 , Y i = 1 ] = α β n
Since α ^ n \hat{\alpha}_{n} α ^ n converges, it converges to
lim n → ∞ α ^ n = 2 α n − α β n n + α n = 2 α − α β 1 + α = α . \lim\limits_{n\to\infty}\hat{\alpha}_n=\frac{2\alpha n-\alpha\beta n}{n+\alpha n}=\frac{2\alpha-\alpha\beta}{1+\alpha} = \alpha. n → ∞ lim α ^ n = n + α n 2 α n − α β n = 1 + α 2 α − α β = α .
問題2
(1)
(Readers may refer to hypergeometric distribution, 超几何分布,超幾何分布.)
Pr ( X = k ) = ( m k ) ( N − m n − k ) ( N n ) . \Pr(X=k)=\frac{\binom{m}{k}\binom{N-m}{n-k}}{\binom{N}{n}}. Pr ( X = k ) = ( n N ) ( k m ) ( n − k N − m ) .
(2)
E [ X ] = ∑ i = 1 n Pr ( X = k ) ⋅ k \mathbb{E}[X]=\sum_{i=1}^n\Pr(X=k)\cdot k E [ X ] = i = 1 ∑ n Pr ( X = k ) ⋅ k
Note that
k ( m k ) = m ! ( k − 1 ) ! ( m − k ) ! = ( m − 1 ) ! m ( k − 1 ) ! ( m − k ) ! = m ( m − 1 k − 1 ) . \begin{aligned}
k\binom{m}{k}&=\frac{m!}{(k-1)!(m-k)!}\\
&=\frac{(m-1)!m}{(k-1)!(m-k)!}\\
&=m\binom{m-1}{k-1}.
\end{aligned} k ( k m ) = ( k − 1 )! ( m − k )! m ! = ( k − 1 )! ( m − k )! ( m − 1 )! m = m ( k − 1 m − 1 ) .
Then
k ⋅ Pr ( X = k ) = m ( m − 1 k − 1 ) ( N − m n − k ) ( N n ) = m ( m − 1 k − 1 ) ( ( N − 1 ) − ( m − 1 ) ( n − 1 ) − ( k − 1 ) ) N n ( N − 1 n − 1 ) . k \cdot \Pr(X=k)=\frac{m\binom{m-1}{k-1}\binom{N-m}{n-k}}{\binom{N}{n}}=\frac{m\binom{m-1}{k-1}\binom{(N-1)-(m-1)}{(n-1)-(k-1)}}{\frac{N}{n}\binom{N-1}{n-1}}. k ⋅ Pr ( X = k ) = ( n N ) m ( k − 1 m − 1 ) ( n − k N − m ) = n N ( n − 1 N − 1 ) m ( k − 1 m − 1 ) ( ( n − 1 ) − ( k − 1 ) ( N − 1 ) − ( m − 1 ) ) .
The expectation becomes
E [ X ] = ∑ k = 1 n m n N [ ( m − 1 k − 1 ) ( ( N − 1 ) − ( m − 1 ) ( n − 1 ) − ( k − 1 ) ) ( N − 1 n − 1 ) ] = m n N ∑ k = 1 n [ ( m − 1 k − 1 ) ( ( N − 1 ) − ( m − 1 ) ( n − 1 ) − ( k − 1 ) ) ( N − 1 n − 1 ) ] ⏟ = 1 , as all probabilities sum to 1. = m n N . \begin{aligned}
\mathbb{E}[X]& =\sum_{k=1}^n\frac{mn}{N}\bigg[\frac{\binom{m-1}{k-1}\binom{(N-1)-(m-1)}{(n-1)-(k-1)}}{\binom{N-1}{n-1}}\bigg] \\
&=\frac{mn}N\underbrace{\sum_{k=1}^n\left[\frac{\binom{m-1}{k-1}\binom{(N-1)-(m-1)}{(n-1)-(k-1)}}{\binom{N-1}{n-1}}\right]}_{=1,\text{ as all probabilities sum to 1.}} \\
&=\frac{mn}{N}.
\end{aligned} E [ X ] = k = 1 ∑ n N mn [ ( n − 1 N − 1 ) ( k − 1 m − 1 ) ( ( n − 1 ) − ( k − 1 ) ( N − 1 ) − ( m − 1 ) ) ] = N mn = 1 , as all probabilities sum to 1. k = 1 ∑ n [ ( n − 1 N − 1 ) ( k − 1 m − 1 ) ( ( n − 1 ) − ( k − 1 ) ( N − 1 ) − ( m − 1 ) ) ] = N mn .
(3)
(For (3) and (4), readers may refer to Mark-recapture method, 標識再捕法.)
The likelihood is
L ( N ) = Pr ( X = k ) ⏟ function of n , k and parameterized by N = ( m k ) ( N − m n − k ) ( N n ) . L(N)=\underbrace{\Pr(X=k)}_{\text{ function of } n,k \text{ and parameterized by }N}=\frac{\binom{m}{k}\binom{N-m}{n-k}}{\binom{N}{n}}. L ( N ) = function of n , k and parameterized by N Pr ( X = k ) = ( n N ) ( k m ) ( n − k N − m ) .
(4)
L ( N ) L ( N − 1 ) = ( N − m n − k ) ( N − m − 1 n − k ) ⋅ ( N − 1 n ) ( N n ) = N − m N − m − n + k ⋅ N − n N . \begin{aligned}
\frac{L(N)}{L(N-1)}& =\frac{\binom{N-m}{n-k}}{\binom{N-m-1}{n-k}}\cdot\frac{\binom{N-1}{n}}{\binom{N}{n}} \\
&=\frac{N-m}{N-m-n+k}\cdot\frac{N-n}{N}.
\end{aligned} L ( N − 1 ) L ( N ) = ( n − k N − m − 1 ) ( n − k N − m ) ⋅ ( n N ) ( n N − 1 ) = N − m − n + k N − m ⋅ N N − n .
(5)
L ( N ) L(N) L ( N ) is positive.
When L ( N ) / L ( N − 1 ) ≤ 1 L(N)/L(N-1) \leq 1 L ( N ) / L ( N − 1 ) ≤ 1 ,
N − m N − m − n + k ⋅ N − n N ≤ 1 , ⇒ N ≥ m n k , \begin{aligned}
&\frac{N-m}{N-m-n+k} \cdot \frac{N-n}{N}\leq1,\\
&\Rightarrow\quad N \geq \frac{mn}{k},
\end{aligned} N − m − n + k N − m ⋅ N N − n ≤ 1 , ⇒ N ≥ k mn ,
L ( N ) L(N) L ( N ) monotonely decreases.
When L ( N ) / L ( N − 1 ) ≥ 1 L(N)/L(N-1) \geq 1 L ( N ) / L ( N − 1 ) ≥ 1 , i.e.,
N ≤ m n k , N \leq \frac{mn}{k}, N ≤ k mn ,
L ( N ) L(N) L ( N ) monotonely increases.
So the maximum likelihood estimate of N N N would be N ^ = ⌊ m n / k ⌋ \hat{N}=\lfloor mn/k\rfloor N ^ = ⌊ mn / k ⌋ , floored as N N N is a positive integer.