跳到主要内容

東京工業大学 環境・社会理工学院 融合理工学系 2020年8月実施 概率统计

Author

思齐塾, 祭音Myyura

Description

X を確率変数とし,X の確率密度関数を pX(x)p_X(x) とする。任意の関数 f(x)f(x) の期待値 f(x)\langle f(x) \rangle は以下のように定義される。

f(x)=f(x)pX(x)dx\langle f(x) \rangle = \int_{-\infty}^{\infty} f(x)p_X(x)dx

(1)

このとき, pX(x)p_X(x) に従ってサンプリングされた X の M 個の実現値(これを標本と呼ぶ)の集合を {xi}\{x_i\} ( i=1,2,,Mi=1,2,\ldots,M ) と表わすと, f(x)f(x) の期待値は近似的に

f(x)1Mi=1Mf(xi)\langle f(x) \rangle \approx \frac{1}{M} \sum_{i=1}^{M} f(x_i)

(2)

によって求められる。このことを用いて任意の関数の積分を求める方法について以下の問 1~6 に答えよ。

  1. 標本から求められたある母数の推定量の期待値が真の母数に等しいとき,その推定量を不偏推定量と呼ぶ。式 (2) の右辺は真の期待値 f(x)\langle f(x) \rangle の不偏推定量であることを示せ。

  2. 式 (2) の右辺の誤差を ε とすると,

ε=1M{i=1Mf(xi)f(x)}\varepsilon = \left| \frac{1}{M} \left\{ \sum_{i=1}^{M} f(x_i) - \langle f(x) \rangle \right\} \right|

(3)

と表わされる。関数 f(x)f(x) について μf=f(x)\mu_f = \langle f(x) \rangleσf2=(f(x)μf)2pX(x)dx\sigma_f^2 = \int (f(x) - \mu_f)^2 p_X(x) dx とすると,式 (3) の右辺第 1 項の中括弧内は, MM \to \infty のとき中心極限定理によって平均 MμfM \mu_f ,分散 Mσf2M \sigma_f^2 なる正規確率変数に収束する。

このことを用いて,ε は平均 0,分散 σf2/M\sigma_f^2 / M なる正規分布に従うことを示せ。

  1. 問 2 の結果を用いて,式 (2) の近似の収束の速さを M のオーダーとして表わせ。例えば,M が 2 倍になったときに近似の誤差が 1/4 になるのであれば,収束の速さは M2M^{-2} である。

  2. f(x)f(x) が実数区間 [a,b] において定義されるものとする。 pX(x)p_X(x) が区間 [a,b] における一様分布のとき,その確率密度関数を用いて式 (1) を書き改めよ。

  3. 次の定積分の値 α を求めよ。

α=011x2dx\alpha = \int_0^1 \sqrt{1-x^2} dx

(4)

  1. 問 4 を参考にして,式 (4) の定積分を区間 [0,1] の一様乱数を用いて求めるアルゴリズム(手順)をフローチャートまたは箇条書きによって説明せよ。

题目描述

设随机变量 XX 的概率密度函数为 pX(x)p_X(x)。对任意函数 f(x)f(x),定义

f(x)=f(x)pX(x)dx.(1)\langle f(x)\rangle =\int_{-\infty}^{\infty}f(x)p_X(x)\,dx. \tag{1}

若按 pX(x)p_X(x) 抽取 XXMM 个实现值(样本){xi}\{x_i\}i=1,2,,Mi=1,2,\ldots,M,则可用

f(x)1Mi=1Mf(xi)(2)\langle f(x)\rangle \approx\frac1M\sum_{i=1}^{M}f(x_i) \tag{2}

近似计算期望,并由此计算函数积分。回答以下第 1 至第 6 问。

  1. 若由样本构造的参数估计量之期望等于参数真值,则称其为无偏估计量。证明式 (2) 右端是 f(x)\langle f(x)\rangle 的无偏估计量。

  2. 现有题面把式 (2) 右端的误差 ε\varepsilon 写成

    ε=1M{i=1Mf(xi)f(x)}.(3)\varepsilon =\left| \frac1M\left\{ \sum_{i=1}^{M}f(x_i)-\langle f(x)\rangle \right\} \right|. \tag{3}

    对函数 ff 定义

    μf=f(x),σf2=(f(x)μf)2pX(x)dx.\mu_f=\langle f(x)\rangle,\qquad \sigma_f^2=\int\bigl(f(x)-\mu_f\bigr)^2p_X(x)\,dx.

    题面继而说明:当 MM\to\infty 时,式 (3) 中大括号涉及的样本和依据中心极限定理趋近于均值 MμfM\mu_f、方差 Mσf2M\sigma_f^2 的正态随机变量,并要求据此说明 ε\varepsilon 服从均值 00、方差 σf2/M\sigma_f^2/M 的正态分布。

  3. 利用第 2 问的结果,以 MM 的幂次表示式 (2) 近似的收敛速度。例如,若 MM 加倍时误差变为原来的 1/41/4,则收敛速度记作 M2M^{-2}

  4. f(x)f(x) 定义在实区间 [a,b][a,b] 上。当 pX(x)p_X(x)[a,b][a,b] 上均匀分布的概率密度时,用该密度改写式 (1),从而给出区间积分与均匀分布期望的关系。

  5. 求定积分

    α=011x2dx.(4)\alpha=\int_0^1\sqrt{1-x^2}\,dx. \tag{4}
  6. 参考第 4 问,用流程图或分点步骤说明一个使用 [0,1][0,1] 上均匀随机数近似计算式 (4) 的算法。

题面一致性边界:现有式 (3) 在样本和中减去的是 μf\mu_f,而标准的样本均值误差应减去 MμfM\mu_f;此外,带绝对值的 ε0\varepsilon\geq0 不可能服从均值为零的正态分布。Kai 能唯一确认的预期结论是针对符号误差

δM=i=1Mf(xi)MμfM,δM M N ⁣(0,σf2M),\delta_M=\frac{\sum_{i=1}^{M}f(x_i)-M\mu_f}{M}, \qquad \delta_M\ \mathop{\sim}_{M\to\infty}\ N\!\left(0,\frac{\sigma_f^2}{M}\right),

而真正的绝对误差 δM|\delta_M| 渐近服从半正态分布。这里保留现有题面的式 (3) 和原要求,并明确这一无法从缺失原稿进一步消解的冲突。

Kai

1.

X1,,XMX_1,\ldots,X_MpXp_X に従う独立同分布標本とし、

μ^f=1Mi=1Mf(Xi),μf=f(X)\widehat\mu_f=\frac1M\sum_{i=1}^M f(X_i),\qquad \mu_f=\langle f(X)\rangle

とおく。期待値の線形性より

E[μ^f]=1Mi=1ME[f(Xi)]=1MMμf=μf.E[\widehat\mu_f] =\frac1M\sum_{i=1}^M E[f(X_i)] =\frac1M\cdot M\mu_f =\mu_f.

したがって、

μ^f は μf の不偏推定量である。\boxed{\widehat\mu_f\text{ は }\mu_f\text{ の不偏推定量である。}}

2.

問題文の式 (3) とその直後の結論には、次の二つの数式上の不整合がある。

  1. 標本平均の誤差は
1Mi=1Mf(Xi)μf=1Mi=1Mf(Xi)Mμf \left|\frac1M\sum_{i=1}^M f(X_i)-\mu_f\right| =\frac1M\left|\sum_{i=1}^M f(X_i)-M\mu_f\right|

であり、中括弧内で引くべき量は μf\mu_f ではなく MμfM\mu_f である。 2. 絶対誤差 ε0\varepsilon\ge0 が「平均 0 の正規分布」に従うことはあり得ない。

意図された 符号付き誤差

δM=μ^fμf=i=1Mf(Xi)MμfM\delta_M=\widehat\mu_f-\mu_f =\frac{\sum_{i=1}^M f(X_i)-M\mu_f}{M}

と定義する。中心極限定理により

i=1Mf(Xi) M N(Mμf,Mσf2)\sum_{i=1}^M f(X_i)\ \mathop{\sim}_{M\to\infty}\ N(M\mu_f,M\sigma_f^2)

なので、線形変換によって

δM M N(0,σf2M).\boxed{\delta_M\ \mathop{\sim}_{M\to\infty}\ N\left(0,\frac{\sigma_f^2}{M}\right)}.

一方、真の絶対誤差 ε=δM\varepsilon=|\delta_M| は漸近的に半正規分布に従い、

E[ε]σfM2π,Var(ε)σf2M(12π).E[\varepsilon]\sim\frac{\sigma_f}{\sqrt M}\sqrt{\frac2\pi},\qquad \operatorname{Var}(\varepsilon)\sim\frac{\sigma_f^2}{M}\left(1-\frac2\pi\right).

したがって、問題文が主張する平均 0、分散 σf2/M\sigma_f^2/M の正規分布は、 ε\varepsilon ではなく δM\delta_M に対する結論である。

3.

問2より符号付き誤差の標準偏差は

Var(δM)=σfM.\sqrt{\operatorname{Var}(\delta_M)}=\frac{\sigma_f}{\sqrt M}.

絶対誤差の典型的な大きさも同じ次数なので、収束の速さは

M1/2.\boxed{M^{-1/2}}.

例えば標本数を 4 倍にして、初めて典型誤差が約 1/21/2 になる。

4.

区間 [a,b][a,b] の一様分布の確率密度は

pX(x)={1ba,axb,0,それ以外p_X(x)=\begin{cases}\dfrac1{b-a},&a\le x\le b,\\0,&\text{それ以外}\end{cases}

である。したがって式 (1) は

f(X)=1baabf(x)dx,\boxed{\langle f(X)\rangle=\frac1{b-a}\int_a^b f(x)\,dx},

すなわち

abf(x)dx=(ba)f(X)\boxed{\int_a^b f(x)\,dx=(b-a)\langle f(X)\rangle}

と書き改められる。

5.

x=sinθx=\sin\theta0θπ/20\le\theta\le\pi/2 )とおくと

α=0π/2cos2θdθ=[θ2+sin2θ4]0π/2=π4.\begin{aligned} \alpha &=\int_0^{\pi/2}\cos^2\theta\,d\theta =\left[\frac{\theta}{2}+\frac{\sin2\theta}{4}\right]_0^{\pi/2}\\ &=\boxed{\frac{\pi}{4}}. \end{aligned}

これは単位円の第1象限部分の面積とも一致する。

6.

区間の長さが 11 なので、問4より α=E[1X2]\alpha=E[\sqrt{1-X^2}]XU[0,1]X\sim U[0,1] )である。モンテカルロ法の手順は次のとおり。

  1. 標本数 MM を定め、和 S=0S=0 とする。
  2. i=1,,Mi=1,\ldots,M について、独立な一様乱数 Ui[0,1]U_i\in[0,1] を生成する。
  3. 各回で SS+1Ui2S\leftarrow S+\sqrt{1-U_i^2} と更新する。
α^M=SM \boxed{\widehat\alpha_M=\frac{S}{M}}

を積分値として出力する。

この推定量は不偏であり、その標準誤差は、 Yi=1Ui2Y_i=\sqrt{1-U_i^2} の標本標準偏差を sYs_Y とすれば sY/Ms_Y/\sqrt M で推定できる。必要な精度に達していなければ MM を増やして同じ手順を繰り返す。