1

平均値の定理からデルタ法へ~テイラー展開と剰余項による線形化~

63
0
$$$$

平均値の定理からデルタ法へ ― テイラー展開・解析性・剰余項

平均値の定理は「区間の両端の値の差を,途中の一点の微分係数で書く」という等式である。微分の定義からロルの定理を経てほぼ機械的に出てくる。これを $n$ 次まで押し進めるとテイラーの定理になり,近似の精度は剰余項をどう抑えるかに集約される。同じ「一点で線形化して残りを誤差に押し込む」発想は,統計で非線形変換 $g(\bar{X}_{n})$ の漸近分布を求めるデルタ法にもそのまま効く。$\bar{X}_{n}$ の揺らぎが中心極限定理で正規と分かっていれば,$g$ を平均まわりで一次近似し,傾き $g'$ で分散を移すだけでよい。

ロルの定理から出発して,この流れを一通り辿る。中心極限定理やスルツキーの定理は既知として証明を省く。

1. 平均値の定理の階層

平均値の定理はどれも,根っこは最大値・最小値の定理(=実数の連続性)にある。まずロルの定理を出し,割線を測る補助関数を差し替えていくだけで,ラグランジュ・コーシーが順に得られる。

1.1 ロルの定理

ロルの定理

$f$ が閉区間 $[a,b]$ で連続,開区間 $(a,b)$ で微分可能で,$f(a)=f(b)$ を満たすとする。このとき $f'(c)=0$ となる $c\in(a,b)$ が少なくとも1つ存在する。

最大値・最小値の定理より,$f$$[a,b]$ 上で最大値と最小値をとる。$f$ が定数ならば任意の点で $f'=0$ となり主張は自明である。定数でないときは,ある $x_{0}\in(a,b)$ が存在して $f(x_{0})\neq f(a)$ である。$f(x_{0})>f(a)$ ならば最大値は端点 $a,b$(ともに値 $f(a)$)では達成されず,$f(x_{0})< f(a)$ ならば最小値が端点では達成されないから,いずれの場合も最大値または最小値の少なくとも一方が開区間内部の点 $c$ で達成される。一般性を失わず $c$ で最大値をとるとすると,任意の微小な $h$ に対して $f(c+h)\le f(c)$ が成り立つから
$$ \lim_{h\to+0}\frac{f(c+h)-f(c)}{h}\le0,\qquad \lim_{h\to-0}\frac{f(c+h)-f(c)}{h}\ge0 $$
となる。$f$$c$ で微分可能で両側極限が一致するから,これを満たすのは $f'(c)=0$ のみである。

1.2 ラグランジュの平均値の定理

ラグランジュの平均値の定理

$f$ が閉区間 $[a,b]$ で連続,開区間 $(a,b)$ で微分可能ならば,
$$ \frac{f(b)-f(a)}{b-a}=f'(c) $$
を満たす $c\in(a,b)$ が存在する。

区間幅を $h=b-a$,内分点を $c=a+\theta h\ (0<\theta<1)$ と書けば,これは剰余項付き1次近似 $f(a+h)=f(a)+f'(a+\theta h)\,h$ にほかならない。

割線との差を測る補助関数
$$ F(x)=f(x)-\left(f(a)+\frac{f(b)-f(a)}{b-a}(x-a)\right) $$
を定めると $F(a)=F(b)=0$ である。rolle より $F'(c)=0$ を満たす $c\in(a,b)$ が存在し,
$$ F'(x)=f'(x)-\frac{f(b)-f(a)}{b-a} $$
であるから $f'(c)=\dfrac{f(b)-f(a)}{b-a}$ を得る。

$(a,b)$ 全体で $|f'(x)|\le M$ なら,任意の $x_1,x_2\in[a,b]$ に対して $|f(x_1)-f(x_2)|\le M\,|x_1-x_2|$,すなわちリプシッツ連続が従う。

1.3 コーシーの平均値の定理

コーシーの平均値の定理

$f,g$ が閉区間 $[a,b]$ で連続,開区間 $(a,b)$ で微分可能で,$(a,b)$ 上で $g'(x)\neq0$ とする。このとき
$$ \frac{f(b)-f(a)}{g(b)-g(a)}=\frac{f'(c)}{g'(c)} $$
を満たす $c\in(a,b)$ が存在する。

一般形は $\big(f(b)-f(a)\big)g'(c)=\big(g(b)-g(a)\big)f'(c)$ と書けて $g'(c)=0$ も許すが,あとでロピタルに使うので比の形で述べ,そのために $(a,b)$ 全体で $g'(x)\neq0$ という少し強い仮定を置いておく。この仮定のもとで $g$ は単射である:もし $g(u)=g(v)$$a\le u< v\le b$)なら $[u,v]$rolle を適用して $g'(c)=0$$c\in(u,v)$)となり矛盾する。したがって $g(a)\neq g(b)$ で左辺の分母は $0$ にならない(この単射性は後のロピタルの証明でも効く)。

補助関数
$$ H(x)=f(x)-f(a)-\frac{f(b)-f(a)}{g(b)-g(a)}\big(g(x)-g(a)\big) $$
$H(a)=H(b)=0$ を満たす。rolle より $H'(c)=0$ となる $c\in(a,b)$ が存在し,
$$ H'(c)=f'(c)-\frac{f(b)-f(a)}{g(b)-g(a)}\,g'(c)=0 $$
となる。$g'(c)\neq0$ で整理して主張を得る。

1.4 ロピタルの定理

コーシーの平均値の定理をそのまま回すと,$\infty/\infty$ 型のロピタルが出る。ここでは分母が発散する片側極限を,極限値 $L$ が有限実数の場合に扱う。$f$ の極限は仮定せず,分母 $g$ の発散だけでよい($L=\pm\infty$ まで含めるなら証明を別途補強する)。

ロピタルの定理(分母発散型・片側極限,有限極限の場合)

$f,g$$(a,b)$ で微分可能,$(a,b)$ 上で $g'(x)\neq0$ とし,$\displaystyle\lim_{x\to a+0}|g(x)|=\infty$ とする。さらに,ある有限実数 $L\in\mathbb{R}$ に対して
$$ \lim_{x\to a+0}\frac{f'(x)}{g'(x)}=L $$
が成り立つならば,
$$ \lim_{x\to a+0}\frac{f(x)}{g(x)}=L $$
が成り立つ。

見通しを先に述べておく。区間 $[x,d]$ でコーシーの平均値の定理を使うと $f/g$$f'/g'$ の値でほぼ書けるが,そこに固定端点 $d$ の寄与 $f(d),g(d)$ が混ざる。分母 $g(x)$$\infty$ に飛ぶので,この端点の寄与は $x\to a+0$ で薄まって消え,$f'/g'\to L$ だけが残る,というのが仕掛けである。

任意に $\varepsilon>0$ をとる。仮定より,ある $d\in(a,b)$ が存在して,すべての $c\in(a,d)$
$$ \left|\frac{f'(c)}{g'(c)}-L\right|<\frac{\varepsilon}{2} $$
が成り立つ。$d$ を固定し,$a< x< d$ を任意にとる。$x,d\in(a,b)$ であり $f,g$$(a,b)$ で微分可能だから,特に $[x,d]$ 上で連続,$(x,d)$ 上で微分可能である。したがって区間 $[x,d]$$f,g$cauchy-mvt を適用でき($g$ の単射性より分母 $g(x)-g(d)\neq0$ である),ある $c\in(x,d)$ が存在して
$$ \frac{f(x)-f(d)}{g(x)-g(d)}=\frac{f'(c)}{g'(c)} $$
となる。また $\displaystyle\lim_{x\to a+0}|g(x)|=\infty$ より,$x$ を十分 $a$ に近くとれば $g(x)\neq0$ としてよい。左辺を分母分子ともに $g(x)$ で割って変形すると
$$ \frac{f(x)}{g(x)}=\frac{f'(c)}{g'(c)}\left(1-\frac{g(d)}{g(x)}\right)+\frac{f(d)}{g(x)} $$
を得る。ここで $A:=f'(c)/g'(c)$$c$$x$$d$ に依存して定まる値であるため定数ではないが,$c\in(a,d)$ ゆえ $|A-L|<\varepsilon/2$ を満たし,特に $|A|<|L|+\varepsilon/2$ で有界である。上式を整理すると
$$ \frac{f(x)}{g(x)}-A=\frac{f(d)-A\,g(d)}{g(x)} $$
であるから,$A$ の有界性を用いると
$$ \left|\frac{f(x)}{g(x)}-A\right|=\left|\frac{f(d)-A\,g(d)}{g(x)}\right|\le\frac{|f(d)|+(|L|+\varepsilon/2)\,|g(d)|}{|g(x)|} $$
と評価できる。分子の $f(d),g(d)$ は固定された定数であり,$x\to a+0$ のとき $|g(x)|\to\infty$ だから,右辺は $0$ に収束する。ゆえに,ある $\delta>0$(ただし $a+\delta\le d$)が存在して,$a< x< a+\delta$ なる任意の $x$ に対して
$$ \left|\frac{f(x)}{g(x)}-A\right|<\frac{\varepsilon}{2} $$
とできる。これと $|A-L|<\varepsilon/2$ を合わせて
$$ \left|\frac{f(x)}{g(x)}-L\right|\le\left|\frac{f(x)}{g(x)}-A\right|+|A-L|<\varepsilon $$
を得る。$\varepsilon>0$ は任意だから主張が従う。

$0/0$ 型も補助関数の取り方を変えれば同じ筋で示せる。

ここまでを表にまとめる。

定理主要な仮定結論どこで効くか
ロルの定理$f(a)=f(b)$$\exists c,\ f'(c)=0$他の平均値定理の出発点
ラグランジュ微分可能$\exists c,\ f(b)-f(a)=f'(c)(b-a)$リプシッツ連続
コーシー$g'(x)\neq0$$\exists c,\ \frac{f(b)-f(a)}{g(b)-g(a)}=\frac{f'(c)}{g'(c)}$ロピタル・テイラー

2. テイラーの定理と剰余項

ラグランジュの平均値の定理は一次近似の誤差を $f'(c)h$ と書いたものだった。これを $n$ 次まで上げたのがテイラーの定理で,近似がどれだけ効くかは剰余項の大きさで決まる。

2.1 テイラー多項式と剰余項

テイラー多項式と剰余項

$f$ が点 $a$$n$ 階まで微分可能であるとする。$a$ を中心とする $n$ 次テイラー多項式を
$$ T_{n,a}(x)=\sum_{k=0}^{n}\frac{f^{(k)}(a)}{k!}(x-a)^{k} $$
と定め,剰余項を $R_{n,a}(x):=f(x)-T_{n,a}(x)$ と定義する。さらに $f$$a$ で無限回微分可能なとき,テイラー級数 $\displaystyle\sum_{k=0}^{\infty}\frac{f^{(k)}(a)}{k!}(x-a)^{k}$ が定義でき,各点 $x$ においてこの級数が $f(x)$ に収束することは,その $x$$n\to\infty$ のとき $R_{n,a}(x)\to0$ となることと同値である。

定義に必要なのは点 $a$ での微分可能性だけだが,剰余項を実際に評価する段になると,区間上の連続性や高階微分可能性といった強い仮定が要る。

2.2 シュレミルヒ・ロシュの剰余項

微分型の剰余項は,パラメータ $p$ を一つ持つシュレミルヒ・ロシュ(Schlömilch–Roche)の形にまとめて書ける。$p$ を選び直すと,以下に見るようにラグランジュ型・コーシー型が特殊ケースとして出る。非整数冪 $(x-t)^{p}$ を実数として扱う都合上,まず $x>a$ の場合を述べる。

シュレミルヒ・ロシュの剰余項

$x>a$ とし,$f$$[a,x]$$C^{n}$ 級,$(a,x)$$n+1$ 回微分可能とする。任意の実数 $p\ (0< p\le n+1)$ に対して,ある $\xi\in(a,x)$ が存在して
$$ R_{n,a}(x)=\frac{f^{(n+1)}(\xi)}{p\cdot n!}\,(x-\xi)^{\,n+1-p}\,(x-a)^{\,p} $$
が成り立つ。

$x>a$ の場合を示す。$x$ を固定し,$t$ の関数
$$ F(t)=f(x)-S(t),\qquad S(t)=\sum_{k=0}^{n}\frac{f^{(k)}(t)}{k!}(x-t)^{k} $$
を考える。$S$ の各項を微分すると,$k\ge1$ に対して
$$ \frac{d}{dt}\!\left\{\frac{f^{(k)}(t)}{k!}(x-t)^{k}\right\}=\frac{f^{(k+1)}(t)}{k!}(x-t)^{k}-\frac{f^{(k)}(t)}{(k-1)!}(x-t)^{k-1} $$
となり($k=0$ の項の微分は $f'(t)$),$k$ について和をとると隣接項が相殺して(telescoping)
$$ S'(t)=\frac{f^{(n+1)}(t)}{n!}(x-t)^{n},\qquad\text{ゆえに}\quad F'(t)=-\frac{f^{(n+1)}(t)}{n!}(x-t)^{n} $$
を得る。次に $g(t)=(x-t)^{p}$ とおく。$0< p\le n+1$ かつ $t\in[a,x]$ では $x-t\ge0$ ゆえ $g$$[a,x]$ 上で連続であり,$(a,x)$ では
$$ g'(t)=-p(x-t)^{p-1}\neq0 $$
が成り立つ。($0< p<1$ のとき $g'$ は端点 $t=x$ で有限値をもたないが,cauchy-mvt が要求するのは開区間 $(a,x)$ での微分可能性だけなので問題ない。)端点では
$$ F(x)=0,\quad F(a)=R_{n,a}(x),\quad g(x)=0,\quad g(a)=(x-a)^{p} $$
である。$[a,x]$$F,g$cauchy-mvt を適用すると,$a<\xi< x$ なる $\xi$ が存在して
$$ \frac{F(x)-F(a)}{g(x)-g(a)}=\frac{F'(\xi)}{g'(\xi)} $$
となる。各値を代入して
$$ \frac{-R_{n,a}(x)}{-(x-a)^{p}}=\frac{-\dfrac{f^{(n+1)}(\xi)}{n!}(x-\xi)^{n}}{-p(x-\xi)^{p-1}} $$
となり,$R_{n,a}(x)$ について解けば主張を得る。

$x< a$ のときは,非整数の $p$ に対して底 $x-t$ が負になり $(x-t)^{p}$ が実数として定義できない。補助関数を $g(t)=(t-x)^{p}$ に取り直して同じ議論をすれば,$\xi\in(x,a)$ に対して
$$ R_{n,a}(x)=(-1)^{n+1}\,\frac{f^{(n+1)}(\xi)}{p\cdot n!}\,(\xi-x)^{\,n+1-p}\,(a-x)^{\,p} $$
を得る。指数が整数になるラグランジュ型($p=n+1$)・コーシー型($p=1$)では,本文の表式がそのまま $x< a$ でも成り立つ。

2.3 剰余項の特殊形

schlomilch$p$ を固定すると古典的な剰余項が出る。以下の各式の $\xi$ は,$p$(および型)ごとに別々に定まる点である点に注意する。

ラグランジュ型($p=n+1$

$$ R_{n,a}(x)=\frac{f^{(n+1)}(\xi)}{(n+1)!}(x-a)^{n+1} $$

$n=0$ でラグランジュの平均値の定理に一致する。固定した $a,x$ に対し,$n$ に依存しない一つの定数 $M$ がとれて,$a$$x$ を結ぶ区間上で階数によらず $|f^{(n+1)}|\le M$ が成り立つなら
$$ |R_{n,a}(x)|\le \frac{M\,|x-a|^{n+1}}{(n+1)!}\longrightarrow0\quad(n\to\infty) $$
となる。$\sin x,\cos x$ では $M=1$$e^{x}$ では区間上で $M=e^{\max(a,x)}$ がとれ,いずれも階乗の成長がべき乗を凌ぐため $\mathbb{R}$ 全体で収束する。

コーシー型($p=1$

$\xi=a+\theta(x-a)\ (0<\theta<1)$ とおくと,
$$ R_{n,a}(x)=\frac{f^{(n+1)}(\xi)}{n!}(x-\xi)^{n}(x-a) =\frac{f^{(n+1)}\big(a+\theta(x-a)\big)}{n!}(1-\theta)^{n}(x-a)^{n+1} $$

二項級数 $(1+x)^{\alpha}\ (\alpha\notin\mathbb{N})$$|x|<1$ での収束には,ラグランジュ型では足りずコーシー型が要る。$a=0$$f(x)=(1+x)^{\alpha}$ とすると
$$ f^{(n+1)}(u)=\alpha(\alpha-1)\cdots(\alpha-n)(1+u)^{\alpha-n-1} $$
であり,$u=\theta x$ を代入して整理すると
$$ R_{n,0}(x)=d_{n}\,(1+\theta x)^{\alpha-1}\left(\frac{1-\theta}{1+\theta x}\right)^{n}x^{n+1}, \qquad d_{n}=\frac{\alpha(\alpha-1)\cdots(\alpha-n)}{n!} $$
を得る。$d_{n}$ は分子に $n+1$ 個の因子をもち,通常の二項係数ではなく剰余項に由来する係数である。$\theta=\theta_{n}$ は各次数ごとに定まる。$-1< x<1$ では $1+\theta_{n} x>0$ であり,さらに $1-\theta_{n}<1+\theta_{n} x\iff x>-1$ だから
$$ 0<\frac{1-\theta_{n}}{1+\theta_{n} x}<1 $$
が成り立つ。ここで $\theta_{n}$$n$ に依存するため,この比の $n$ 乗が $0$ に収束するとは限らない($\theta_{n}\to0$ なら比は $1$ に近づく)。収束を担うのは,比が $1$ で上から抑えられることと,残りの因子 $d_{n}x^{n+1}$ の減衰である。実際 $x\in(-1,1)$ を固定すると,$0<\theta_{n}<1$ より $1+\theta_{n}x$ は正の閉区間 $[\min(1,1+x),\ \max(1,1+x)]$ に入るから,$(1+\theta_{n}x)^{\alpha-1}$$n$(および $\theta_{n}$)によらずある定数 $C$$\alpha-1\ge0$ なら $C=(1+|x|)^{\alpha-1}$$\alpha-1<0$ なら $C=(1-|x|)^{\alpha-1}$)で抑えられる。比の $n$ 乗が $1$ 以下であることと合わせて
$$ |R_{n,0}(x)|\le C\,|d_{n}\,x^{n+1}| $$
となる。あとは
$$ \left|\frac{d_{n+1}\,x^{n+2}}{d_{n}\,x^{n+1}}\right|=\left|\frac{\alpha-n-1}{n+1}\right|\,|x|\longrightarrow|x|\quad(n\to\infty) $$
$|x|<1$ ゆえ,ダランベールの判定法により $\displaystyle\sum_{n}|d_{n}x^{n+1}|$ は収束し,特に一般項 $d_{n}x^{n+1}\to0$,よって $R_{n,0}(x)\to0$ が従う。

ラグランジュ型では剰余が $(x-a)^{n+1}=x^{n+1}$ に比例し,$x\to-1^{+}$ では $|x|^{n+1}\to1$ の分を他で抑えきれない。コーシー型が端まで持つのは,$(1-\theta)^{n}$ という余分な減衰因子を抱えているおかげである。

積分型

$f\in C^{n+1}$ なら,$\xi$ を含まない決定論的な表現
$$ R_{n,a}(x)=\int_{a}^{x}\frac{f^{(n+1)}(t)}{n!}(x-t)^{n}\,dt $$
が成り立つ。微積分学の基本定理 $f(x)=f(a)+\displaystyle\int_{a}^{x}f'(t)\,dt$ から出発し,部分積分
$$ \int_{a}^{x}f'(t)\,dt=\Big[-(x-t)f'(t)\Big]_{a}^{x}+\int_{a}^{x}(x-t)f''(t)\,dt $$
を繰り返せば(数学的帰納法)得られる。各段の部分積分は $f^{(k)}$ の連続性(仮定 $f\in C^{n+1}$ から従う)で正当化される。$C^{n+1}$ 級はリーマン積分で十分だが,より一般には $f^{(n)}$ が絶対連続なら,ルベーグ積分の意味で同じ表現が成り立つ。$\xi$ を含まない分こちらは扱いやすい。

剰余項パラメータ表現 $R_{n,a}(x)$主な用途
シュレミルヒ・ロシュ$0< p\le n+1$$x>a$$\frac{f^{(n+1)}(\xi)}{p\cdot n!}(x-\xi)^{n+1-p}(x-a)^{p}$全微分型を統合。$x< a$ では符号に注意
ラグランジュ$p=n+1$$\frac{f^{(n+1)}(\xi)}{(n+1)!}(x-a)^{n+1}$$e^{x},\sin x$ の大域収束
コーシー$p=1$$\frac{f^{(n+1)}(\xi)}{n!}(x-\xi)^{n}(x-a)$二項級数 $(1+x)^{\alpha}$ の収束
積分型$\int_{a}^{x}\frac{f^{(n+1)}(t)}{n!}(x-t)^{n}\,dt$$\xi$ を排除,$f^{(n)}$ 絶対連続でも可

3. 滑らかさと解析性のギャップ

$C^\infty$ 級(無限回微分可能)であることと,$C^\omega$ 級(各点の近傍で自身のテイラー級数に一致する,解析的)であることは別物である。両者を隔てる定番の反例を挙げる。

3.1 非解析的な滑らかな関数

非解析的な滑らかな関数

$$ f(x)=\begin{cases} e^{-1/x^{2}} & (x\neq0)\\[2pt] 0 & (x=0)\end{cases} $$
$\mathbb{R}$$C^\infty$ 級であり,すべての $n\ge0$$f^{(n)}(0)=0$ を満たす。

次を $n$ に関する帰納法で示す:「$f$$\mathbb{R}$$n$ 回微分可能で,ある多項式 $P_{n}$ により $x\neq0$ では $f^{(n)}(x)=P_{n}\!\left(\dfrac{1}{x}\right)e^{-1/x^{2}}$ と表され,かつ $f^{(n)}(0)=0$ である。」

$n=0$ では $P_{0}=1$$f(0)=0$$x\to0$$e^{-1/x^{2}}\to0=f(0)$ ゆえ $f$$0$ で連続)であり成り立つ。$n$ で成り立つと仮定する。$x\neq0$ では連鎖律により,適当な多項式 $P_{n+1}$
$$ f^{(n+1)}(x)=P_{n+1}\!\left(\frac{1}{x}\right)e^{-1/x^{2}} $$
と書ける(たとえば $f'(x)=2x^{-3}e^{-1/x^{2}}$$P_{1}(t)=2t^{3}$)。$t=1/x$ とおくと $x\to0$$t^{2}\to\infty$ であり,任意の $m\ge0$ で成り立つ $\displaystyle\lim_{|t|\to\infty}\frac{t^{m}}{e^{t^{2}}}=0$(指数が多項式を凌ぐ)を使う。微分の定義と帰納法の仮定 $f^{(n)}(0)=0$ から
$$ f^{(n+1)}(0)=\lim_{x\to0}\frac{f^{(n)}(x)-f^{(n)}(0)}{x}=\lim_{|t|\to\infty}t\,P_{n}(t)\,e^{-t^{2}}=0 $$
となり,$f^{(n+1)}(0)$ は存在して $0$ である。ゆえに $f$$\mathbb{R}$$n+1$ 回微分可能。さらに
$$ \lim_{x\to0}f^{(n+1)}(x)=\lim_{|t|\to\infty}\frac{P_{n+1}(t)}{e^{t^{2}}}=0=f^{(n+1)}(0) $$
より $f^{(n+1)}$$0$ で連続。以上で命題は $n+1$ でも成り立ち,帰納的にすべての $n\ge0$$f^{(n)}(0)=0$,かつ各 $f^{(n)}$ が連続(したがって $f$$C^\infty$ 級)である。

3.2 テイラー級数の破綻とバンプ関数

nonanalytic の関数を $0$ でマクローリン展開すると
$$ \sum_{n=0}^{\infty}\frac{f^{(n)}(0)}{n!}x^{n}=0 $$
となり,収束半径 $\infty$,和は恒等的に $0$ である。ところが $x\neq0$ を固定すると $T_{n,0}(x)=0$ かつ $f(x)>0$ ゆえ,すべての $n$$R_{n,0}(x)=f(x)>0$ である。次数をいくら上げても剰余は $0$ に行かず,テイラー級数は $f$ を再構成しない($x=0$ では $R_{n,0}(0)=0$)。

原点で導関数がすべて消えるということは,テイラー係数が全部 $0$,つまり級数は原点まわりの $f$ の情報を一切拾えていない。裏を返せば「級数には全く写らない滑らかな盛り上がり」を自由に作れるということで,これがバンプ関数の材料になる。

先の $e^{-1/x^{2}}$ は両側から平坦に $0$ へ落ちる例だった。片側だけで正になり境界で平坦に $0$ へ接続する素材としては
$$ \eta(x)=\begin{cases} e^{-1/x} & (x>0)\\[2pt] 0 & (x\le0)\end{cases} $$
がよく使われる。$e^{-1/x}$$x\to0-$ で発散するので,$x\le0$ 側を $0$ とする片側定義が要る。$\eta$$C^\infty$ 級で,$0$ での導関数がすべて $0$ になる。$\eta$ を組み合わせれば,コンパクト台をもち境界で $C^\infty$$0$ へつながるバンプ関数が作れる。これを積分 $1$ に正規化すれば標準的な軟化子(mollifier)になる。こうした滑らかな切断関数は,微分幾何の $C^\infty$ 級「1の分割(partition of unity)」や,偏微分方程式論の平滑化の土台である。

4. ベクトル値関数への一般化

平均値の「等式」は,値域に全順序がないベクトル値・複素数値関数では一般に成り立たない。

4.1 平均値の定理の破綻

平均値の定理が成り立たない例

$f(t)=e^{it}=(\cos t,\sin t)\ (t\in[0,2\pi])$ では $f(2\pi)-f(0)=(0,0)$ である。しかし
$$ f'(t)=(-\sin t,\cos t),\qquad \|f'(t)\|=\sqrt{\sin^{2}t+\cos^{2}t}=1\neq0 $$
ゆえ,$f(2\pi)-f(0)=f'(c)\,(2\pi-0)$ を満たす $c\in(0,2\pi)$ は存在しない。

成分ごとに平均値の定理を満たす点がずれるため,単一の $c$ による等式では書けない。

4.2 平均値の不等式

等式は諦める代わりに,ノルムの不等式なら成り立つ。漸近評価にはこれで足りる。

平均値の不等式

$U\subset\mathbb{R}^{n}$ を開集合,$K\subset U$ を凸集合とし,$\boldsymbol{f}:U\to\mathbb{R}^{m}$$C^{1}$ 級とする。任意の $\boldsymbol{a},\boldsymbol{b}\in K$ について
$$ \|\boldsymbol{f}(\boldsymbol{b})-\boldsymbol{f}(\boldsymbol{a})\|\le\sup_{0\le t\le1}\big\|J_{\boldsymbol{f}}\big(\boldsymbol{a}+t(\boldsymbol{b}-\boldsymbol{a})\big)\big\|\cdot\|\boldsymbol{b}-\boldsymbol{a}\| $$
が成り立つ。ここで $J_{\boldsymbol{f}}$ はヤコビ行列,$\|\cdot\|$$\mathbb{R}^{n},\mathbb{R}^{m}$ ではユークリッドノルム,行列に対してはそれが誘導する作用素ノルム $\|A\|=\sup_{\|\boldsymbol{v}\|=1}\|A\boldsymbol{v}\|$ を表す。$K$ の凸性より線分 $\{\boldsymbol{a}+t(\boldsymbol{b}-\boldsymbol{a}):0\le t\le1\}$$K\subset U$ に含まれる。右辺の上限はこの線分上でとるもので,線分はコンパクト,$J_{\boldsymbol{f}}$ は連続だから有限値である($K$ 自身のコンパクト性は要らない)。

$\gamma(t)=\boldsymbol{a}+t(\boldsymbol{b}-\boldsymbol{a})\ (0\le t\le1)$ とおくと,凸性より $\gamma(t)\in K\subset U$ であり,微積分学の基本定理と連鎖律から
$$ \boldsymbol{f}(\boldsymbol{b})-\boldsymbol{f}(\boldsymbol{a})=\int_{0}^{1}J_{\boldsymbol{f}}\big(\gamma(t)\big)(\boldsymbol{b}-\boldsymbol{a})\,dt $$
が成り立つ。両辺のノルムをとり,積分の三角不等式と作用素ノルムの劣乗法性を使うと
$$ \|\boldsymbol{f}(\boldsymbol{b})-\boldsymbol{f}(\boldsymbol{a})\|\le\int_{0}^{1}\big\|J_{\boldsymbol{f}}(\gamma(t))\big\|\,\|\boldsymbol{b}-\boldsymbol{a}\|\,dt\le\sup_{0\le t\le1}\big\|J_{\boldsymbol{f}}(\gamma(t))\big\|\cdot\|\boldsymbol{b}-\boldsymbol{a}\| $$
を得る。

多変数テイラーの剰余評価や多次元ニュートン法の収束証明では,この不等式が実際に使われる。

5. 統計的応用:デルタ法

標本平均 $\bar{X}_{n}$ の非線形変換 $g(\bar{X}_{n})$(オッズや対数変換など)の漸近分布を,テイラーの局所線形化と確率的極限を組み合わせて出すのがデルタ法である。

5.1 漸近正規性とスルツキーの定理

漸近正規性

確率変数列 $\{X_{n}\}$ が真値 $\theta$$\sigma^{2}>0$ に対し
$$ \sqrt{n}\,(X_{n}-\theta)\xrightarrow{d}\mathcal{N}(0,\sigma^{2}) $$
を満たすことをいう($\xrightarrow{d}$ は分布収束)。中心極限定理の帰結として頻出する。

スルツキーの定理

$W_{n}\xrightarrow{d}W$ かつ $Z_{n}\xrightarrow{p}c$(定数への確率収束)ならば,
$$ W_{n}+Z_{n}\xrightarrow{d}W+c,\qquad W_{n}Z_{n}\xrightarrow{d}cW $$
が成り立つ。

極限分布をもつ列に,定数へ確率収束する列を足したり掛けたりしても極限分布の形は保たれる,という主張である(証明は標準的なので省く)。

以下で使う確率オーダー記法を決めておく。$Z_{n}=O_{p}(1)$(確率的に有界)とは,任意の $\varepsilon>0$ にある $M>0$ が存在して $\sup_{n}P(|Z_{n}|>M)<\varepsilon$ となること,$Z_{n}=o_{p}(1)$ とは $Z_{n}\xrightarrow{p}0$ を表す。

5.2 1変数デルタ法

1変数デルタ法

$g$ はボレル可測で,$\theta$ を含む開近傍で定義され(すなわち $\theta$ は定義域の内点),$\theta$ で微分可能とする。$\sqrt{n}\,(X_{n}-\theta)\xrightarrow{d}\mathcal{N}(0,\sigma^{2})$ のとき,
$$ \sqrt{n}\,\big(g(X_{n})-g(\theta)\big)\xrightarrow{d}\mathcal{N}\big(0,\,[g'(\theta)]^{2}\sigma^{2}\big) $$
が成り立つ。特に $g'(\theta)\neq0$ のとき極限分布は非退化である。

仕掛けは単純で,$\sqrt{n}$ を掛けると一次の項 $g'(\theta)\sqrt{n}(X_{n}-\theta)$ だけが残り,これは正規極限を $g'(\theta)$ 倍したものになる。剰余は $\sqrt{n}\times o_{p}(1/\sqrt{n})=o_{p}(1)$ で落ちる。

$\theta$ は内点だから,$\theta$ を含む開近傍 $U$$g$ の定義域に含まれる)がとれる。$g$$\theta$ で微分可能だから,一次のペアノ型剰余により $U$ 上で
$$ g(x)=g(\theta)+g'(\theta)(x-\theta)+r(x),\qquad \lim_{x\to\theta}\frac{r(x)}{x-\theta}=0 $$
と書ける。$U$ 上で
$$ h(x)=\begin{cases}\dfrac{r(x)}{x-\theta} & (x\in U,\ x\neq\theta)\\[6pt] 0 & (x=\theta)\end{cases} $$
とおくと,上の極限より $h$$x=\theta$ で連続($h(\theta)=0$)である。

仮定より $\sqrt{n}(X_{n}-\theta)=O_{p}(1)$,これを $\sqrt{n}$ で割って $X_{n}-\theta=O_{p}(1/\sqrt{n})=o_{p}(1)$,すなわち $X_{n}\xrightarrow{p}\theta$。ゆえに $X_{n}$$U$ に入る確率は $1$ に漸近する($P(X_{n}\in U)\to1$)。事象 $\{X_{n}\in U\}$ 上では,両辺から $g(\theta)$ を引き $\sqrt{n}$ を掛けて
$$ \sqrt{n}\big(g(X_{n})-g(\theta)\big)=g'(\theta)\sqrt{n}(X_{n}-\theta)+\sqrt{n}(X_{n}-\theta)\,h(X_{n}) $$
が成り立ち,補集合の確率は $o(1)$ だから,漸近分布を論じるにはこの展開でよい。$h$$\theta$ で連続だから,連続写像定理により $h(X_{n})\xrightarrow{p}h(\theta)=0$。ゆえに右辺第2項は $O_{p}(1)\cdot o_{p}(1)=o_{p}(1)$$0$ に確率収束する。第1項は $\mathcal{N}(0,[g'(\theta)]^{2}\sigma^{2})$ に分布収束するから,slutsky より主張を得る。

$g'(\theta)=0$ のときは,この一次デルタ法の極限が $\mathcal{N}(0,0)$$0$ への退化)になり,非自明な極限を得るには2次デルタ法など高次の展開が要る。

オッズの漸近分散

$X\sim\mathrm{Bin}(n,p)$$0< p<1$ とし,標本比率 $\hat{p}=X/n$$\sqrt{n}(\hat{p}-p)\xrightarrow{d}\mathcal{N}(0,p(1-p))$ を満たす。オッズ $g(p)=\dfrac{p}{1-p}$$0< p<1$ で定義)は $g'(p)=\dfrac{1}{(1-p)^{2}}$ ゆえ,delta より $\sqrt{n}\big(g(\hat{p})-g(p)\big)$ の漸近分散は
$$ [g'(p)]^{2}\cdot p(1-p)=\frac{1}{(1-p)^{4}}\cdot p(1-p)=\frac{p}{(1-p)^{3}} $$
となる。したがって $g(\hat{p})$ は近似的に $\mathcal{N}\!\left(g(p),\,\dfrac{p}{n(1-p)^{3}}\right)$ に従う。有限標本では $\hat{p}=1$ のとき $g(\hat{p})$ は定義されないが,$0< p<1$ ゆえ $P(\hat{p}=1)=p^{n}\to0$ で漸近分布には効かない。なお2群の「オッズ比」を扱うには次の多変量デルタ法(mv-delta)が要る。

5.3 多変量・汎関数デルタ法

推定量 $\boldsymbol{X}_{n}$ がベクトルで,これにスカラー値 $g:\mathbb{R}^{p}\to\mathbb{R}$ を施す場合,一次近似は勾配ベクトルで表される。

多変量デルタ法

$\sqrt{n}\,(\boldsymbol{X}_{n}-\boldsymbol{\mu})\xrightarrow{d}\mathcal{N}_{p}(\boldsymbol{0},\boldsymbol{\Sigma})$ とし,$g:\mathbb{R}^{p}\to\mathbb{R}$$\boldsymbol{\mu}$ で全微分可能(フレシェ微分可能)とする。勾配を $\nabla g(\boldsymbol{\mu})$ とおくと,
$$ \sqrt{n}\,\big(g(\boldsymbol{X}_{n})-g(\boldsymbol{\mu})\big)\xrightarrow{d}\mathcal{N}\big(0,\,\nabla g(\boldsymbol{\mu})^{\top}\boldsymbol{\Sigma}\,\nabla g(\boldsymbol{\mu})\big) $$
が成り立つ。漸近分散は勾配と分散共分散行列の二次形式になる。

$\nabla g(\boldsymbol{\mu})=\boldsymbol{0}$ なら極限は $0$ に退化し,やはり高次の展開が要る。1変数の「点 $\theta$ で微分可能」に正確に対応するのは「点 $\boldsymbol{\mu}$ で全微分可能」で,このとき
$$ g(\boldsymbol{X}_{n})=g(\boldsymbol{\mu})+\nabla g(\boldsymbol{\mu})^{\top}(\boldsymbol{X}_{n}-\boldsymbol{\mu})+o_{p}\big(\|\boldsymbol{X}_{n}-\boldsymbol{\mu}\|\big) $$
というペアノ型近似が立って,1変数と同じ筋で証明が回る。多変量では偏導関数の存在だけでは全微分可能性が出ないので,実用上は,それを含意する検証しやすい十分条件として $\boldsymbol{\mu}$ の近傍で連続な偏導関数($C^{1}$ 級)をもつことを課すことが多い。一般のベクトル値 $g:\mathbb{R}^{p}\to\mathbb{R}^{q}$ では勾配の代わりにヤコビ行列 $Dg(\boldsymbol{\mu})$ を使い,極限共分散は $Dg(\boldsymbol{\mu})\,\boldsymbol{\Sigma}\,Dg(\boldsymbol{\mu})^{\top}$ になる。

さらに $g$ を統計汎関数 $\phi$ に替えると汎関数デルタ法になる。微分可能性に対応するのは,適切な関数空間上での $\sqrt{n}(\mathbb{P}_{n}-P)$ の弱収束と $\phi$ のアダマール(Hadamard)微分可能性で,正則な統計汎関数ではこの一次導関数が影響関数(influence function)で表され,その分散が漸近分散を与える。経験分布に基づく M 推定量・Z 推定量の漸近論やロバスト統計で効く。厳密には関数空間上の弱収束理論を要するので,ここでは概念だけ触れておく。

6. まとめ

全体を通して,やっていることは終始「一点で線形化して,残りを剰余として評価する」の一手である。解析ではそれがテイラー展開と剰余項の収束論になり,統計では同じ一次近似がデルタ法として漸近分散を与える。$e^{-1/x^{2}}$ の例とベクトル値での等式の破れは,この手がどこまで通用するかの境目を示している。

投稿日:9日前
更新日:4日前
数学の力で現場を変える アルゴリズムエンジニア募集 - Mathlog served by OptHub

この記事を高評価した人

高評価したユーザはいません

この記事に送られたバッジ

バッジはありません。

投稿者

教育・臨床医学の統計に興味があります。

コメント

他の人のコメント

コメントはありません。
読み込み中...
読み込み中