Tom Charnock
Institut d'Astrophysique de Paris
Tom Charnock
Institut d'Astrophysique de Paris
Tom Charnock
Institut d'Astrophysique de Paris
when something is intrinsically unknowable it is biased
if there is some offset, which could in principle be corrected, it is biased
Training data and targets: $\small\boldsymbol{\{}{\bf d},{\bf t}\boldsymbol{\}}^\textrm{train}\equiv\{{\bf d}^\textrm{train}_i, {\bf t}^\textrm{train}_i|i\in[1,n_\textrm{train}]\}$
Validation data and targets: $\small\boldsymbol{\{}{\bf d},{\bf t}\boldsymbol{\}}^\textrm{val}\equiv\small\{{\bf d}^\textrm{val}_i, {\bf t}^\textrm{val}_i|i\in[1,n_\textrm{val}]\}$


$$\begin{align*}
\mathcal{P}(\boldsymbol{\omega},\boldsymbol{\alpha}|\boldsymbol{\{}{\bf d},{\bf t}\boldsymbol{\}}^\textrm{train})\propto&~\mathcal{L}(\boldsymbol{\omega},\boldsymbol{\alpha}|\boldsymbol{\{}{\bf d},{\bf t}\boldsymbol{\}}^\textrm{train})p(\boldsymbol{\omega},\boldsymbol{\alpha})\\
\to&~\delta(\boldsymbol{\omega}-\boldsymbol{\omega}^\textrm{MLE},\boldsymbol{\alpha}-\boldsymbol{\alpha}^*)
\end{align*}$$

$$\mathcal{P}({\bf t}|{\bf d})=\delta(\boldsymbol{\tau})$$

$$\begin{align*}
\mathcal{P}({\bf t}|{\bf d})&=\int d\boldsymbol{\omega}d\boldsymbol{\nu}d\boldsymbol{\alpha}~\mathcal{L}({\bf t}|{\bf d},\boldsymbol{\omega},\boldsymbol{\alpha})\mathcal{Q}(\boldsymbol{\omega}|\boldsymbol{\nu}, \boldsymbol{\alpha}, \boldsymbol{\{}{\bf d}, {\bf t}\boldsymbol{\}}^\textrm{train})\\
&\phantom{hellohello}\times\delta(\boldsymbol{\nu}-\boldsymbol{\nu}^\textrm{MLE}, \boldsymbol{\alpha}-\boldsymbol{\alpha}^*)\\
&=\int d\boldsymbol{\omega}~\mathcal{L}({\bf t}|{\bf d},\boldsymbol{\omega}, \boldsymbol{\alpha}^*)\mathcal{Q}(\boldsymbol{\omega}|\boldsymbol{\nu}^\textrm{MLE}, \boldsymbol{\alpha}^*, \boldsymbol{\{}{\bf d}, {\bf t}\boldsymbol{\}}^\textrm{train}).
\end{align*}$$
Classical network : $\tiny \mathcal{P}(\boldsymbol{\omega},\boldsymbol{\alpha}|\boldsymbol{\{}{\bf d},{\bf t}\boldsymbol{\}}^\textrm{train}) \to \delta(\boldsymbol{\omega}-\boldsymbol{\omega}^\textrm{MLE},\boldsymbol{\alpha}-\boldsymbol{\alpha}^*)$
Variational inference : $\tiny \mathcal{P}(\boldsymbol{\omega},\boldsymbol{\alpha}|\boldsymbol{\{}{\bf d},{\bf t}\boldsymbol{\}}^\textrm{train}) = \mathcal{Q}(\boldsymbol{\omega}|\boldsymbol{\nu}^\textrm{MLE}, \boldsymbol{\alpha}^*, \boldsymbol{\{}{\bf d},{\bf t}\boldsymbol{\}}^\textrm{train})$
Bayesian networks : $\tiny \mathcal{P}(\boldsymbol{\omega},\boldsymbol{\alpha}|\boldsymbol{\{}{\bf d},{\bf t}\boldsymbol{\}}^\textrm{train}) =\prod_i^{n_\textrm{train}}\mathcal{L}({\bf t}^\textrm{train}_i|{\bf d}^\textrm{train}_i,\boldsymbol{\omega},\boldsymbol{\alpha})p(\boldsymbol{\omega},\boldsymbol{\alpha})$

Compare distance between observed summaries and simulation summaries and select results within $\epsilon$