$$\Lambda(\boldsymbol{\theta},\boldsymbol{\tau})\propto-\ln\mathcal{L}(\boldsymbol{\theta}|{\bf d},\boldsymbol{\omega},\boldsymbol{\alpha})$$

$$\begin{align*}
\tiny\mathcal{P}(\boldsymbol{\omega},\boldsymbol{\alpha}|\boldsymbol{\{}{\bf d},\boldsymbol{\theta}\boldsymbol{\}}^\textrm{train})\propto&\tiny~\mathcal{L}(\boldsymbol{\omega},\boldsymbol{\alpha}|\boldsymbol{\{}{\bf d},\boldsymbol{\theta}\boldsymbol{\}}^\textrm{train})p(\boldsymbol{\omega},\boldsymbol{\alpha})\\
\tiny\to&\tiny~\delta(\boldsymbol{\omega}-\boldsymbol{\omega}^\textrm{MLE},\boldsymbol{\alpha}-\boldsymbol{\alpha}^*)
\tiny\\
\tiny\mathcal{P}(\boldsymbol{\theta}|{\bf d}) \propto&\tiny~\int d\boldsymbol{\omega}d\boldsymbol{\alpha}\mathcal{L}(\boldsymbol{\theta}|{\bf d},\boldsymbol{\omega},\boldsymbol{\alpha})\delta(\boldsymbol{\omega}-\boldsymbol{\omega}^\textrm{MLE},\boldsymbol{\alpha}-\boldsymbol{\alpha}^*)\\
\tiny=&\tiny~\delta(\boldsymbol{\tau})
\end{align*}$$

$$\mathcal{P}(\boldsymbol{\theta}|{\bf d})=\delta(\boldsymbol{\tau})$$


$$\begin{align*}
\mathcal{P}(\boldsymbol{\theta}|{\bf d})&=\int d\boldsymbol{\omega}d\boldsymbol{\nu}d\boldsymbol{\alpha}~\mathcal{L}(\boldsymbol{\theta}|{\bf d},\boldsymbol{\omega},\boldsymbol{\alpha})\mathcal{Q}(\boldsymbol{\omega}|\boldsymbol{\nu}, \boldsymbol{\alpha}, \boldsymbol{\{}{\bf d}, \boldsymbol{\theta}\boldsymbol{\}}^\textrm{train})\\
&\phantom{hellohello}\times\delta(\boldsymbol{\nu}-\boldsymbol{\nu}^\textrm{MLE}, \boldsymbol{\alpha}-\boldsymbol{\alpha}^*)\\
&=\int d\boldsymbol{\omega}~\mathcal{L}(\boldsymbol{\theta}|{\bf d},\boldsymbol{\omega}, \boldsymbol{\alpha}^*)\mathcal{Q}(\boldsymbol{\omega}|\boldsymbol{\nu}^\textrm{MLE}, \boldsymbol{\alpha}^*, \boldsymbol{\{}{\bf d}, \boldsymbol{\theta}\boldsymbol{\}}^\textrm{train}).
\end{align*}$$
Classical network : $\tiny \mathcal{P}(\boldsymbol{\omega},\boldsymbol{\alpha}|\boldsymbol{\{}{\bf d},\boldsymbol{\theta}\boldsymbol{\}}^\textrm{train}) \to \delta(\boldsymbol{\omega}-\boldsymbol{\omega}^\textrm{MLE},\boldsymbol{\alpha}-\boldsymbol{\alpha}^*)$
Variational inference : $\tiny \mathcal{P}(\boldsymbol{\omega},\boldsymbol{\alpha}|\boldsymbol{\{}{\bf d},\boldsymbol{\theta}\boldsymbol{\}}^\textrm{train}) = \mathcal{Q}(\boldsymbol{\omega}|\boldsymbol{\nu}^\textrm{MLE}, \boldsymbol{\alpha}^*, \boldsymbol{\{}{\bf d},\boldsymbol{\theta}\boldsymbol{\}}^\textrm{train})$
Bayesian networks : $\tiny \mathcal{P}(\boldsymbol{\omega},\boldsymbol{\alpha}|\boldsymbol{\{}{\bf d},\boldsymbol{\theta}\boldsymbol{\}}^\textrm{train}) =\prod_i^{n_\textrm{train}}\mathcal{L}({\bf t}^\textrm{train}_i|\boldsymbol{\theta}^\textrm{train}_i,\boldsymbol{\omega},\boldsymbol{\alpha})p(\boldsymbol{\omega},\boldsymbol{\alpha})$
$$
\mathcal{P}(\boldsymbol{\theta}|{\bf t},\mathcal{M}\otimes\mathscr{f}) = \frac{\mathcal{L}({\bf t}|\boldsymbol{\theta},\mathcal{M}\otimes\mathscr{f})p(\boldsymbol{\theta}|\mathcal{M})}{p({\bf t}|\mathcal{M}\otimes\mathscr{f})}
$$
A slice through at the summarised observation is the approximate posterior
Posterior distribution of galaxy counts and fluxes in fields