At each time step (t), the encoder outputs logits
Collecting over time (mean-field form):
Initial state distribution:
Transitions (stationary or input-conditioned):
Mean-field expected log prior under (q):
\sum_{k=1}^K q_{1,k}, \log \pi_k ;+; \sum_{t=2}^T \sum_{i=1}^K \sum_{j=1}^K q_{t-1,i}, q_{t,j}, \log A_t[i,j]. $$
Parameterization via logits (normalization):
Stationary: $$ M_t \equiv M \in \mathbb{R}^{K\times K}. $$
Input-conditioned: $$ M_t = g_\theta^{\text{trans}}(u_t) \in \mathbb{R}^{K\times K}. $$
State embedding matrix
Emission parameters (diagonal Gaussian):
Per-time log likelihood (diagonal Gaussian):
$$ \log p_\theta(x_t \mid z_t) \approx \log \mathcal{N}!\big(x_t;, \mu_t,, \mathrm{diag}(\sigma_t^2)\big) = -\tfrac{1}{2}!\left[ d\log(2\pi)
- \sum_{j=1}^d \log \sigma^2_{t,j}
- \sum_{j=1}^d \frac{(x_{t,j}-\mu_{t,j})^2}{\sigma^2_{t,j}} \right]. $$
Expected reconstruction term under (q):
\sum_{t=1}^T \sum_{k=1}^K q_{t,k}, \log p_\theta(x_t \mid z_t = k) ;;\approx;; \sum_{t=1}^T \log \mathcal{N}!\big(x_t;, \mu_t,, \mathrm{diag}(\sigma_t^2)\big). $$
(The approximation uses
Entropy (sum over time and states):
\sum_{t=1}^T \sum_{k=1}^K \big(- q_{t,k}, \log q_{t,k}\big). $$
Full ELBO:
\underbrace{\mathbb{E}q[\log p\theta(x_{1:T} \mid z_{1:T})]}{\text{reconstruction}} + \underbrace{\mathbb{E}q[\log p\theta(z{1:T} \mid u_{1:T})]}_{\text{HMM prior}}
\underbrace{\mathbb{E}q[\log q\phi(z_{1:T} \mid x_{1:T})]}_{\text{entropy}}. $$
Optional
\mathrm{Recon} + \beta ,(\mathrm{Prior} - \mathrm{Entropy}), \qquad \beta \in [0,1]. $$
Training objective (minimize negative ELBO):
-
$K$ : number of discrete hidden states (regimes). -
$T$ : number of time steps. -
$d$ : data dimension per time step. -
$q_{t,k}$ : variational posterior probability of state$k$ at time$t$ . -
$\pi$ : initial state distribution (with$\sum_{k=1}^K \pi_k = 1$ ). -
$A_t$ : transition probabilities at time$t$ (each row sums to$1$ ). -
$E \in \mathbb{R}^{K\times D}$ : state embedding matrix;$D$ is embedding size. -
$g_\theta$ : decoder network producing$(\mu_t,\log\sigma_t^2)$ from$e_t$ . -
$u_t$ : optional exogenous inputs for input-conditioned transitions.