Circonscriptions classées par écart projeté entre le favori et son poursuivant. La sélection d'une ligne ou d'une case de la carte met à jour la fiche ci-dessus.
Quatre sources alimentent le modèle. (i) Les sondages provinciaux d'intentions de vote de 2014 à aujourd'hui, compilés depuis les tableaux publics de Wikipédia (CC BY-SA), chaque entrée renvoyant à la publication originale de la maison de sondage; les ventilations régionales (Montréal, Québec, reste du Québec) proviennent des rapports des maisons lorsque publiés. (ii) Les résultats officiels des élections générales de 2014, 2018 et 2022 (Élections Québec), réagrégés sur la carte électorale de 2026 (127 circonscriptions) par correspondance géographique des sections de vote, ainsi que les cinq élections partielles tenues depuis 2022 (DGEQ). (iii) Le recensement de 2021 (Statistique Canada), agrégé des aires de diffusion vers les circonscriptions. (iv) Le statut des députés sortants, les retraits et les candidatures des chefs, relevés des pages de l'Assemblée nationale.
Un vecteur d'intentions de vote est une composition : ses parts sont positives et somment à l'unité, de sorte que l'analyse est conduite dans le simplexe et non dans l'espace euclidien des pourcentages. Toutes les réponses et tous les prédicteurs de nature compositionnelle sont transformés en coordonnées log-ratio isométriques (ILR), base orthonormée de dimension k−1 dans laquelle les opérations linéaires et les distances sont valides. Les ajustements multiplicatifs (primes et pénalités locales) sont appliqués comme perturbations compositionnelles, l'opération interne du simplexe. Les partis non ventilés par les sondages anciens sont traités par amalgamation dans la part résiduelle, avec remplacement multiplicatif des zéros.
La trajectoire des intentions de vote est estimée par régression par processus gaussien, un processus indépendant par coordonnée ILR, noyau de Matérn (ν = 3/2). La variance d'observation de chaque sondage est calculée par coordonnée : méthode delta appliquée à l'échantillonnage multinomial, Var(ilr_c) = Σ_p M²_cp / (n x_p), où M est le jacobien de la transformation ILR. Une échelle multiplicative par coordonnée, estimée sur grille, absorbe la surdispersion entre maisons de sondage. Les hyperparamètres (portée, échelle de bruit et paramètres de non-stationnarité) sont marginalisés : la prédiction est la moyenne des modèles de la grille pondérée par leur vraisemblance marginale, et l'incertitude sur les hyperparamètres est ainsi incluse dans les intervalles prédictifs.
Deux formes de non-stationnarité sont admises, chacune contenant le modèle stationnaire comme cas particulier afin que la sélection relève de la vraisemblance et non d'un choix discrétionnaire. Premièrement, des points de rupture aux changements de chefs (14 janvier et 12 avril 2026) : la covariance entre régimes est multipliée par ρ|Δr|, ρ ∈ [0, 1] estimé par vraisemblance marginale, ρ = 1 restituant le noyau stationnaire; une rupture partielle est retenue sur une coordonnée, le modèle stationnaire ailleurs. Deuxièmement, une dilatation de l'axe temporel en période de campagne (du décret au scrutin, fenêtres 2014, 2018, 2022 et 2026) : un jour de campagne compte pour k jours de temps de noyau, k partagé entre toutes les campagnes (donc identifié principalement par les campagnes passées) et k = 1 restituant l'horloge uniforme. La dilatation retenue est forte : portée effective d'environ 40 à 190 jours en campagne selon la coordonnée, contre 300 à 1500 hors campagne. La calibration des intervalles prédictifs est mesurée par validation séquentielle : à chaque coupure mensuelle de 2016 à 2026, le modèle ajusté sur les seuls sondages antérieurs prédit le sondage suivant. L'intervalle nominal à 90 % couvre 79 % de ces 675 prédictions (95 % en période de campagne, 78 % hors campagne). La validation croisée par plis aléatoires donne 90,5 %, chiffre qui mesure l'interpolation de la série et non la prédiction.
Les sondages régionaux sont intégrés par un processus gaussien conjoint à observations agrégées. Chaque région r possède une trajectoire latente fr = g + hr, où g est la composante provinciale commune et hr un écart régional indépendant. Un sondage national observe la somme des fr pondérée par les poids électoraux; un sondage régional observe fr directement. Ces deux types d'observations étant des fonctionnelles linéaires du processus, la loi a posteriori demeure gaussienne et s'obtient en forme fermée. Le noyau de g hérite, coordonnée par coordonnée, de la portée et de l'horloge dilatée de la tendance nationale, de sorte que la portée héritée conserve la même signification dans les deux modèles; la variance d'observation régionale suit la théorie de l'échantillonnage (≈ 3/n). Validation rétrospective sur 2022 : erreur absolue moyenne régionale de 3,1 points, contre 3,6 pour l'hypothèse de swing uniforme.
Le point de départ de chaque circonscription est son résultat de 2022 exprimé sur la carte de 2026. Aucune correction de participation différentielle n'est appliquée : le poids de rétrécissement de cette correction, estimé sur grille contre les sondages finaux de 2022 et de 2026 combinés, est nul (erreur absolue moyenne de 1,89 point sans correction, 2,06 avec). Le mouvement provincial estimé (section 3), net de l'écart régional courant moins celui de 2022 (section 4), est appliqué en log-ratios. Trois ajustements estimés s'y superposent, tous en perturbation compositionnelle :
S'ajoute une déviation locale prédite par régression par processus gaussien multivarié (noyau de Matérn, un processus par coordonnée ILR, hyperparamètres re-sélectionnés par vraisemblance marginale dans chaque pli de validation). Les prédicteurs sont le profil du recensement (langue d'usage, scolarité, statut d'immigration et structure sectorielle de l'emploi, chacun fermé par une part résiduelle explicite puis transformé en ILR; âge médian, revenu médian des ménages et densité de population comme grandeurs scalaires) et la déviation de la circonscription à l'élection précédente, en ILR. Aucune sélection de variables n'est opérée. R² multivarié hors échantillon : 0,44 (retrait aléatoire de 50 % des circonscriptions, répété 15 fois), contre 0,38 pour la régression ridge de référence.
La distribution des sièges est obtenue par simulation Monte Carlo (5 000 tirages) propageant quatre sources d'incertitude : (i) la loi a posteriori de la tendance nationale; (ii) un choc systémique commun à toutes les circonscriptions (biais collectif des maisons de sondage et dérive d'opinion jusqu'au scrutin), calibré sur l'écart entre les derniers sondages et les résultats réels de 2018 et 2022, isotrope en ILR; (iii) un choc régional, les déviations locales étant spatialement corrélées; (iv) la déviation idiosyncrasique de chaque circonscription, rééchantillonnée des erreurs de prédiction hors échantillon du modèle local, à variance élargie là où le modèle ne prédit rien. Chaque tirage attribue un gagnant par circonscription; les 127 sièges sont donc alloués dans chaque tirage.
Deux statistiques résument la distribution jointe. La probabilité de victoire par circonscription est la fréquence de victoire sur les tirages; par linéarité de l'espérance, sa somme sur les circonscriptions égale l'espérance de sièges du parti, et ces espérances somment exactement à 127, l'unique décomposition par circonscription qui soit additive. Le scénario central rapporté est le médoïde de la distribution jointe : le tirage minimisant la distance L1 moyenne aux autres tirages. Contrairement au vecteur des médianes marginales, qui ne correspond à aucun scénario atteignable et ne somme pas au nombre de sièges, le médoïde est une réalisation effective, cohérente entre partis. Les intentions de vote rapportées décrivent l'état de l'opinion à la date du calcul; la simulation de sièges porte sur le jour du scrutin (5 octobre 2026). Chaque tirage portant à la fois une composition nationale de votes et une allocation de sièges, la distorsion du mode de scrutin est elle-même une distribution jointe : le panneau votes-sièges rapporte les espérances des deux parts par parti et l'indice des moindres carrés de Gallagher, √(½Σ(v−s)²), résumé en médiane et intervalle à 90 % sur les tirages.
Le pipeline a été validé rétrospectivement sur les deux élections disponibles. Sur 2022 (swing seul) : 89 % des circonscriptions correctement classées, 78 % des courses serrées. Sur 2018 (pipeline complet, en validation temporelle inversée faute d'une troisième élection) : 89 % des circonscriptions et 97 % des serrées, contre 52 % pour la projection sans changement. Le choc systémique est calibré sur les élections de 2018 et de 2022; son isotropie en coordonnées ILR a été testée contre une alternative anisotrope (axe principal des dérives observées, part directionnelle sur grille) et retenue par validation leave-one-out sur les trois dérives disponibles. La participation différentielle par âge n'est pas modélisée (poids optimal nul sur les sondages finaux de 2022 et 2026 combinés). Ne sont pas modélisées non plus : la notoriété individuelle des candidats (testée via la notoriété Wikipédia, redondante avec le profil démographique, sans gain hors échantillon) et la covariance entre partis dans la tendance. Cette dernière a été évaluée deux fois : par injection de la corrélation empirique des résidus de sondages (rejetée, l'effet sur les sièges restant dans le bruit de simulation), puis par corégionalisation intrinsèque, la matrice de couplage B étant estimée conjointement par vraisemblance marginale sur les coordonnées ILR empilées; le gain de vraisemblance in-sample (+7 nats sur le modèle indépendant) ne survit pas à la validation croisée (log-vraisemblance prédictive inférieure de 25 nats sur 1 355 observations, couverture inchangée), signature d'un surajustement des hyperparamètres de couplage. Les effets de maison de sondage, évalués par validation croisée temporelle, n'apportent aucun gain prédictif et ne sont pas retenus; les portées par variable (ARD) du modèle local dégradent la prédiction hors échantillon et sont écartées. Le poids du signal des partielles demeure un a priori non validable sur données historiques.
L'ensemble des estimations (transformations compositionnelles, régressions par processus gaussien, sélection d'hyperparamètres et validation croisée) repose sur la suite de calcul tangent. Le pipeline complet est publié sous licence GPL-3 et reproductible depuis le dépôt github.com/essicolo/silatendancesemaintient (Essi Parent; assistance de Claude Code pour l'ingestion des données et l'organisation du flux de calcul). La projection est recalculée intégralement à chaque nouveau sondage détecté.