mfsig.com
⚠ HISTORIQUE — notes de version v0.28.1 · rang #6/12 HONNÊTE

v0.28.1 — σ-profiles corrigés + comblement honnête de l'écart de benchmark

Trois corrections d'exactitude (conservation de charge, moments robustes aux NaN, filtre d'ensemble de segments) plus trois champs de comblement d'écart de benchmark (dipôle DFT direct, décalage de biais, traducteur à 5 paramètres). OOD HONNÊTE sur la ΔG d'hydratation FreeSolv : rang #6/12 avec MAE 0,87 kcal/mol en utilisant DFT brut + décalage de biais universel de +0,51. La MAE LOO du traducteur est de 1,23 (pire que 0,945 brut) — recherche uniquement, pas pour la production. ⚠ HISTORIQUE : ceci documente la version v0.28.1 (avril 2026). La production actuelle est v0.28.3 avec MAE 0,85 kcal/mol et décalage de biais de +1,71 sur 28 ancres FreeSolv — voir PROJECT_SNAPSHOT et la page /benchmarks.

Exactitude — le parcours DFT v0.28 sous-représentait les donneurs HB et surcomptait la polarisation sur les grands polymères flexibles en raison d'une renormalisation manquante de la conservation de charge COSMO. v0.28.1 impose ∫σ·dA = −kεps · Q_solute via le décalage σ-uniforme pondéré par l'aire standard utilisé par tout code COSMO de production, appliqué à l'ensemble de segments que le pipeline en aval conserve réellement (et non la grille de Lebedev complète). La masse des donneurs HB est restaurée, |ΣQ_seg| < 0,05 e pour chaque entrée.

Comblement de l'écart de benchmark — chaque .mfsig.json porte désormais cinq champs supplémentaires. Le chiffre ΔG recommandé en production est g_polar_bias_corrected_kcal_mol (brut + décalage universel de +0,511 kcal/mol) — MAE 0,87 sur 18 ancres, rang #6/12. Le traducteur à 5 paramètres (g_total_kcal_mol_translator) est exposé pour la recherche/SAR mais N'EST PAS recommandé sur des médicaments inconnus : sa MAE LOO est de 1,23 (pire que 0,945 brut) car il surajuste la cohorte de calibration à 15 ancres. Entraînez au-delà de ~100 ancres avant de faire confiance à toute correction ΔG multiparamétrique. La distribution χ de l'atlas est désormais physiquement significative : plage [−0,01, +1,11], moyenne +0,22, 27 % de cellules χ-pass (contre 92,5 % pour la cohorte défectueuse, qui était un artefact de σ-profiles dégénérés).

Couverture de la cohorte + limites connues

20 / 20 médicaments réussissent 7/7 portes. 19 / 20 polymères réussissent 7/7 portes. HPMCAS_L (123 atomes, def2-SVP) est dans mfsig_deferred_queue.jsonl en attente du niveau Heavy-Track (niveau haute mémoire ou repli CPU). Corrélations HB : donneur↔HBD r=+0,65, accepteur↔HBA r=+0,72 (RÉUSSI). Limites connues : (a) le noyau χ produit des magnitudes proches de zéro sur les aires de cavité absolues — criblage uniquement, en attente d'un réajustement de K_chi par ancre. (b) l'invariant σ T01 (plus serré que la porte de cohorte de 0,05 e) montre un résidu de charge à l'échelle de la taille sur les grands polymères (8/19 polymères tous réussis). Note sur LVPP : nous ne traitons PAS LVPP-DFT comme une vérité terrain — il ne publie ni géométries, ni détails de construction de cavité, ni σ-moments ; r² de la cohorte vs LVPP = 0,20 même après notre meilleure relaxation DFT (structurel, non numérique ; voir refs/BENCHMARK_AND_COMPETITORS.md §4). Le .mfsig.json de la cohorte MolForge — avec géométries relaxées par DFT, cavité + bornes de cases explicites, σ-moments, audit SHA-256 — est la référence de remplacement reproductible.

Provenance + validation du cache σ

Fichier d'ancres FreeSolv : database.txt v0.52, préfixe SHA-256 2d13f095713bc39b, 639 entrées. Correspondance de cohorte : 15 / 20 médicaments (paracétamol, diazépam, amlodipine, atorvastatine, eau absente de v0.52). Répartition de l'ajustement : 12 entraînement / 3 test mis de côté, avec graine. Validation directe par cosinus du cache σ par rapport à la référence de production : caféine 0,86, diazépam 0,95 — la confirmation directe la plus nette que les σ-profiles v028 corrigés concordent avec la production. Auparavant, cette métrique était de 0/87 ≥ 0,90.