MLB Modeling Features (2023-2025)
45 features pré-calculées combinant cotes Pinnacle, métriques avancées, météo, stats pitchers et park factors. Plug & play dans n'importe quel framework ML.
Contenu du dataset
Chaque colonne, chaque ligne — voici exactement ce que vous obtenez.
Intelligence Pitcher
xERA du lanceur partant, main de lancer, confrontations wOBA frappeurs vs SP, différentiel xERA et ERA du bullpen (glissant).
Métriques glissantes
Moyennes glissantes sur 7 jours : vélocité des lancers, vitesse de sortie et taux de HR. Pré-calculées pour éviter le fenêtrage manuel.
Stade & météo
Facteurs de runs par stade, température (°C), vitesse du vent (km/h), indicateur de dôme. Toutes les features pré-jointes — zéro engineering nécessaire.
Aperçu des données
5 lignes exemple| # | game_pk | date | home | away | ft_line | f5_line | spread | sp_home | xera_h | xera_a | bp_era_h | park_f | temp_c | dome |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 1 | 745444 | 2024-03-20 | SD | LAD | 9.0 | 4.5 | 1.5 | Yu Darvish | 3.42 | 3.18 | 3.85 | 0.97 | 21.3 | 0 |
| 2 | 746175 | 2024-03-21 | LAD | SD | 8.5 | 4.5 | -1.5 | Y. Yamamoto | 3.61 | 4.02 | 3.72 | 1.03 | 19.8 | 0 |
| 3 | 745039 | 2024-03-28 | TEX | CHC | 8.5 | 4.5 | -1.5 | N. Eovaldi | 3.89 | 3.55 | 4.12 | 1.08 | 24.1 | 1 |
| 4 | 745116 | 2024-03-28 | TB | TOR | 7.5 | 4.0 | -1.5 | Z. Eflin | 3.24 | 3.96 | 3.58 | 0.92 | 23.5 | 1 |
| 5 | 745283 | 2024-03-28 | SEA | BOS | 7.5 | 4.0 | -1.5 | L. Castillo | 3.15 | 4.21 | 3.41 | 0.95 | 11.2 | 1 |
Matchs inclus
| Saison | Matchs | sur 2 430 |
|---|---|---|
| 2023 | 1 822 | 75,0% |
| 2024 | 2 296 | 94,5% |
| 2025 | 2 105 | 86,6% |
| Total | 6 223 | 91,7% |
*Chaque saison MLB comprend 2 430 matchs programmés. Les matchs avec cotes incomplètes ou scores manquants sont exclus — c'est pourquoi chaque ligne incluse a zéro valeur manquante.
Schéma (colonnes clés)
| Colonne | Description |
|---|---|
| game_pk / game_date | ID de match + date |
| ft_line / f5_line / spread | Pinnacle ouverture + actuel |
| sp_home_name / sp_away_name | Noms des lanceurs partants |
| sp_home_xera / sp_away_xera | ERA attendu (xERA) |
| xera_diff | Différentiel xERA |
| bullpen_era_home / _away | ERA du bullpen (glissant) |
| velo_* / exit_velo_* | Métriques pitchers glissantes 7 jours |
| woba_home_vs_sp | wOBA de l'alignement vs SP adverse |
| park_factor | Facteur de runs du stade |
| temp_c / wind_kph / dome | Météo + indicateur de dôme |
| score_home / total_runs | Variables cibles |
Économisez 40+ heures de data engineering. Construire ce dataset de zéro implique d'écrire des intégrations API, gérer les limites de requêtes, nettoyer les cas limites, combler les lacunes et joindre plusieurs sources. Nous avons tout fait. Vous obtenez le résultat propre — prêt à charger dans pandas en une ligne.
Conçu pour
Data Scientists
Entraînez des modèles prédictifs avec 45 features pré-calculées. Compatible scikit-learn, XGBoost, LightGBM, CatBoost, PyTorch, R.
Zéro feature engineering
Toutes les features pré-calculées et pré-jointes. Pas d'intégrations API, pas de nettoyage de données, aucune valeur manquante à combler.
Étudiants & chercheurs
Étudiez l'analytique sportive avec des données réelles. Parfait pour les mémoires, projets et compétitions Kaggle.
Fichiers inclus
Chaque dataset en CSV et Parquet — par saison + bundle complet.
Questions fréquentes
Quels formats de fichier sont inclus ?
Comment télécharger les fichiers ?
Que signifie « Zéro NULLs » ?
D'où viennent les cotes ?
Puis-je utiliser ces données commercialement ?
Dois-je encore faire du feature engineering ?
Quels frameworks ML sont compatibles ?
Prêt à construire ?
Un fichier. Un achat. Des backtests infinis.