Inscription gratuite + 7 jours PRO offerts Créer mon compte
Data Shop / Data / MLB Modeling Features (2023-2025)
MLB Modeling Features (2023-2025)
Data · MLB

MLB Modeling Features (2023-2025)

45 features pré-calculées combinant cotes Pinnacle, métriques avancées, météo, stats pitchers et park factors. Plug & play dans n'importe quel framework ML.

6 223Matchs
41Features
3Saisons
ZéroNULLs
Données : Mai 2023 — Oct 2025 Mis à jour le 10/03/2026
29€ Achat unique
Acheter et télécharger
Téléchargement immédiat CSV + Parquet Paiement sécurisé Stripe Usage commercial OK
Pinnacle uniquement Le bookmaker le plus sharp du marché
2023 — 2025 Trois saisons régulières complètes
Zéro NULLs Chaque cellule remplie, garanti
CSV + Parquet pandas, Polars, DuckDB, R, Spark

Contenu du dataset

Chaque colonne, chaque ligne — voici exactement ce que vous obtenez.

Intelligence Pitcher

xERA du lanceur partant, main de lancer, confrontations wOBA frappeurs vs SP, différentiel xERA et ERA du bullpen (glissant).

Métriques glissantes

Moyennes glissantes sur 7 jours : vélocité des lancers, vitesse de sortie et taux de HR. Pré-calculées pour éviter le fenêtrage manuel.

Stade & météo

Facteurs de runs par stade, température (°C), vitesse du vent (km/h), indicateur de dôme. Toutes les features pré-jointes — zéro engineering nécessaire.

Aperçu des données

5 lignes exemple
mlb_modeling_features_2024.csv
#game_pkdatehomeawayft_linef5_linespreadsp_homexera_hxera_abp_era_hpark_ftemp_cdome
17454442024-03-20SDLAD9.04.51.5Yu Darvish3.423.183.850.9721.30
27461752024-03-21LADSD8.54.5-1.5Y. Yamamoto3.614.023.721.0319.80
37450392024-03-28TEXCHC8.54.5-1.5N. Eovaldi3.893.554.121.0824.11
47451162024-03-28TBTOR7.54.0-1.5Z. Eflin3.243.963.580.9223.51
57452832024-03-28SEABOS7.54.0-1.5L. Castillo3.154.213.410.9511.21
Zéro cellule vide, garanti. Chaque ligne est 100% complète — les matchs avec données manquantes sont exclus avant export. Vous n'aurez jamais à gérer de NaN, NULL ou valeurs vides.

Matchs inclus

SaisonMatchssur 2 430
20231 82275,0%
20242 29694,5%
20252 10586,6%
Total6 22391,7%

*Chaque saison MLB comprend 2 430 matchs programmés. Les matchs avec cotes incomplètes ou scores manquants sont exclus — c'est pourquoi chaque ligne incluse a zéro valeur manquante.

Schéma (colonnes clés)

ColonneDescription
game_pk / game_dateID de match + date
ft_line / f5_line / spreadPinnacle ouverture + actuel
sp_home_name / sp_away_nameNoms des lanceurs partants
sp_home_xera / sp_away_xeraERA attendu (xERA)
xera_diffDifférentiel xERA
bullpen_era_home / _awayERA du bullpen (glissant)
velo_* / exit_velo_*Métriques pitchers glissantes 7 jours
woba_home_vs_spwOBA de l'alignement vs SP adverse
park_factorFacteur de runs du stade
temp_c / wind_kph / domeMétéo + indicateur de dôme
score_home / total_runsVariables cibles

Économisez 40+ heures de data engineering. Construire ce dataset de zéro implique d'écrire des intégrations API, gérer les limites de requêtes, nettoyer les cas limites, combler les lacunes et joindre plusieurs sources. Nous avons tout fait. Vous obtenez le résultat propre — prêt à charger dans pandas en une ligne.

Conçu pour

Data Scientists

Entraînez des modèles prédictifs avec 45 features pré-calculées. Compatible scikit-learn, XGBoost, LightGBM, CatBoost, PyTorch, R.

Zéro feature engineering

Toutes les features pré-calculées et pré-jointes. Pas d'intégrations API, pas de nettoyage de données, aucune valeur manquante à combler.

Étudiants & chercheurs

Étudiez l'analytique sportive avec des données réelles. Parfait pour les mémoires, projets et compétitions Kaggle.

Fichiers inclus

Chaque dataset en CSV et Parquet — par saison + bundle complet.

CSV
mlb_modeling_features_2023.csv
PQ
mlb_modeling_features_2023.parquet
CSV
mlb_modeling_features_2024.csv
PQ
mlb_modeling_features_2024.parquet
CSV
mlb_modeling_features_2025.csv
PQ
mlb_modeling_features_2025.parquet
CSV
mlb_modeling_features_2023_2025.csv
PQ
mlb_modeling_features_2023_2025.parquet

Questions fréquentes

Quels formats de fichier sont inclus ?
CSV (UTF-8, séparé par virgules) et Parquet (compression ZSTD). Compatible avec pandas, Polars, DuckDB, Spark, R (arrow) et tout outil lisant les formats tabulaires standard.
Comment télécharger les fichiers ?
Après paiement via Stripe, vous recevez un lien de téléchargement immédiat. Le lien est valide pendant 72 heures avec jusqu'à 5 téléchargements. Tous les fichiers sont regroupés dans un seul ZIP.
Que signifie « Zéro NULLs » ?
Chaque cellule de chaque fichier est remplie — aucune valeur manquante, aucun NaN, aucun blanc. Les matchs avec des données incomplètes (cotes manquantes, scores absents, etc.) sont exclus avant export pour que vous obteniez un dataset 100% propre.
D'où viennent les cotes ?
Pinnacle, via les endpoints historiques de The Odds API. Pinnacle est largement considéré comme le bookmaker le plus sharp — ses lignes sont les plus proches de la probabilité réelle et le standard de référence pour le calcul de la CLV.
Puis-je utiliser ces données commercialement ?
Oui. Les données sont sous licence pour usage personnel et commercial (analyse, modélisation, dashboards, outils). La redistribution des fichiers de données brutes est interdite.
Dois-je encore faire du feature engineering ?
Non. Les 45 features sont pré-calculées, pré-jointes et prêtes à l'emploi. Chargez simplement le fichier et passez-le à votre modèle. Les variables cibles (scores, total de runs, marge) sont incluses.
Quels frameworks ML sont compatibles ?
Tous. Les données sont tabulaires standard (CSV/Parquet) et fonctionnent avec scikit-learn, XGBoost, LightGBM, CatBoost, PyTorch, TensorFlow, R, Julia — tout framework qui lit des DataFrames.

Prêt à construire ?

Un fichier. Un achat. Des backtests infinis.

29€
Acheter et télécharger
Paiement sécurisé via Stripe · Téléchargement immédiat · CSV + Parquet · Usage commercial OK
JEU INTERDIT AUX MINEURS. Jouer comporte des risques : endettement, dépendance, isolement. Aide & jeu responsable · Joueurs Info Service : 09 74 75 13 13