DataForge, powered by Apache Spark es un instalador comunitario para Windows 10/11. No está afiliado a The Apache Software Foundation. Deja un runtime local de Apache Spark listo para usar.
Este repositorio publica las versiones. El instalador y las notas de cada entrega están en Releases.
- Descargar
- Componentes
- Qué hace el instalador
- Comprobar
- Variables de entorno
- Logs
- Desinstalación
- Licencia y marcas
- Abre la última Release.
- Descarga
DataForge-Setup-*.exe. - Ejecútalo. No hace falta Internet durante la instalación.
- Abre una nueva terminal o el acceso directo Apache Spark shell.
La tabla refleja la entrega 0.0.1 anunciada en este README. Cada Release puede traer otras versiones; en ese caso prevalece la tabla de esa entrega.
| Componente | Versión |
|---|---|
| Java (Eclipse Temurin) | 17 |
| Apache Spark | 3.5.9 |
| PySpark | 3.5.9 |
| ipykernel | 7.3.0 |
| winutils (Hadoop) | 3.3.6 |
| CPython oficial | 3.11.9 |
Copia un runtime autocontenido en {InstallDir} (por defecto
C:\Program Files\DataForge):
- Eclipse Temurin, Apache Spark, winutils de Apache Hadoop y un CPython oficial con PySpark e ipykernel
- Variables de usuario:
DATAFORGE_HOME,JAVA_HOME,SPARK_HOME,HADOOP_HOME,PYSPARK_PYTHONyPYSPARK_DRIVER_PYTHON - Accesos directos Apache Spark shell y Python (DataForge)
- Comprobación de que
pysparkarranca en local y de queipykernelse importa
No modifica un Python ajeno ni registra py.exe. Si el producto ya
está instalado, el Setup lo reemplaza en la misma carpeta. Para cambiar
de ubicación, desinstala primero desde Agregar o quitar programas.
Tras instalar, la raíz contiene java/, spark/, hadoop/,
python/ y LICENSE.txt (versiones y licencias de esa copia).
pysparkO desde el acceso directo Python (DataForge):
python -c "import ipykernel; print(ipykernel.__version__)"
python -c "from pyspark.sql import SparkSession; spark = SparkSession.builder.getOrCreate(); print(spark.version); spark.stop()"El runtime Python vive en {InstallDir}\python. Los paquetes extra se
instalan con python -m pip y pueden requerir red.
| Variable | Valor |
|---|---|
DATAFORGE_HOME |
Directorio de instalación |
JAVA_HOME |
{InstallDir}\java |
SPARK_HOME |
{InstallDir}\spark |
HADOOP_HOME |
{InstallDir}\hadoop |
PYSPARK_PYTHON |
{InstallDir}\python\python.exe |
PYSPARK_DRIVER_PYTHON |
Igual que PYSPARK_PYTHON |
Las rutas que DataForge añade al PATH de usuario son absolutas bajo
{InstallDir}. Tras instalar, abre una terminal nueva.
- Durante la post-instalación el instalador muestra un log en tiempo real.
- Si todo va bien, el log sigue visible hasta pulsar Siguiente y
después se elimina
logs/. - Si falla, se conservan
logs/y el runtime copiado.
Usa Agregar o quitar programas. El desinstalador elimina las
variables de entorno, las entradas propias del PATH, el registro
PEP 514 propio, el kernelspec de usuario, el CPython privado y el
contenido de la instalación. No toca otras instalaciones de Python.
- El
.exeincluye el runtime; el tamaño es grande (cientos de MiB). HADOOP_HOMEapunta a la carpeta que contienebin\winutils.exe.- DataForge no está afiliado a The Apache Software Foundation, Eclipse Foundation AISBL ni Python Software Foundation. Apache Spark™ y Spark™ son marcas de la ASF. Ver marcas de Apache Spark.
- El instalador se publica bajo la licencia MIT del archivo
LICENSEde este repositorio. Los componentes empaquetados conservan las suyas.