PySpark 是 Apache Spark 的 Python API,后者是分布式数据处理引擎。它允许 Python 代码在集群上运行 Spark 作业,处理 TB 级规模的数据集。PySpark 提供与 Pandas 类似的 DataFrame 和 SQL API,并集成 MLlib 用于分布式机器学习。当数据量超出 Dask 或单台机器的处理能力时,就会使用它。
登录查看节点详情
首阶段节点可试读;登录后解锁全部路线图节点正文与进度同步。