处理大数据集时的 FetchFailedException 或 MetadataFetchFailedException

当我使用 1 GB 数据集运行解析代码时，它完成没有任何错误。但是，当我一次尝试 25 GB 的数据时，会出现以下错误。我试图了解如何避免以下故障。很高兴听到任何建议或想法。

差分误差，

org.apache.spark.shuffle.MetadataFetchFailedException: Missing an output location for shuffle 0
org.apache.spark.shuffle.FetchFailedException: Failed to connect to ip-xxxxxxxx
org.apache.spark.shuffle.FetchFailedException: Error in opening FileSegmentManagedBuffer{file=/mnt/yarn/nm/usercache/xxxx/appcache/application_1450751731124_8446/blockmgr-8a7b17b8-f4c3-45e7-aea8-8b0a7481be55/08/shuffle_0_224_0.data, offset=12329181, length=2104094}

集群详情：

纱线：8节点
核心总数：64
内存： 500 GB
火花版本：1.5

火花提交语句：

spark-submit --master yarn-cluster 
                        --conf spark.dynamicAllocation.enabled=true 
                        --conf spark.shuffle.service.enabled=true 
                        --executor-memory 4g 
                        --driver-memory 16g 
                        --num-executors 50 
                        --deploy-mode cluster 
                        --executor-cores 1 
                        --class my.parser 
                        myparser.jar 
                        -input xxx 
                        -output xxxx

堆栈跟踪之一：

at org.apache.spark.MapOutputTracker$$anonfun$org$apache$spark$MapOutputTracker$$convertMapStatuses$2.apply(MapOutputTracker.scala:460)
at org.apache.spark.MapOutputTracker$$anonfun$org$apache$spark$MapOutputTracker$$convertMapStatuses$2.apply(MapOutputTracker.scala:456)
at scala.collection.TraversableLike$WithFilter$$anonfun$foreach$1.apply(TraversableLike.scala:772)
at scala.collection.IndexedSeqOptimized$class.foreach(IndexedSeqOptimized.scala:33)
at scala.collection.mutable.ArrayOps$ofRef.foreach(ArrayOps.scala:108)
at scala.collection.TraversableLike$WithFilter.foreach(TraversableLike.scala:771)
at org.apache.spark.MapOutputTracker$.org$apache$spark$MapOutputTracker$$convertMapStatuses(MapOutputTracker.scala:456)
at org.apache.spark.MapOutputTracker.getMapSizesByExecutorId(MapOutputTracker.scala:183)
at org.apache.spark.shuffle.hash.HashShuffleReader.read(HashShuffleReader.scala:47)
at org.apache.spark.rdd.ShuffledRDD.compute(ShuffledRDD.scala:90)
at org.apache.spark.rdd.RDD.computeOrReadCheckpoint(RDD.scala:297)
at org.apache.spark.rdd.RDD.iterator(RDD.scala:264)
at org.apache.spark.rdd.MapPartitionsRDD.compute(MapPartitionsRDD.scala:38)
at org.apache.spark.rdd.RDD.computeOrReadCheckpoint(RDD.scala:297)
at org.apache.spark.rdd.RDD.iterator(RDD.scala:264)
at org.apache.spark.scheduler.ResultTask.runTask(ResultTask.scala:66)
at org.apache.spark.scheduler.Task.run(Task.scala:88)
at org.apache.spark.executor.Executor$TaskRunner.run(Executor.scala:214)
at java.util.concurrent.ThreadPoolExecutor.runWorker(ThreadPoolExecutor.java:1142)
at java.util.concurrent.ThreadPoolExecutor$Worker.run(ThreadPoolExecutor.java:617)
at java.lang.Thread.run(Thread.java:745)

此错误几乎可以保证是由执行程序上的内存问题引起的。我可以想到几种解决这些类型问题的方法。

1）您可以尝试使用更多分区运行（在dataframe上执行repartition）。当一个或多个分区包含的数据多于内存容量时，通常会出现内存问题。

2）我注意到您没有明确设置spark.yarn.executor.memoryOverhead，因此它将默认为max(386, 0.10* executorMemory)在您的情况下为400MB。这对我来说听起来很低。我会尝试将其增加到 1GB（请注意，如果您将内存开销增加到 1GB，则需要将--executor-memory降低到 3GB）

3）查看故障节点上的日志文件。您要查找文本"杀死容器"。如果您看到文本"超出物理内存限制"，根据我的经验，增加内存开销将解决问题。

除了上述内存和网络配置问题外，值得注意的是，对于大型表（例如此处的几个TB），org.apache.spark.shuffle.FetchFailedException可能会由于检索随机分区超时而发生。要解决此问题，您可以设置以下内容：

SET spark.reducer.maxReqsInFlight=1;  -- Only pull one file at a time to use full network bandwidth.
SET spark.shuffle.io.retryWait=60s;  -- Increase the time to wait while retrieving shuffle partitions before retrying. Longer times are necessary for larger files.
SET spark.shuffle.io.maxRetries=10;

通过将 Spark 超时spark.network.timeout增加到更大的值（如 800），我也得到了一些不错的结果。默认的 120 秒将导致许多执行程序在负载较重时超时。

好吧，这是一个古老的线程，在 Stackoverflow 上有很多答案，但我因这个错误损失了几天，我认为分享这个故事可能会有所帮助。

实际上有几种方式可以发生这种情况。正如Glennie的精彩回答所提到的，这很可能是一个内存问题，因此请确保您有足够的内存来存储所有内容。有容器内存、AM 内存、映射内存、reduce 内存等配置需要注意。阅读本文对找到正确的配置有很大帮助。您应该自己选择数字，但这里有一些我设置的属性。

纱线站点.xml

<property>
    <name>yarn.nodemanager.resource.memory-mb</name>
    <value>32768</value>
</property>
<property>
    <name>yarn.app.mapreduce.am.resource.mb</name>
    <value>4096</value>
</property>
<property>
    <name>yarn.scheduler.minimum-allocation-mb</name>
    <value>4096</value>
</property>

地图网站.xml

<property>
    <name>mapreduce.map.memory.mb</name>
    <value>4096</value>
</property>
<property>
    <name>mapreduce.reduce.memory.mb</name>
    <value>4096</value>
</property>

这些可以修复您可能遇到的其他一些错误，例如 PySpark shell 在启动时崩溃。但就我而言，尽管一些错误消失了（例如MetadataFetchFailed错误），但问题仍然存在。确切的错误是：

org.apache.spark.shuffle.FetchFailedException：无法连接到 DB-ETA-C/x.x.x.x：34085

在尝试了从 Spark 超时到 YARN 随机服务的所有可能的 YARN 和 Spark 属性后，我最终意识到在错误日志中失败的容器正在寻找 x.x.x.x ，运行时的本地（内部）IP netstat -tulpn | grep <PORT NUM>返回 y.y.y.y：34085，其中 y.y.y.y 是外部 IP 地址。这根本不是内存问题，它只是一个网络配置问题。

Spark 服务仅绑定到外部接口，因为主机名与 /etc/hosts 中的外部 IP 相关联。更新/etc/hosts文件后，问题已修复。

底线：该错误显然表明某些容器无法到达另一个容器。这通常是由于内存问题导致的容器故障，但它也可能是网络问题，因此也要注意这些问题，尤其是在节点上有多个接口的情况下。

如果所有随机任务都失败了，那么一个可能的原因可能是 netty 的依赖冲突。从火花核心中排除网络依赖对我有用。

       <dependency>
            <groupId>org.apache.spark</groupId>
            <artifactId>spark-core_2.10</artifactId>
            <version>${spark.version}</version>
            <exclusions>
                <exclusion>
                    <groupId>io.netty</groupId>
                    <artifactId>netty-all</artifactId>
                </exclusion>
                <exclusion>
                    <groupId>io.netty</groupId>
                    <artifactId>netty</artifactId>
                </exclusion>
            </exclusions>
        </dependency>

相关内容

最新更新

热门标签：