Spark GraphX:添加多个边缘权重



我是 GraphX 的新手,有一个包含四列的 Spark 数据帧,如下所示:

src_ip    dst_ip    flow_count   sum_bytes
8.8.8.8   1.2.3.4          435        1137
  ...       ...           ...         ...

基本上,我想将src_ipdst_ip映射到顶点,并将flow_countsum_bytes分配为边属性。据我所知,我们不能在 GraphX 中添加边属性,因为只允许顶点属性。因此,我正在考虑添加flow_count作为边缘权重:

//create edges
val trafficEdges = trafficsFromTo.map(x =Edge(MurmurHash3.stringHash(x(0).toString,MurmurHash3.stringHash(x(1).toString,x(2))

但是,我也可以添加sum_bytes作为边缘重量吗?

可以将这两个变量添加到边缘。最简单的解决方案是使用元组,例如:

val data = Array(Edge(3L, 7L, (123, 456)), Edge(5L, 3L, (41, 34)))
val edges: RDD[Edge[(Int, Int)]] = spark.sparkContext.parallelize(data)

或者,您可以使用案例类:

case class EdgeWeight(flow_count: Int, sum_bytes: Int)
val data2 = Array(Edge(3L, 7L, EdgeWeight(123, 456)), Edge(5L, 3L, EdgeWeight(41, 34)))
val edges: RDD[Edge[EdgeWeight]] = spark.sparkContext.parallelize(data2)

如果要添加更多属性,则使用 case 类的使用和维护会更方便。


我相信在这种特定情况下,最优雅地解决了:

val trafficEdges = trafficsFromTo.map{x => 
  Edge(MurmurHash3.stringHash(x(0).toString, 
       MurmurHash3.stringHash(x(1).toString,
       EdgeWeight(x(2), x(3))
}
trafficEdges.sortBy(edge => edge.attr.flow_count) // sort by flow_count

相关内容

  • 没有找到相关文章

最新更新