我有一个LDA模型,运行的语料库大小为12,054个文档,词汇大小为9,681个单词和60个聚类。我试图通过调用.topicDistributions()或.javaTopicDistributions()来获得文档的主题分布。这两种方法都返回文档上的主题分布的rdd。因此,根据我的理解,行数应该是文档数,列数应该是主题数。但是,当我在调用topicDistributions()之后对rdd进行计数时,我得到的计数是11,665 (少于传递给模型的文档数量)?每个文档都有正确的主题数量(60)。为什么会这样呢?
下面是演示:http://spark.apache.org/docs/latest/mllib-clustering.html
代码如下:
enter code here
//parse tf vectors from corpus
JavaRDD<Vector> parsedData = data.map(
new Function<String, Vector>() {
public Vector call(String s) {
s = s.substring(1, s.length()-1);
String[] sarray = s.trim().split(",");
double[] values = new double[sarray.length];
for (int i = 0; i < sarray.length; i++)
{
values[i] = Double.parseDouble(sarray[i]);
}
return Vectors.dense(values);
}
);
System.out.println(parsedData.count()) //prints 12,054
// Index documents with unique IDs
JavaPairRDD<Long, Vector> corpus = JavaPairRDD.fromJavaRDD(parsedData.zipWithIndex().map(
new Function<Tuple2<Vector, Long>, Tuple2<Long, Vector>>() {
public Tuple2<Long, Vector> call(Tuple2<Vector, Long> doc_id) {
return doc_id.swap();
}
}
));
System.out.println(corpus.count()) //prints 12,054
LDA lda = new LDA()
LDAModel ldaModel = lda.setK(k.intValue()).run(corpus);
RDD<scala.Tuple2<Object,Vector>> topic_dist_over_docs = ((DistributedLDAModel) ldaModel).topicDistributions();
System.out.println(topic_dist_over_docs.count()) //prints 11,655 ???
JavaPairRDD<Long,Vector> topic_dist_over_docs2 = ((DistributedLDAModel) ldaModel).javaTopicDistributions();
System.out.println(topic_dist_over_docs2.count()) //also prints 11,655 ???发布于 2015-08-22 07:15:24
在topicDistributions的Spark1.4中似乎有一个bug。在更新到Spark 1.5的实验版本后,我能够解决这个问题。
https://stackoverflow.com/questions/32019231
复制相似问题