【学习笔记】维基百科中文数据处理（NLP）

本文简单记录一下初学NLP的一个小例子，NLP需要使用语料库进行训练，本文使用维基百科的中文数据进行训练，下载地址在：https://dumps.wikimedia.org/zhwiki/20171020/，我下载的是比较大的，训练效果也更好。

下载下来后的文件是xml.gz格式的，需要先用维基百科提供的process.py转换为文本文件，该代码可以在维基百科上下载，这里把它贴出来：

#!/usr/bin/env python
# -*- coding: utf-8 -*-
# 修改后的代码如下：
import logging
import os.path
import sys
from gensim.corpora import WikiCorpus
if __name__ == '__main__':program = os.path.basename(sys.argv[0])logger = logging.getLogger(program)logging.basicConfig(format='%(asctime)s: %(levelname)s: %(message)s')logging.root.setLevel(level=logging.INFO)logger.info("running %s" % ' '.join(sys.argv))# check and process input argumentsif len(sys.argv) < 3:print (globals()['__doc__'] % locals())sys.exit(1)inp, outp = sys.argv[1:3]space = b' 'i = 0output = open(outp, 'w',encoding='utf-8')wiki = WikiCorpus(inp, lemmatize=False, dictionary={})for text in wiki.get_texts():s=space.join(text)s=s.decode('utf8') + "\n"output.write(s)i = i + 1if (i % 10000 == 0):logger.info("Saved " + str(i) + " articles")output.close()logger.info("Finished Saved " + str(i) + " articles")
#python process.py zhwiki-latest-pages-articles.xml.bz2 wiki.zh.text

经过处理后的生成的文本文档是繁体中文的，需要转换为简体中文，这里使用OpenCC库，下载地址在：https://bintray.com/package/files/byvoid/opencc/OpenCC，找到对应平台的安装包找帮助使用即可。

转换后的文本还需要进行分词，这里使用Python jieba分词，直接pip install jieba即可安装。分词代码：

import jieba
import jieba.analyse
import jieba.posseg as pseg
import codecs,sys
def cut_words(sentence):#print sentencereturn " ".join(jieba.cut(sentence)).encode('utf-8')
f=codecs.open('wiki.zh.jian.text','r',encoding="utf8")
target = codecs.open("zh.jian.wiki.seg-1.3g.txt", 'w',encoding="utf8")
print ('open files')
line_num=1
line = f.readline()
while line:print('---- processing ', line_num, ' article----------------')line_seg = " ".join(jieba.cut(line))target.writelines(line_seg)line_num = line_num + 1line = f.readline()
f.close()
target.close()
exit()
while line:curr = []for oneline in line:#print(oneline)curr.append(oneline)after_cut = map(cut_words, curr)target.writelines(after_cut)print ('saved',line_num,'articles')exit()line = f.readline1()
f.close()
target.close()# python Testjieba.py

分词后的文本类似于：

欧几里得   西元前 三 世纪 的 希腊 数学家   现在 被 认为 是 几何 之 父   此画 为 拉斐尔 的 作品   雅典 学院   数学

将文本使用gensim word2Vec训练即可，安装gensim也简单，直接pip install，训练代码如下：

import logging
import os.path
import sys
import multiprocessing
from gensim.corpora import WikiCorpus
from gensim.models import Word2Vec
from gensim.models.word2vec import LineSentence
if __name__ == '__main__':program = os.path.basename(sys.argv[0])logger = logging.getLogger(program)logging.basicConfig(format='%(asctime)s: %(levelname)s: %(message)s')logging.root.setLevel(level=logging.INFO)logger.info("running %s" % ' '.join(sys.argv))# check and process input argumentsif len(sys.argv) < 4:print (globals()['__doc__'] % locals())sys.exit(1)inp, outp1, outp2 = sys.argv[1:4]model = Word2Vec(LineSentence(inp), size=400, window=5, min_count=5, workers=multiprocessing.cpu_count())model.save(outp1)model.model.wv.save_word2vec_format(outp2, binary=False)
#python word2vec_model.py zh.jian.wiki.seg.txt wiki.zh.text.model wiki.zh.text.vector
#opencc -i wiki_texts.txt -o test.txt -c t2s.json

训练很费时间，训练完成后即可进行相似度匹配，代码如下：

from gensim.models import Word2Vecen_wiki_word2vec_model = Word2Vec.load('wiki.zh.text.model')testwords = ['苹果','数学','学术','白痴','篮球']
for i in range(5):res = en_wiki_word2vec_model.most_similar(testwords[i])print (testwords[i])print (res)

应该说gensim已经封装了word2vec的细节，所以使用已经很简单了，只是语料库的训练很费时间！

【学习笔记】维基百科中文数据处理（NLP）相关推荐

【NLP】维基百科中文数据训练word2vec词向量模型——基于gensim库
前言本篇主要是基于gensim 库中的 Word2Vec 模型,使用维基百科中文数据训练word2vec 词向量模型,大体步骤如下: 数据预处理模型的训练模型的测试准备条件: Window ...
用Python3.6来做维基百科中文语料
首先介绍一下word2vec 参考http://www.cnblogs.com/iloveai/p/word2vec.html 2013年,Google开源了一款用于词向量计算的工具--word2ve ...
Python Djang 搭建自动词性标注网站（基于Keras框架和维基百科中文预训练词向量Word2vec模型，分别实现由GRU、LSTM、RNN神经网络组成的词性标注模型）
引言本文基于Keras框架和维基百科中文预训练词向量Word2vec模型,分别实现由GRU.LSTM.RNN神经网络组成的词性标注模型,并且将模型封装,使用python Django web框架搭建 ...
Maple学习笔记——数学计算与数据处理
Maple学习笔记--数学计算与数据处理数据计算多项式相关: 求解方程.不等式矩阵计算.线性代数: 微积分多变量和向量微积分优化概率与统计数据处理导入数据数据计算多项式相关: 1. ...
【Unity学习笔记】[Unity中文课堂教程] C#中级编程代码
[Unity学习笔记][Unity中文课堂教程] C#中级编程代码最近想补一补C#基础,Unity官方的C#中级编程教程质量很高,于是开个帖子把跟着敲+记录了部分价讲解和我自己的理解的代码存在这原 ...
维基百科中文创始人_维基百科的创始人正在建立一个社区运营的新闻网站
维基百科中文创始人 Back in 2001, Jimmy Wales co-founded Wikipedia with the mission of "empowering and en ...
【相机标准】我的cameralink协议学习笔记（个人中文翻译，以及理解）
创作时间:2020-11-17 根据附件的原英文版cameralink协议,总结学习. 目录: 第一章简介第二章信号需求 .第三章端口分配第四章 bit分配第五章连接器附录A 芯片组标 ...
windows下使用word2vec训练维基百科中文语料全攻略！（三
全文共1552个字,7张图,预计阅读时间8分钟. 训练一个聊天机器人的很重要的一步是词向量训练,无论是生成式聊天机器人还是检索式聊天机器人,都需要将文字转化为词向量,时下最火的词向量训练模型是word ...
windows下使用word2vec训练维基百科中文语料全攻略！（二）
全文共454个字,3张图,预计阅读时间5分钟. 训练一个聊天机器人的很重要的一步是词向量训练,无论是生成式聊天机器人还是检索式聊天机器人,都需要将文字转化为词向量,时下最火的词向量训练模型是word2 ...
ElasticSearch学习笔记-ngram、中文拼音、简繁体搜索记录
ElasticSearch版本:elasticsearch-7.3.0 ElasticSearch相关插件安装可以参考: ElasticSearch学习笔记-插件安装记录_人生偌只如初见的博客-CSD ...

【学习笔记】维基百科中文数据处理（NLP）

【学习笔记】维基百科中文数据处理（NLP）相关推荐

最新文章

热门文章