seo与python大数据结合给文本分词并提取高频词

最近研究seo和python如何结合，参考网上的一些资料，写的这个程序。

目的：分析某个行业（例如：圆柱模板）用户最关心的一些词，根据需求去自动调整TDK,以及栏目，内容页的规划

使用方法：

1、下载安装cygwin：http://www.cygwin.com/
2、cygwin安装时别忘记安装curl，wget，iconv，lynx，dos2unix，Python等常用工具，特别是Python，这次主要就是用它了。
3、去下载jieba中文分词组件：
首选：https://github.com/fxsjy/jieba/archive/master.zip
备用：https://pypi.python.org/pypi/jieba/
4、安装jieba中文分词组件：
全自动安装： easy_install jieba 或者 pip install jieba / pip3 install jieba
半自动安装：先下载 https://pypi.python.org/pypi/jieba/ ，解压后运行 python setup.py install
手动安装：将 jieba 目录放置于当前目录或者 site-packages 目录
通过 import jieba 来引用
5、复制以下代码，另存为“jiebacmd.py”
6、新建一个文件夹，将你需要分词的文本和jiebacmd.py拷进去，记住文本需要另存为utf-8编码，然后在cygwin里用cd命令把工作目录切换进新建的文件夹，再输入以下命令：cat abc.txt|python jiebacmd.py|sort|uniq -c|sort -nr|head -100

　　代码：

#encoding=utf-8
#usage example (find top 100 words in abc.txt):
#用途：找出abc.txt文件中出现频率最高的前100个词
#复制以下命令到cygwin里运行，abc.txt是你文本的文件名，head -100可以自己改成想要提取的前多少个词
#cat abc.txt | python jiebacmd.py | sort | uniq -c | sort -nr -k1 | head -100
#以上都是注释，不影响程序运行
from __future__ import unicode_literals
import sys
sys.path.append("../")
reload(sys)
sys.setdefaultencoding( "utf-8" )
import jieba
default_encoding=‘utf-8‘
if len(sys.argv)>1:
    default_encoding = sys.argv[1]
while True:
    line = sys.stdin.readline()
    if line=="":
        break
    line = line.strip()
    for word in jieba.cut(line):
        print(word)

原文地址：https://www.cnblogs.com/68xi/p/9351408.html

时间： 2024-10-27 08:10:06

seo与python大数据结合给文本分词并提取高频词的相关文章

Spark2.x+Python大数据机器学习视频课程

Spark2.x+Python大数据机器学习视频课程下载地址:https://pan.baidu.com/s/1imjFFStyjbRqyMtnboPgpQ 提取码: 32pb 本课程系统讲解如何在Spark2.0上高效运用Python来处理数据并建立机器学习模型,帮助读者开发并部署高效可拓展的实时Spark解决方案. 第一章.搭建Spark 2.x+Python开发环境及基本开发入门 1.快速环境搭建:导入Windows7虚拟机至VMWARE及启动系统和远程桌面连接2.快速环境搭建:Windo

Python大数据与机器学习之NumPy初体验

本文是Python大数据与机器学习系列文章中的第6篇,将介绍学习Python大数据与机器学习所必须的NumPy库. 通过本文系列文章您将能够学到的知识如下: 应用Python进行大数据与机器学习应用Spark进行大数据分析实现机器学习算法学习使用NumPy库处理数值数据学习使用Pandas库进行数据分析学习使用Matplotlib库进行Python绘图学习使用Seaborn库进行统计绘图使用Plotly库进行动态可视化使用SciKit-learn处理机器学习任务 K-Means聚

《零起点Python大数据与量化交易》中文PDF+源代码

下载:https://pan.baidu.com/s/1JWmwMFHZV0mYAyAl-HkPyw 更多资料:http://blog.51cto.com/3215120 <零起点Python大数据与量化交易>中文PDF+源代码中文PDF,带目录和书签,655页,文字可以复制粘贴.配套源代码. 本书是国内关于Python大数据与量化交易的原创图书. 如图: 原文地址:http://blog.51cto.com/4820691/2311108

牛津王宁：大数据和量化金融—从机器交易高频交易到大数据交易

牛津王宁:大数据和量化金融—从机器交易高频交易到大数据交易很高兴来到这里,我是第二次参加这种会议了,我这次是以第二个身份来的,就是牛津大学NIE金融大数据实验室,代表实验室过来,今天主要分享一下我们实验室做的关于量化金融的思考跟案例. 首先简单介绍一下我们的大数据NIE实验室,是一个全新的实验室,是2013年11月正式成立的,开幕仪式是牛津大学的校长哈密尔顿先生,还有香港的FDK,就是香港金融数据技术有限公司的总裁镍反其(音)先生同时自主了我们这个实验室.我们实验室的定位是世界主要大学的第一

零基础入门到精通：Python大数据与机器学习之Pandas-数据操作

在这里还是要推荐下我自己建的Python开发学习群:483546416,群里都是学Python开发的,如果你正在学习Python ,小编欢迎你加入,大家都是软件开发党,不定期分享干货(只有Python软件开发相关的),包括我自己整理的一份2018最新的Python进阶资料和高级开发教程,欢迎进阶中和进想深入Python的小伙伴. 同时还要大数据学习群:784557197 实战练习在Jupyter Notebook上执行以下代码: import pandas as pd df = pd.Data

Spark2.x+Python大数据机器学习实战视频教程

提取码:6o68 课程学习:https://pan.baidu.com/s/13kOswCBRsnXBJWsPGBZDqQ 机器学习是近二十来年兴起的多领域学科,机器学习算法可从数据中建立模型,并利用模型对未知数据进行预测.机器学习技术不断进步,应用相当广泛,例如推荐引擎.定向广告.需求预测.垃圾邮件过滤.医学诊断.自然语言处理.搜索引擎.诈骗侦测.证券分析.视觉辨识.语音识别.手写识别等. 为什么近年来机器学习变得如此热门,各大公司都争相投入?因为机器学习需要大量数据进行训练.大数据的兴起带来

Python大数据：信用卡逾期分析

# -*- coding:utf-8 -*- # 数据集成 import csv import numpy as np import pandas as pd import matplotlib.pyplot as plt #客户信息 basicInfo = pd.DataFrame.from_csv('datas/basicInfo_train.csv', header=0, sep=',', index_col=0, parse_dates=True, encoding=None, tupl

飘逸的python - 大数据TopK问题的quick select解法

TopK问题,即寻找最大的K个数,这个问题非常常见,比如从1千万搜索记录中找出最热门的10个关键词. 方法一: 先排序,然后截取前k个数. 时间复杂度:O(n*logn)+O(k)=O(n*logn). 方法二: 最小堆. 维护容量为k的最小堆.根据最小堆性质,堆顶一定是最小的,如果小于堆顶,则直接pass,如果大于堆顶,则替换掉堆顶,并heapify整理堆,其中heapify的时间复杂度是logk. 时间复杂度:O(k+(n-k)*logk)=O(n*logk) 方法三: 本文的主角.quic

spark + ansj 对大数据量中文进行分词

????目前的分词器大部分都是单机服务器进行分词,或者使用hadoop mapreduce对存储在hdfs中大量的数据文本进行分词.由于mapreduce的速度较慢,相对spark来说代码书写较繁琐.本文使用spark + ansj对存储在hdfs中的中文文本数据进行分词. ????首先下载ansj源码文件,下载地址为https://github.com/NLPchina/ansj_seg,同时需要下载nlp-lang.jar包,下载地址上述网站中可以看到.由于spark传输数据必须进行序列化,