![Python自然语言处理(微课版)](https://wfqqreader-1252317822.image.myqcloud.com/cover/869/44509869/b_44509869.jpg)
上QQ阅读APP看书,第一时间看更新
1.5.5 搜狗新闻语料库
搜狗新闻语料库,下载地址为http://www.sogou.com/labs/resource/cs.php,如图1-14所示。
搜狐新闻数据(SogouCS)请直接下载精简版,文件为SogouCS.reduced.tar.gz,解压到d:\SogouCS.reduced,共有128个文本文件,如图1-15所示。
每一个txt文件采用ANSI编码,内容是XML格式化,如图1-16所示。
将每个txt文件根据url、contenttitle、content进行拆分,具体含义如下。
· url:获取内容类别。
· contenttitle:获取内容标题,作为txt的文档名。
· content:正文内容。
![](https://epubservercos.yuewen.com/CC79B0/23721531409454406/epubprivate/OEBPS/Images/Figure-P31_2511.jpg?sign=1739592701-CyjRDaPIqNLR407PveBxXKPkK6oQM2dI-0-6a68611290c58a7db5426aedaf3c3774)
图1-14 搜狗新闻语料库网页
![](https://epubservercos.yuewen.com/CC79B0/23721531409454406/epubprivate/OEBPS/Images/Figure-P31_2514.jpg?sign=1739592701-deypZYy4nMBs5A0aFWmppyTWvXq1s1c7-0-a1937e336712bd5843e1ae2fd6dee63b)
图1-15 下载搜狗新闻语料库
![](https://epubservercos.yuewen.com/CC79B0/23721531409454406/epubprivate/OEBPS/Images/Figure-P32_2519.jpg?sign=1739592701-aADu7ipW7NYNOO3F1qehhzpGf89mxMMv-0-6a0d49a940402820eaadc64a8988eb6a)
图1-16 文件内容
代码如下。
![](https://epubservercos.yuewen.com/CC79B0/23721531409454406/epubprivate/OEBPS/Images/Figure-P32_2522.jpg?sign=1739592701-aYryCErN4vOzSUdwvhhF2hcm1GcK3yrK-0-0ac5105c7b738a524d6a29692c0c0129)
最终数据集整理为15个类别,如图1-17所示。
![](https://epubservercos.yuewen.com/CC79B0/23721531409454406/epubprivate/OEBPS/Images/Figure-P33_2527.jpg?sign=1739592701-ctwemznSnJKcOjkhEZOw4GeQMM90xaUL-0-65913495998f8d04fc49abc3fbd7f903)
图1-17 语料集分类