值得大家信赖的软件下载站!
GeneralNewsExtractor(新闻网页正文通用抽取器)v0.2.6官方版

GeneralNewsExtractor(新闻网页正文通用抽取器)v0.2.6官方版

  • 大小:15KB语言:简体中文授权:免费版
  • 更新日期:2021-05-08 09:34:42
  • 平台:WinXP,Vista,Win7,Win8,WinALL

高速下载

高速下载器,提速50%

本地下载

  GeneralNewsExtractor(新闻网页正文通用抽取器)是一个基于《基于文本及符号密度的网页正文提取方法》论文用Python实现的正文抽取器,可以用来提取 HTML 中正文的内容、作者、标题。

GeneralNewsExtractor(新闻网页正文通用抽取器)

开发介绍

  项目起源

  开发这个项目,源自于我在知网发现了一篇关于自动化抽取新闻类网站正文的算法论文――《基于文本及符号密度的网页正文提取方法》)

  这篇论文中描述的算法看起来简洁清晰,并且符合逻辑。但由于论文中只讲了算法原理,并没有具体的语言实现,所以我使用 Python 根据论文实现了这个抽取器。并分别使用今日头条、网易新闻、游民星空、观察者网、凤凰网、腾讯新闻、ReadHub、新浪新闻做了测试,发现提取效果非常出色,几乎能够达到100%的准确率。

  项目现状

  在论文中描述的正文提取基础上,我增加了标题、发布时间和文章作者的自动化探测与提取功能。

  目前这个项目是一个非常非常早期的 Demo,发布出来是希望能够尽快得到大家的使用反馈,从而能够更好地有针对性地进行开发。

  本项目取名为抽取器,而不是爬虫,是为了规避不必要的风险,因此,本项目的输入是 HTML,输出是一个字典。请自行使用恰当的方法获取目标网站的 HTML。

  本项目现在不会,将来也不会提供主动请求网站 HTML 的功能。

软件截图
  • 下载地址
人类寿命科学计算器(寿命计算器)V1.1 最新版
网友评论
网名
(您的评论需要经过审核才能显示)
发布评论
1楼 网友 21-05-01 08:17:41

安装完的朋友能不能说一下GeneralNewsExtractor(新闻网页正文通用抽取器)能不能选择安装路径呢。

2楼 网友 21-04-05 23:21:03

感觉还不错,GeneralNewsExtractor(新闻网页正文通用抽取器)2.0.1比上个版本要好的多

3楼 网友 21-03-12 01:42:45

问下大家这个GeneralNewsExtractor(新闻网页正文通用抽取器)是否是官方提供的最新的35.0.7 官方版吗?

4楼 网友 21-02-02 02:05:22

说不能安装的人,上辈子都是折翼的屎壳郎

5楼 网友 20-11-25 16:08:36

赞~!楼主大好人

6楼 网友 20-10-18 07:51:28

有点卡,很一般,没有什么特别的

7楼 网友 20-09-18 22:41:22

下载GeneralNewsExtractor(新闻网页正文通用抽取器)中,希望可以正常使用,别遇到BUG就好了

8楼 网友 20-08-27 01:00:33

怎么下载GeneralNewsExtractor(新闻网页正文通用抽取器)啊?是高速下载吗?是一款国产软件很想试试啊

9楼 网友 20-08-11 10:23:36

GeneralNewsExtractor(新闻网页正文通用抽取器)7.1.0下载好慢,不知道是不是我网速问题,继续等待……

10楼 网友 20-06-28 17:36:50

安卓手机可以查吗