新闻采集器是将非结构化的新闻文章从多个新闻来源网页中抽取出来保存到结构化的数据库中的软件。 主要功能 根据用户自定义的任务配置,批量而精确地抽取目标网络媒体栏目中的新闻或文章,转化为为结构化的记录(标题,作者,内容,采集时间,来源,分类,相关图片等),保存在本地数据库中,用于内部使用或外网发布,快速实现外部信息的获取。 主要技术 新闻采集器核心技术是模式定义和模式匹配。模式属于人工智能的术语,意思为物体前人积累的经验的抽象和升华。简单地说,就是从不断重复出现的事件中发现和抽象出的规律,是解决问题...