一种任意尺度的话题脉络实时生成方法及系统

    公开(公告)号:CN112307278A

    公开(公告)日:2021-02-02

    申请号:CN202011154213.1

    申请日:2020-10-26

    Abstract: 本发明提出一种任意尺度的话题脉络实时生成方法及系统,包括:获取话题历史数据,该话题历史数据包括指定时间范围内预设时间单位的子话题及各子话题所包含的文档;以子话题作为节点,根据该指定时间范围内子话题间的相关性,建立节点间的连边,得到该话题历史数据的图数据;通过动态规划得到该指定时间范围内预设时间单位中各节点的路径权值最大的前k条路径,从所有的出度为0的各节点的该前k条路径中选出权值最大的前k条路径作为该话题历史数据的话题脉络,其中k为正整数。

    一种非等值关联子查询的优化方法和系统

    公开(公告)号:CN108874849B

    公开(公告)日:2020-12-25

    申请号:CN201810097136.7

    申请日:2018-01-31

    Abstract: 本发明公开了一种非等值关联子查询的优化方法和系统,其特征在于,包括:获取关联子查询的外表关联列的取值集;根据该关联子查询中操作符的类型和该取值集,建立该关联子查询的外表关联列到内表关联列分区的映射关系;根据得到的分区集合,对该关联子查询的内表进行分区,同时依据该关联子查询中内表的查询聚合函数,获取关联子查询在各分区的中间结果状态信息;根据该映射关系,遍历该外表关联列,通过聚合对应的分区集的中间结果状态信息,得到外表中各关联列对应的子查询结果。本发明具有的技术效果包括:通过对内表进行分区,并重复利用各分区的中间结果从而得到最终的子查询结果集,以提升查询性能。

    一种基于类别稠密向量表示的通用文本分类方法及系统

    公开(公告)号:CN111259658A

    公开(公告)日:2020-06-09

    申请号:CN202010080710.5

    申请日:2020-02-05

    Abstract: 本发明提出一种基于类别稠密向量表示的通用文本分类方法及系统,包括:获取包括以标记类别文本的训练数据,使用全连接网络处理该训练数据,得到各类别的类别稠密向量;将待分类文本输入至深度神经网络,得到该待分类文本中每个词的词稠密向量,并集合该词稠密向量得到该待分类文本的文本稠密向量;将该文本稠密向量和该类别稠密向量输入至匹配度测量模型,得到该待分类文本属于各类别的概率分布,将该待分类文本与该概率分布中概率最大的类别相匹配,作为该待分类文本的分类结果。本发明基于类别稠密向量表示,将文本分类问题转化为文本匹配问题,通过计算输入文本与每个类别之间的匹配程度,将文本分到匹配程度最大的类别之中。

    一种基于表示向量的作品标签推荐方法和系统

    公开(公告)号:CN107391577B

    公开(公告)日:2020-04-03

    申请号:CN201710469315.4

    申请日:2017-06-20

    Abstract: 本发明涉及一种基于表示向量的标签推荐方法和系统,其特征在于,包括:获取多个作品,根据每个作品对应的标签、关系及对象,构建多个包含作品和标签的二元组信息和包含作品、关系及对象的三元组信息,根据二元组信息和三元组信息生成训练数据集;通过对训练数据集进行表示学习,分别得到各个作品的作品表示向量和各类标签的标签表示向量;通过计算各个作品表示向量和各类标签表示向量之间的距离,从各类标签中筛选出各个作品的推荐标签。本发明在学习表示向量的过程中,本发明同时考虑作品标签对二元组信息和作品的三元组信息。通过融入更多信息,使得学到的表示向量能够更准确地反映作品和标签的语义,从而更好地支持标签推荐这一任务。

    一种基于中间人的互联网数据采集方法及系统

    公开(公告)号:CN110781367A

    公开(公告)日:2020-02-11

    申请号:CN201910909270.7

    申请日:2019-09-25

    Abstract: 本发明提出一种基于中间人的互联网数据采集方法及系统,包括:通过安装中间人代理证书至网页信息采集设备,建立网页信息采集设备的中间人,网页信息采集设备访问互联网中网页信息时,中间人代理网页信息采集设备的全部网络流量;中间人获取包含待采集网页URL正则表达式的采集任务,捕获全部网络流量中符合URL正则表达式的流量,作为中间流量,并将采集任务注入中间流量的HTML页面中,得到待解析页面并将其存入第一数据库;解析模块根据第一数据库中待解析页面的URL信息,将待解析页面分发给解析器实例进行解析,从中获取包含结构化数据的网页采集结果并将其存入第二数据库。本发明能够支持所有依靠集成浏览器内核功能来提供信息的应用的数据采集。

    基于事件因果关系抽取的网络苗头事件检测方法及系统

    公开(公告)号:CN110705597A

    公开(公告)日:2020-01-17

    申请号:CN201910833900.7

    申请日:2019-09-04

    Abstract: 本发明提出一种基于事件因果关系抽取的网络苗头事件检测方法及系统,包括:将苗头因果事件对中原因事件作为苗头事件,存入苗头事件样本库,以苗头事件样本库的数据作为训练集,训练基于机器学习的第一苗头事件分类器,并将苗头因果事件对的因果联系作为苗头事件判定规则,存入苗头事件判定规则库,以苗头事件判定规则库构建基于规则的第二苗头事件分类器;对指定的网络平台进行事件抽取,得到多个结构化事件,并将多个结构化事件中指代同一个事件的结构化事件统一为一个共指事件,并对共指事件进行泛化,得到网络平台的抽象事件,使用第一苗头事件分类器和第二苗头事件分类器分别处理抽象事件,综合两者的结果作为网络平台苗头事件的检测结果。

    一种基于Kubernetes的脚本解释型服务代理方法和系统

    公开(公告)号:CN110557428A

    公开(公告)日:2019-12-10

    申请号:CN201910646748.1

    申请日:2019-07-17

    Abstract: 本发明涉及一种基于Kubernetes的脚本解释型服务代理方法和系统,该方法包括:设置一客户端,用于生成代理脚本并作为服务请求;设置一Kubernetes系统,并在该Kubernetes系统中部署若干服务;设置一服务执行单元,用于处理该服务请求,并返回处理结果至该客户端;该方法包括:函数绑定步骤,该服务执行单元根据一预设协议,定期查询API SERVER,获取该Kubernetes系统中的服务,并为每一服务绑定一函数名称;服务调用步骤,该服务执行单元接收并解析执行该客户端发送的该服务请求中的代理脚本,并在执行脚本的过程中,依据函数名调用Kubernetes中的服务。本发明有效解决了复杂服务以及远程和不可靠环境下的访问问题。

    基于微内核操作系统的分布式流式数据处理方法及系统

    公开(公告)号:CN110532072A

    公开(公告)日:2019-12-03

    申请号:CN201910672072.3

    申请日:2019-07-24

    Abstract: 本发明提出一种基于微内核操作系统的分布式流式数据处理方法及系统,包括:获取包含用户定义函数的作业代码,并以该用户定义函数作为节点将该作业代码转换为有向无环图,并根据该有向无环图中算子之间的关联度,将该有向无环图中算子进行合并,得到任务逻辑视图;根据分布式微内核操作系统的物理执行环境,将该任务逻辑视图转换为执行图,该分布式微内核操作系统中工作节点收到该执行图,并将该执行图内的作业任务与作业调度分配至空闲CPU内核执行。与现有技术相比,本发明具有端到端处理延迟低,且吞吐量高,系统镜像体积小,启动时间短的技术进步。

Patent Agency Ranking