当前位置: 首页 > news >正文

直接进入网站的代码网站建设是要考虑什么东西

直接进入网站的代码,网站建设是要考虑什么东西,宁波百度seo代理,用腾讯云服务器做网站目录 1.语料库 2.语料库建设 #xff08;1#xff09;规范制定 #xff08;2#xff09;人员培训 #xff08;3#xff09;人工标注 3.中文处理中的常见语料库 #xff08;1#xff09;中文分词语料库 #xff08;2#xff09;词性标注语料库 #xff08;3…目录 1.语料库 2.语料库建设 1规范制定 2人员培训  3人工标注 3.中文处理中的常见语料库 1中文分词语料库 2词性标注语料库 3命名实体识别语料库 4句法分析语料库 5文本分类语料库 4.NLP开源工具 1.语料库 语料库就是自然语音处理中的数据集。 2.语料库建设 语料库建设指的是构建一份语料库的过程分为规范制定、人员培训与人工标注这 3个阶段。 1规范制定 指的是由语言学专家分析并制定一套标注规范这份规范包括标注集定义、样例和实施方法。 在中文分词和词性标注领域比较著名的规范有 - 北京大学计算语言学研究所发布的《现代汉语语料库加工规范-——词语切分与词性标注》 - 中国国家标准化管理委员会发布的《信息处理用现代汉语词类标记规范》 2人员培训  指的是对标注员的培训由于人力资源的限制制定规范与执行规范的未必是同一批人。大型语料库往往需要多人协同标注 这些标注员对规范的理解必须达到一致否则会导致标注员内部冲突影响语料库的质量 3人工标注 针对不同类型的任务人们开发出许多标注软件其中比较成熟的一款是 brat ( brat rapidannotation tool )它支持词性标注、命名实体识别和句法分析等任务brat是典型的B/S架构服务端用Python编写客户端运行于浏览器相较于其他标注软件brat最大的亮点是多人协同标注功能此外拖曳式的操作体验也为brat增色不少。 3.中文处理中的常见语料库 1中文分词语料库 由人工正确切分后的句子集合。以著名的“ 1998年《人民日报》语料库 ”为例该语料库由北京大学计算语言学研究所联合富士通研究开发中心有限公司在人民日报社新闻信息中心的许可下从 1999 年4月起到 2002 年 4 月底共同标注完成语料规模达到2600万汉字。 先  有  通货膨胀  干扰后  有  通货  紧缩  叫板。 2词性标注语料库 它指的是切分并为每个词语指定一个词性的语料。依然以《人民日报》语料库为例“ 1998年的《人民日报》”一共含有 43 种词性这个集合称作“ 词性标注集 ” 迈向/v 充满/v 希望/n 的/u 新/a 世纪/n ——/w 一九九八年/t 新年/t 讲话/n 3命名实体识别语料库 这种语料库人工标注了文本内部制作者关心的“ 实体名词 ”以及“ 实体类别 ”。比如《人民日报》语料库中一共含有人名、地名和机构名3种命名实体。这个句子中的加粗词语分别是“ 人名 ”、“ 地名 ”和“ 机构名 ”中括号括起来的是“ 复合词 ”我们可以观察到 有时候机构名和地名复合起来会构成更长的机构名这种构词法上的嵌套现象增加了命名实体识别的难度 萨哈夫/nr 说/v ,/w 伊拉克/ns 将/d 同/p [联合国/nt 销毁/v 伊拉克/ns 大规模/b 杀伤性/n 武器/n 特别/a 委员会/n] /nt 继续/v 保持/v 合作/v 。/w 4句法分析语料库 汉语中常用的句法分析语料库有 CTB Chinese Treebank中文树库 这份语料库的建设工作始于1998年历经宾夕法尼亚大学、科罗拉多大学和布兰迪斯大学的贡献一直在发布多个改进版本。以 CTB 8.0 版为例一共含有来自新闻、广播和互联网的3007篇文章共计 71369 个句子、1620 561 个单词和 2589848 个字符每个句子都经过了分词、词性标注和句法标注其中一个句子可视化后如图1-6所示。 中文单词上面的英文标签表示“ 词性 ”而箭头表示“ 有语法联系 ”的两个单词具体是何种联系由箭头上的标签表示。 5文本分类语料库 它指的是人工标注了“ 所属分类 ”的文章构成的语料库。相较于上面介绍的 4 种语料库文本分类语料库的数据量明显要大很多。 eg以著名的搜狗文本分类语料库为例 一共包含汽车、财经、IT、健康、体育、旅游、教育、招聘、文化、军事 10 个类别每个类别下含有8000篇新闻。 另外一些新闻网站上的栏目经过了编辑的手工整理相互之间的区分度较高也可作为文本分类语料库使用。 “ 情感分类语料库 ”则是文本分类语料库的一个子集无非是类别限定为“ 正面 ”“ 负面 ”等而已。 notes 如果这些语料库中的类目、规模不满足实际需求我们还可以按需自行标注 标注的过程实际上就是把许多文档整理后放到不同的文件夹中 4.NLP开源工具 目前开源界贡献了许多优秀的NLP工具它们为我们提供了多种选择。下边介绍最为主流的几种。比如教学常用的NLTK ( Natural Language Toolkit )、斯坦福大学开发的CoreNLP以及国内哈工大开发的 LTP ( Language Technology Platform )、何晗开发的HanLP ( Han Language Processing )下面是上述工具的比较。 我们将使用hanlp进行学习具体安装使用会记录在下一笔记。
http://www.pierceye.com/news/88829/

相关文章:

  • 网站建设续费合同广州建设工程交易中心怎么样
  • 凡科建站如何制作论坛西双版纳住房和城乡建设局网站
  • 西安网站设设哈尔滨做网站哪里好
  • 百度联盟网站怎么做app软件商店
  • 西安网站制作公司排名什么网站可以做宣传
  • 怎么在360做网站建设网站个人网上银行
  • 教育网站制作多少费用河北seo技术培训
  • 佛山市品牌网站建设哪家好wordpress本地路径
  • 网站设计能出来什么wordpress 商城 插件
  • 东营建设局网站企业邮箱地址怎么填
  • 中国建设银行官网站e路护航下载宝塔搭建wordpress
  • 网站变量网站后台系统
  • 建立企业网站的目的和意义合肥网站开发招聘
  • 农八师建设兵团社保网站深圳包装设计招聘
  • 做微商做什么网站比较好广州服装设计公司排行
  • 个人可以做导航网站吗网站友情链接 关键词经常改动
  • 慈溪专业做网站公司开发小程序需要的技术
  • 国外网站的设计风格企业网站建立之前必须首先确定
  • 宣武成都网站建设0基础做网站多久
  • 360免费视频网站建设微信小程序用什么开发
  • 网站无后台可以上框架电商网站设计平台
  • 动态asp.net网站开发制作人
  • 网站模板建设报价单网站前端工程师
  • 整站优化和关键词优化的区别咖啡色网站模板
  • 烟台网站推广优化视觉营销网站
  • 课程平台网站建设报价黎平网站建设
  • 国外响应式网站模板vs网站模态框怎么做
  • 哪些网站是php做的天津企业网站建设公司
  • 有经验的唐山网站建设张家港手机网站
  • 上海营销网站建设公司百度指数怎么看