色哟哟视频在线观看-色哟哟视频在线-色哟哟欧美15最新在线-色哟哟免费在线观看-国产l精品国产亚洲区在线观看-国产l精品国产亚洲区久久

0
  • 聊天消息
  • 系統消息
  • 評論與回復
登錄后你可以
  • 下載海量資料
  • 學習在線課程
  • 觀看技術視頻
  • 寫文章/發帖/加入社區
會員中心
电子发烧友
开通电子发烧友VIP会员 尊享10大特权
海量资料免费下载
精品直播免费看
优质内容免费畅学
课程9折专享价
創作中心

完善資料讓更多小伙伴認識你,還能領取20積分哦,立即完善>

3天內不再提示

自然語言處理(NLP)知識結構總結

人工智能精選 ? 2018-08-29 09:58 ? 次閱讀

自然語言處理知識太龐大了,網上也都是一些零零散散的知識,比如單獨講某些模型,也沒有來龍去脈,學習起來較為困難,于是我自己總結了一份知識體系結構,不足之處,歡迎指正。內容來源主要參考黃志洪老師的自然語言處理課程。主要參考書為宗成慶老師的《統計自然語言處理》,雖然很多內容寫的不清楚,但好像中文NLP書籍就這一本全一些,如果想看好的英文資料,可以到我的GitHub上下載:

http://github.com/lovesoft5/ml

下面直接開始正文:

一、自然語言處理概述

1)自然語言處理:利用計算機為工具,對書面實行或者口頭形式進行各種各樣的處理和加工的技術,是研究人與人交際中以及人與計算機交際中的演員問題的一門學科,是人工智能的主要內容。
2)自然語言處理是研究語言能力和語言應用的模型,建立計算機(算法)框架來實現這樣的語言模型,并完善、評測、最終用于設計各種實用系統。
3)研究問題(主要):
信息檢索
機器翻譯
文檔分類
問答系統
信息過濾
自動文摘
信息抽取
文本挖掘
輿情分析
機器寫作
語音識別

研究模式:自然語言場景問題,數學算法,算法如何應用到解決這些問題,預料訓練,相關實際應用

自然語言的困難:

場景的困難:語言的多樣性、多變性、歧義性
學習的困難:艱難的數學模型(hmm,crf,EM,深度學習等)
語料的困難:什么的語料?語料的作用?如何獲取語料?

二、形式語言與自動機

語言:按照一定規律構成的句子或者字符串的有限或者無限的集合。

描述語言的三種途徑:

窮舉法
文法(產生式系統)描述
自動機

自然語言不是人為設計而是自然進化的,形式語言比如:運算符號、化學分子式、編程語言

形式語言理論朱啊喲研究的是內部結構模式這類語言的純粹的語法領域,從語言學而來,作為一種理解自然語言的句法規律,在計算機科學中,形式語言通常作為定義編程和語法結構的基礎

形式語言與自動機基礎知識:

集合論
圖論
自動機的應用:

1,單詞自動查錯糾正

2,詞性消歧(什么是詞性?什么的詞性標注?為什么需要標注?如何標注?)

形式語言的缺陷:

1、對于像漢語,英語這樣的大型自然語言系統,難以構造精確的文法

2、不符合人類學習語言的習慣

3、有些句子語法正確,但在語義上卻不可能,形式語言無法排出這些句子

4、解決方向:基于大量語料,采用統計學手段建立模型

三、語言模型

1)語言模型(重要):通過語料計算某個句子出現的概率(概率表示),常用的有2-元模型,3-元模型
2)語言模型應用:

語音識別歧義消除例如,給定拼音串:ta shi yan yan jiu saun fa de

可能的漢字串:踏實煙酒算法的 他是研究酸法的 他是研究算法的,顯然,最后一句才符合。

3)語言模型的啟示:

1、開啟自然語言處理的統計方法

2、統計方法的一般步驟:

收集大量語料
對語料進行統計分析,得出知識
針對場景建立算法模型
解釋和應用結果

4) 語言模型性能評價,包括評價目標,評價的難點,常用指標(交叉熵,困惑度)

5)數據平滑:

數據平滑的概念,為什么需要平滑

平滑的方法,加一法,加法平滑法,古德-圖靈法,J-M法,Katz平滑法

6)語言模型的缺陷:

語料來自不同的領域,而語言模型對文本類型、主題等十分敏感

n與相鄰的n-1個詞相關,假設不是很成立。


四、概率圖模型,生成模型與判別模型,貝葉斯網絡,馬爾科夫鏈與隱馬爾科夫模型(HMM)

1)概率圖模型概述(什么的概率圖模型,參考清華大學教材《概率圖模型》)

2)馬爾科夫過程(定義,理解)

3)隱馬爾科夫過程(定義,理解)

HMM的三個基本問題(定義,解法,應用)

注:第一個問題,涉及最大似然估計法,第二個問題涉及EM算法,第三個問題涉及維特比算法,內容很多,要重點理解,(參考書李航《統計學習方法》,網上博客,筆者github)

五、馬爾科夫網,最大熵模型,條件隨機場(CRF)

1)HMM的三個基本問題的參數估計與計算

2)什么是熵

3)EM算法(應用十分廣泛,好好理解)
4)HMM的應用
5)層次化馬爾科夫模型與馬爾科夫網絡

提出原因,HMM存在兩個問題
6)最大熵馬爾科夫模型
優點:與HMM相比,允許使用特征刻畫觀察序列,訓練高效
缺點: 存在標記偏置問題

7)條件隨機場及其應用(概念,模型過程,與HMM關系)
參數估計方法(GIS算法,改進IIS算法)

CRF基本問題:特征選取(特征模板)、概率計算、參數訓練、解碼(維特比)

應用場景:

詞性標注類問題(現在一般用RNN+CRF)
中文分詞(發展過程,經典算法,了解開源工具jieba分詞)
中文人名,地名識別

8) CRF++

六、命名實體 識別,詞性標注,內容挖掘、語義分析與篇章分析(大量用到前面的算法)

1)命名實體識別問題

相關概率,定義

相關任務類型

方法(基于規程->基于大規模語料庫)

2)未登錄詞的解決方法(搜索引擎,基于語料)

3)CRF解決命名實體識別(NER)流程總結:

訓練階段:確定特征模板,不同場景(人名,地名等)所使用的特征模板不同,對現有語料進行分詞,在分詞結 果基礎上進行詞性標注(可能手工),NER對應的標注問題是基于詞的,然后訓練CRF模型,得到對應權值參數值

識別過程:將待識別文檔分詞,然后送入CRF模型進行識別計算(維特比算法),得到標注序列,然后根據標 注劃分出命名實體

4)詞性標注(理解含義,意義)及其一致性檢查方法(位置屬性向量,詞性標注序列向量,聚類或者分類算法)


七、句法分析

1)句法分析理解以及意義

1、句法結構分析
完全句法分析

淺層分析(這里有很多方法。。。)
2、 依存關系分析

2)句法分析方法

1、基于規則的句法結構分析
2、基于統計的語法結構分析

八、文本分類,情感分析

1)文本分類,文本排重

文本分類:在預定義的分類體系下,根據文本的特征,將給定的文本與一個或者多個類別相關聯

典型應用:垃圾郵件判定,網頁自動分類

2)文本表示,特征選取與權重計算,詞向量

文本特征選擇常用方法:

1、基于本文頻率的特征提取法
2、信息增量法
3、X2(卡方)統計量
4、互信息法

3)分類器設計

SVM,貝葉斯,決策樹等
4)分類器性能評測

1、召回率
2、正確率
3、F1值

5)主題模型(LDA)與PLSA

LDA模型十分強大,基于貝葉斯改進了PLSA,可以提取出本章的主題詞和關鍵詞,建模過程復雜,難以理解。

6)情感分析

借助計算機幫助用戶快速獲取,整理和分析相關評論信息,對帶有感情色彩的主觀文本進行分析,處理和歸納例如,評論自動分析,水軍識別。

某種意義上看,情感分析也是一種特殊的分類問題
7)應用案例


九、信息檢索,搜索引擎及其原理

1)信息檢索起源于圖書館資料查詢檢索,引入計算機技術后,從單純的文本查詢擴展到包含圖片,音視頻等多媒體信息檢索,檢索對象由數據庫擴展到互聯網。

1、點對點檢索

2、精確匹配模型與相關匹配模型

3、檢索系統關鍵技術:標引,相關度計算

2)常見模型:布爾模型,向量空間模型,概率模型

3)常用技術:倒排索引,隱語義分析(LDA等)

4)評測指標

十、自動文摘與信息抽取,機器翻譯,問答系統

1)統計機器翻譯的的思路,過程,難點,以及解決

2)問答系統

基本組成:問題分析,信息檢索,答案抽取

類型:基于問題-答案, 基于自由文本

典型的解決思路

3)自動文摘的意義,常用方法

4)信息抽取模型(LDA等)

十一、深度學習在自然語言中的應用

1)單詞表示,比如詞向量的訓練(wordvoc)
2)自動寫文本
寫新聞等
3)機器翻譯
4)基于CNN、RNN的文本分類

5)深度學習與CRF結合用于詞性標注

...............
聲明:本文內容及配圖由入駐作者撰寫或者入駐合作網站授權轉載。文章觀點僅代表作者本人,不代表電子發燒友網立場。文章及其配圖僅供工程師學習之用,如有內容侵權或者其他違規問題,請聯系本站處理。 舉報投訴
  • 人工智能
    +關注

    關注

    1804

    文章

    48783

    瀏覽量

    246852
  • 自然語言處理

    關注

    1

    文章

    628

    瀏覽量

    14038
  • nlp
    nlp
    +關注

    關注

    1

    文章

    490

    瀏覽量

    22504
收藏 2人收藏
  • 大饼则卷1
  • undefined_c1a1

評論

相關推薦
熱點推薦

python自然語言

最近,python自然語言是越來越火了,那么什么是自然語言自然語言(Natural Language )廣納了眾多技術,對自然或人類語言
發表于 05-02 13:50

【推薦體驗】騰訊云自然語言處理

結構化抽取,有效輔助人工,降低人力參與成本。因為現在騰訊云自然語言處理產品公測免費,所以我注冊了騰訊云賬號去專門體驗了一下,最直觀的感受就是確實如產品介紹中說的:開箱即用的NLP能力,
發表于 10-09 15:28

自然語言處理——總結、習題

自然語言處理——79 總結、習題
發表于 06-19 11:22

什么是自然語言處理

什么是自然語言處理自然語言處理任務有哪些?自然語言處理的方法是什么?
發表于 09-08 06:51

淺析自然語言處理知識體系結構

自然語言處理知識太龐大了,網上也都是一些零零散散的知識,比如單獨講某些模型,也沒有來龍去脈,學習起來較為困難,于是總結了一份
的頭像 發表于 08-18 09:57 ?5537次閱讀

自然語言處理NLP)的學習方向

自然語言處理(Natural Language Processing,NLP)是計算機科學領域與人工智能領域中的一個重要方向。它研究人與計算機之間用自然語言進行有效通信的理論和方法。融
的頭像 發表于 07-06 16:30 ?1.3w次閱讀

自然語言處理和人工智能的概念及發展史 自然語言處理和人工智能的區別

自然語言處理(Natural Language Processing, NLP)的定義是通過電腦軟件程序實現人們日常語言的機器自動處理。為了
發表于 08-23 18:22 ?1375次閱讀

自然語言處理技術的原理的應用

自然語言處理(Natural Language Processing, NLP)作為人工智能(AI)領域的一個重要分支,旨在使計算機能夠理解和處理人類
的頭像 發表于 07-02 12:50 ?1225次閱讀

什么是自然語言處理 (NLP)

自然語言處理(Natural Language Processing, NLP)是人工智能領域中的一個重要分支,它專注于構建能夠理解和生成人類語言的計算機系統。
的頭像 發表于 07-02 18:16 ?1851次閱讀

自然語言處理包括哪些內容

自然語言處理(Natural Language Processing,簡稱NLP)是人工智能領域的一個重要分支,它涉及到計算機與人類語言之間的交互。
的頭像 發表于 07-03 14:15 ?1737次閱讀

nlp自然語言處理的應用有哪些

自然語言處理(Natural Language Processing,簡稱NLP)是人工智能領域的一個分支,它致力于使計算機能夠理解和生成自然語言。隨著技術的發展,
的頭像 發表于 07-05 09:55 ?3535次閱讀

nlp自然語言處理框架有哪些

自然語言處理(Natural Language Processing,簡稱NLP)是計算機科學和人工智能領域的一個重要分支,它致力于使計算機能夠理解和處理人類
的頭像 發表于 07-09 10:28 ?958次閱讀

nlp自然語言處理基本概念及關鍵技術

自然語言處理(Natural Language Processing,簡稱NLP)是人工智能領域的一個重要分支,它致力于使計算機能夠理解、解釋和生成人類語言
的頭像 發表于 07-09 10:32 ?1245次閱讀

ASR與自然語言處理的結合

ASR(Automatic Speech Recognition,自動語音識別)與自然語言處理NLP)是人工智能領域的兩個重要分支,它們在許多應用中緊密結合,共同構成了自然語言理解和
的頭像 發表于 11-18 15:19 ?936次閱讀

自然語言處理與機器學習的關系 自然語言處理的基本概念及步驟

Learning,簡稱ML)是人工智能的一個核心領域,它使計算機能夠從數據中學習并做出預測或決策。自然語言處理與機器學習之間有著密切的關系,因為機器學習提供了一種強大的工具,用于從大量文本數據中提取模式和知識,從而提高
的頭像 發表于 12-05 15:21 ?1810次閱讀
主站蜘蛛池模板: 欧美顶级情欲片免费看 | 精品一区二区三区高清免费观看 | 日韩亚洲欧美中文高清在线 | 国产色情短视频在线网站 | 日韩a在线看免费观看视频 日韩a视频在线观看 | 成人午夜精品无码区久久漫画日本 | 欧美男男网站免费观看videos | 亚洲精品久久区二区三区蜜桃臀 | 亚洲中字幕永久在线观看 | 日本午夜福利无码高清 | 日日摸夜夜添夜夜爽出水 | 欧美亚洲另类丝袜自拍动漫 | 国产无遮挡又黄又爽在线视频 | 国产性夜夜春夜夜爽1A片 | 午夜婷婷一夜七次郎 | 美女张开腿让男人桶爽无弹窗 | 国自精品三七区 | 久久人人玩人妻潮喷内射人人 | 久久黄色免费网站 | 手机国产视频福利 | 广播电台在线收听 | 麻生希快播在线 | 色欲天天婬色婬香影院 | 边摸边吃奶边做带声音 | 美女的隐私蜜桃传媒免费看 | 国产精品系列在线一区 | 99re28久久热在线观看 | 手机看片一区二区 | 韩日美无码精品无码 | 性白俄罗斯高清xxxxx | 色欲AV亚洲午夜精品无码 | 久久WWW免费人成一看片 | 床伴在线观看免费高清完整泰剧第四集 | 精品无码日本蜜桃麻豆 | 娇妻被朋友玩得呻吟在线电影 | 老师的脚奴 | 韩国伦理片2018在线播放免费观看 | 久久r视频 | 成人精品在线视频 | 无人区大片中文字幕在线 | 鸥美一级黄色片 |

電子發燒友

中國電子工程師最喜歡的網站

  • 2931785位工程師會員交流學習
  • 獲取您個性化的科技前沿技術信息
  • 參加活動獲取豐厚的禮品