- learn简称是个流行的机器学习库, 可供丰富工具及算法, 用以数据挖掘与数据分析。它基于NumPy、SciPy等科学计算库构建, 还为用户供给简洁且强大的API, 让机器学习任务变得更简单高效。内里封装了好些种机器学习算法以及数据处理算法, 给出了涵盖数据清洗、数据预处理、建模调参、数据验证、数据可视化的全流程功能, 是迈入机器学习领域的必备工具。一、安装库库能够经由 pip 命令或 conda 命令去简单地进行安装即可, 然而需要留意的是, 所要安装的名称是- learn:# 使用 conda 安装 conda install scikit-learn # 使用 pip 安装 pip install scikit-learn二、安装库下面再介绍库它是一个开源的数据分析库, 能提供高性能且易于使用的数据结构, 还有数据分析工具, 使得数据处理以及分析变得更简单且高效, 它建立在NumPy库的基础之上, 并且提供了一种称作的数据结构, 用以处理以及操作结构化数据。#使用 conda 安装 conda install pandas能够运用conda list命令去查看安装完毕的库列表, 像图里所呈现那般:三、示例代码这段话里的代码, 运用-learn库当中的类予以文本特征提取, 同样还引入了numpy和库。from sklearn.feature_extraction.text import TfidfVectorizer import numpy as np import pandas as pd是存在于-learn库里头的一个用于文本的特征提取器, 它的用途是把文本数据转变为数值特征向量。其基于TF-IDFTerm -这一概念, 该概念是用来衡量一个词于文档里的重要意义。首先定义了一个名为的列表其中包含了三个文本样本。toy_corpus [the fat cat sat on the mat, the big cat slept, the dog chased a cat]接着, 创立了这么一个对象, 把这个对象赋予给了变量。该对象是用作去计算TF-IDF词项 -特征的一个工具, 它能够把文本转变为向量表示。TF-IDF是文本特征表示常用方法, 它把词频TF与逆文档频率IDF概念相结合。词频TF指词于文档中出现频率, 逆文档频率IDF指词于整个文档集合里的重要性。进而TF-IDF将二者相乘以得出词的TF-IDF值, 此值用来表示词于文档里的重要程度。(True)接下来, 被调用的那个方法, 会作为参数传进去, 用来计算文本的TF-IDF特征。这个方法会返回一个稀疏矩阵, 但这个稀疏矩阵里边存储的是文本样本的TF-IDF特征值。.()运用len函数, 取得了已获取属性中的键的数目, 此数目也就是词汇表对应的大小, 随后将该-size也就是此数-字行向外部表现设备进行呈现出来。与此同时, 运用所用到的shape属性去获取文档 - 词项矩阵的形状情况, 随后把该形状情况打印出来。print(fThe vocabulary size is {len(vectorizer.vocabulary_.keys())} ) print(vectorizer.vocabulary_) print(fThe document-term matrix shape is {corpus_tfidf.shape}) print(corpus_tfidf)输出结果最终, 借由np.round函数把它转变为一个对象df, 接着运用其t方法去获取特征名, 随后把该特征名设置成其列名。dfpd.DataFrame(np.round(corpus_tfidf.toarray(),2)) df.columnsvectorizer.get_feature_names_out() df输出结果有一个被用于数据分析以及处理的库, 它给出了一种高效的数据结构, 叫做。是一种二维的表格型的数据结构, 跟电子表格或者SQL里的表相类似。它是由行和列共同构成的, 每一列能够涵盖不一样的数据类型(像是整数、浮点数、字符串等)。#AI人工智能#