[环境保护探索]-对水资源可饮用程度的数据探索性分析及预测_python 水质分析 water_potability.csv-程序员宅基地

技术标签: python  数据分析  


项目背景

数据集题材: [环境保护探索] 饮用水资源的可用性分析

数据集形式: csv文本格式,数据源自Kaggle。共 32760 条数据,以及 10 个原始特征和标签 (3276 X 10)

项目数据探索目的(译自原文):

获得安全饮用水对健康至关重要,既是一项基本人权,也是一个重要的经济发展问题。在一些地区已经表明,对供水和卫生设施的投资可以产生净经济效益。

本项目旨在对水资源数据的9项水质指标展开探索分析,以及构造模型预测的水体可饮用性,为水资源的保护和合理开发提供数据支持与决策。

水质指标:

pH值(ph):评价水的酸碱平衡的一个重要参数,世卫建议pH值的最大允许限值为6.5至8.5

硬度(Hardness):硬度主要由钙和镁盐引起,被定义为水沉淀钙镁引起的凝块沉淀的容度

总溶解固体(Solids):TDS值较高的水表明该水具有较高的矿化度。TDS的理想限值为500 mg/l,最大限值为1000 mg/l,规定用于饮用

氯胺(Chloramines): 氯和氯胺是公共供水系统中使用的主要消毒剂,饮用水中氯含量高达4毫克/升被认为是安全的。

硫酸盐(Sulfate):化学工业污染物,在大多数淡水供应中,其浓度范围为3至30毫克/升

电导率(Conductivity):水中溶解固体的数量决定电导率,世卫标准,EC值不应超过400μS/cm

有机碳(Organic_carbon):对纯净水中有机化合物中碳总量的测量。美国环保局规定,经处理/饮用水中的TOC<2 mg/L,用于处理的水源水中的TOC<4 mg/L

三卤甲烷(Trihalomethanes):三卤甲烷可能存在于经过氯处理的水中,饮用水中THM含量高达80 ppm被认为是安全的

浊度(Turbidity):水的浊度取决于悬浮状态下存在的固体物质的数量。世界卫生组织建议值5.00 NTU


可饮用性(Potability):表示水对人类饮用是否安全,其中1表示饮用水,0表示不饮用水。

一、数据导入、简单预览,以及预处理

1.引入库

# 通用模块
import pandas as pd
import matplotlib.pyplot as plt
import seaborn as sns
import numpy as np
import plotly.express as px
from collections import Counter
import matplotlib
zhfont1 = matplotlib.font_manager.FontProperties(fname="SourceHanSansSC-Bold.otf")
from warnings import filterwarnings
# 机器学习
from sklearn.model_selection import train_test_split, KFold, cross_validate, cross_val_score
from sklearn.preprocessing import StandardScaler,MinMaxScaler
from sklearn.linear_model import LogisticRegression,RidgeClassifier,SGDClassifier,PassiveAggressiveClassifier
from sklearn.linear_model import Perceptron
from sklearn.svm import SVC,LinearSVC,NuSVC
from sklearn.neighbors import KNeighborsClassifier,NearestCentroid
from sklearn.tree import DecisionTreeClassifier
from sklearn.ensemble import RandomForestClassifier,AdaBoostClassifier,GradientBoostingClassifier
from sklearn.svm import SVC
from sklearn.naive_bayes import GaussianNB,BernoulliNB
from sklearn.ensemble import VotingClassifier
from sklearn.metrics import precision_score,accuracy_score
from sklearn.model_selection import RandomizedSearchCV,GridSearchCV,RepeatedStratifiedKFold
from sklearn.metrics import accuracy_score

2.读入数据

 data = pd.read_csv(r'C:\xlwings\water\water_potability.csv')  # 导入数据
    print('预览数据')
    print(data.head(3).T)  # 预览数据

    print('查看各字段属性')  # 查看各字段属性
    print(data.info())
    print('查看缺失项')  # 查看缺失项
    print(data.isnull().sum()[data.isnull().sum().values != 0].T)  # 得出children,country,agent,company四个字段含有缺失项
    # msno.bar(data, figsize=(10, 7), fontsize=10, color='grey',log=True)  # log=True 切换到对数刻度,更为清晰
    # plt.show()

    print('查看数据大小')  # 查看数据大小
    print(data.size)
    print(data.shape)
    print('看数据数据及分布')  # 查看数据数据及分布
    print(data.describe().T)

结果:
1.共 32760 条数据,以及 10 个原始特征和标签 (3276 X 10)
2.缺失项:
在这里插入图片描述

3.处理缺失值

    d1=data[data['Potability'] == 0][['ph', 'Sulfate', 'Trihalomethanes']].median()
    d2=data[data['Potability'] == 1][['ph', 'Sulfate', 'Trihalomethanes']].median()
    d=pd.DataFrame({
   
    'Potability=0':d1,'Potability=1':d2})   #查看中值差异
    print('查看中值差异')
    print(d)
    e1=data[data['Potability'] == 0][['ph', 'Sulfate', 'Trihalomethanes']].mean()
    e2 = data[data['Potability'] == 1][['ph', 'Sulfate', 'Trihalomethanes']].mean()
    e=pd.DataFrame({
   
    'Potability=0':e1,'Potability=1':e2})
    print(e)
    print('结论:经过对比,饮用水和非饮用水数据中各自关于ph、Sulfate、Trihalomethanes的均值和中位数差异都不大,因此选择中位数作为缺失项的填充值。')

在这里插入图片描述

结论:经过对比,饮用水和非饮用水数据中各自关于ph、Sulfate、Trihalomethanes的均值和中位数差异都不大,因此选择中位数作为缺失项的填充值。

3.1填充缺失值:

data['ph'].fillna(value=data['ph'].median(), inplace=True)
data['Sulfate'].fillna(value=data['Sulfate'].median(), inplace=True)
data['Trihalomethanes'].fillna(value=data['Trihalomethanes'].median(), inplace=True)
print(data.isnull().sum())  # 缺失值全部被填充

data.to_csv(r'C:\xlwings\water\water_potability_full.csv')
print('输出处理后的数据集')

二、水质指标的数据分析

1.各水质特征的数据分布

1.1 硬度

    def pic_hardness():
        fig = px.histogram(data_full, x='Hardness', y=Counter(data_full['Hardness']), color='Potability', template='plotly_white',
                           marginal='box', opacity=0.7, nbins=100,
                           color_discrete_sequence=[colors_green[3], colors_blue[3]],
                           barmode='group', histfunc='count')           #作直方图  边际画箱型图  marginal=`rug`、`box`, `violin`

        fig.add_vline(x=151, line_width=1, line_color=colors_dark[1], line_dash='dot', opacity=0.7)
        fig.add_vline(x=301, line_width=1, line_color=colors_dark[1], line_dash='dot', opacity=0.7)
        fig.add_vline(x=76, line_width=1, line_color=colors_dark[1], line_dash='dot', opacity=0.7)

        fig.add_annotation(text='<76 mg/L <br> 被视作软水', x=40, y=130, showarrow=False, font_size=9)
        fig.add_annotation(text=' 76 ~150<br> (mg/L) 之间<br>被视作中等硬度', x
版权声明:本文为博主原创文章,遵循 CC 4.0 BY-SA 版权协议,转载请附上原文出处链接和本声明。
本文链接:https://blog.csdn.net/Fuelliott/article/details/125524315

智能推荐

5个超厉害的资源搜索网站,每一款都可以让你的资源满满!_最全资源搜索引擎-程序员宅基地

文章浏览阅读1.6w次,点赞8次,收藏41次。生活中我们无时不刻不都要在网站搜索资源,但就是缺少一个趁手的资源搜索网站,如果有一个比较好的资源搜索网站可以帮助我们节省一大半时间!今天小编在这里为大家分享5款超厉害的资源搜索网站,每一款都可以让你的资源丰富精彩!网盘传奇一款最有效的网盘资源搜索网站你还在为找网站里面的资源而烦恼找不到什么合适的工具而烦恼吗?这款网站传奇网站汇聚了4853w个资源,并且它每一天都会持续更新资源;..._最全资源搜索引擎

Book类的设计(Java)_6-1 book类的设计java-程序员宅基地

文章浏览阅读4.5k次,点赞5次,收藏18次。阅读测试程序,设计一个Book类。函数接口定义:class Book{}该类有 四个私有属性 分别是 书籍名称、 价格、 作者、 出版年份,以及相应的set 与get方法;该类有一个含有四个参数的构造方法,这四个参数依次是 书籍名称、 价格、 作者、 出版年份 。裁判测试程序样例:import java.util.*;public class Main { public static void main(String[] args) { List <Book>_6-1 book类的设计java

基于微信小程序的校园导航小程序设计与实现_校园导航微信小程序系统的设计与实现-程序员宅基地

文章浏览阅读613次,点赞28次,收藏27次。相比于以前的传统手工管理方式,智能化的管理方式可以大幅降低学校的运营人员成本,实现了校园导航的标准化、制度化、程序化的管理,有效地防止了校园导航的随意管理,提高了信息的处理速度和精确度,能够及时、准确地查询和修正建筑速看等信息。课题主要采用微信小程序、SpringBoot架构技术,前端以小程序页面呈现给学生,结合后台java语言使页面更加完善,后台使用MySQL数据库进行数据存储。微信小程序主要包括学生信息、校园简介、建筑速看、系统信息等功能,从而实现智能化的管理方式,提高工作效率。

有状态和无状态登录

传统上用户登陆状态会以 Session 的形式保存在服务器上,而 Session ID 则保存在前端的 Cookie 中;而使用 JWT 以后,用户的认证信息将会以 Token 的形式保存在前端,服务器不需要保存任何的用户状态,这也就是为什么 JWT 被称为无状态登陆的原因,无状态登陆最大的优势就是完美支持分布式部署,可以使用一个 Token 发送给不同的服务器,而所有的服务器都会返回同样的结果。有状态和无状态最大的区别就是服务端会不会保存客户端的信息。

九大角度全方位对比Android、iOS开发_ios 开发角度-程序员宅基地

文章浏览阅读784次。发表于10小时前| 2674次阅读| 来源TechCrunch| 19 条评论| 作者Jon EvansiOSAndroid应用开发产品编程语言JavaObjective-C摘要:即便Android市场份额已经超过80%,对于开发者来说,使用哪一个平台做开发仍然很难选择。本文从开发环境、配置、UX设计、语言、API、网络、分享、碎片化、发布等九个方面把Android和iOS_ios 开发角度

搜索引擎的发展历史

搜索引擎的发展历史可以追溯到20世纪90年代初,随着互联网的快速发展和信息量的急剧增加,人们开始感受到了获取和管理信息的挑战。这些阶段展示了搜索引擎在技术和商业模式上的不断演进,以满足用户对信息获取的不断增长的需求。

随便推点

控制对象的特性_控制对象特性-程序员宅基地

文章浏览阅读990次。对象特性是指控制对象的输出参数和输入参数之间的相互作用规律。放大系数K描述控制对象特性的静态特性参数。它的意义是:输出量的变化量和输入量的变化量之比。时间常数T当输入量发生变化后,所引起输出量变化的快慢。(动态参数) ..._控制对象特性

FRP搭建内网穿透(亲测有效)_locyanfrp-程序员宅基地

文章浏览阅读5.7w次,点赞50次,收藏276次。FRP搭建内网穿透1.概述:frp可以通过有公网IP的的服务器将内网的主机暴露给互联网,从而实现通过外网能直接访问到内网主机;frp有服务端和客户端,服务端需要装在有公网ip的服务器上,客户端装在内网主机上。2.简单的图解:3.准备工作:1.一个域名(www.test.xyz)2.一台有公网IP的服务器(阿里云、腾讯云等都行)3.一台内网主机4.下载frp,选择适合的版本下载解压如下:我这里服务器端和客户端都放在了/usr/local/frp/目录下4.执行命令# 服务器端给执_locyanfrp

UVA 12534 - Binary Matrix 2 (网络流‘最小费用最大流’ZKW)_uva12534-程序员宅基地

文章浏览阅读687次。题目:http://acm.hust.edu.cn/vjudge/contest/view.action?cid=93745#problem/A题意:给出r*c的01矩阵,可以翻转格子使得0表成1,1变成0,求出最小的步数使得每一行中1的个数相等,每一列中1的个数相等。思路:网络流。容量可以保证每一行和每一列的1的个数相等,费用可以算出最小步数。行向列建边,如果该格子是_uva12534

免费SSL证书_csdn alphassl免费申请-程序员宅基地

文章浏览阅读504次。1、Let's Encrypt 90天,支持泛域名2、Buypass:https://www.buypass.com/ssl/resources/go-ssl-technical-specification6个月,单域名3、AlwaysOnSLL:https://alwaysonssl.com/ 1年,单域名 可参考蜗牛(wn789)4、TrustAsia5、Alpha..._csdn alphassl免费申请

测试算法的性能(以选择排序为例)_算法性能测试-程序员宅基地

文章浏览阅读1.6k次。测试算法的性能 很多时候我们需要对算法的性能进行测试,最简单的方式是看算法在特定的数据集上的执行时间,简单的测试算法性能的函数实现见testSort()。【思想】:用clock_t计算某排序算法所需的时间,(endTime - startTime)/ CLOCKS_PER_SEC来表示执行了多少秒。【关于宏CLOCKS_PER_SEC】:以下摘自百度百科,“CLOCKS_PE_算法性能测试

Lane Detection_lanedetectionlite-程序员宅基地

文章浏览阅读1.2k次。fromhttps://towardsdatascience.com/finding-lane-lines-simple-pipeline-for-lane-detection-d02b62e7572bIdentifying lanes of the road is very common task that human driver performs. This is important ..._lanedetectionlite

推荐文章

热门文章

相关标签