|
所在平台: Udemy |
课程主页: https://www.udemy.com/course/cwmigthy/
课程评论:没有评论
这门课程名为 "cwmigthy",由一位在职数据科学家授课,旨在传授大数据工程与分析的核心实战技巧。课程面向希望在实际工作中应用大数据开发和分析的学员,将大数据系统的构建和分析过程从头到尾进行讲解,涵盖大数据收集、存储、处理和分析的全流程。课程以项目形式进行,强调快速掌握实际工作中的关键技巧。 **课程主要内容包括:** * **数据科学概述** * **大数据收集与系统设计**:包括网络爬虫、Linux命令、服务器安装与配置(CentOS)、Hadoop集群搭建(CDH)、Scrapy实战、HDFS、ZooKeeper、Cloudera Manager安装。 * **大数据存储模型设计**:关系型数据库、海量日志文件加载、自动驾驶大数据项目存储管理系统配置、Hadoop组件、Hadoop加载模块开发、Hadoop安装与测试、自动驾驶大数据项目(批量和实时数据加载及测试)。 * **大数据处理系统**:大数据处理类型、数据仓库特点、Hadoop/Spark/Hive安装与配置、分散式批处理、列式存储、事件处理、Spark核心组件、Spark Streaming、HiveQL数据仓库构建。 * **数据探索与统计分析**:数据分类、假设、估计、概率、概率分布(二项分布、正态分布)、标准化、z分布、t分布、卡方分布、统计推断、Impala和Zeppelin安装。 * **数据挖掘与机器学习**:数据挖掘阶段、数据预处理(标准化、重缩放)、模型构建(线性回归)、数据可视化、特征工程(PCA)、模型评估(分类模型评估、Lift Chart)、分类算法(KNN, Naive Bayes, 分类回归树)。 * **推断统计学**:估计、置信区间、假设检验、方差分析(单因素、双因素)、协方差分析、回归分析。 课程致力于让学员全面学习数据科学实践中的各类问题。
[현직 데이터 사이언티스트가 전하는 데이터 엔지니어링 및 분석 과정의 핵심 실무 노하우]본 교육은 회사내에서 빅데이터 개발 및 분석 업무를 실제로 적용하고 진행해보고자 하는 분들을 대상으로 기획됐습니다. 빅 데이터 시스템 구축 및 분석의 A부터 Z까지 전체적인 흐름을 파악하고, 빅데이터 수집부터 적재, 처리 , 분석까지 학습합니다. 프로젝트 형태로 교육을 진행하며 실무에서의 핵심 노하우들을 빠르게 습득할 수 있는 게 강의의 특징입니다.해당 강의의 목차는 다음과 같습니다.Data Science에 대해빅데이터 수집과 수집 시스템 설계 빅데이터 수집빅데이터 수집과 수집 시스템 구축스크레이핑 기초재귀식으로 모든 웹 컨텐츠 가져오기정규표현식, 관련 리눅스 명령어링크에 있는 것을 한꺼번에 재귀적으로 받기Centos 서버 설치 및 설정클러스터 네트워크 설정, 가상머신 생성CDH하둡 설치Scrapy스크래파이 실습HDFS, 주키퍼클라우데라 매니저 설치빅데이터 저장 모델 설계관계형 데이터베이스대용량 로그 파일 적재자율 주행 빅데이터 프로젝트빅데이터 저장 관리 시스템 구성하둡의 구성 요소빅데이터 적재 모듈 개발프로젝트 진행하둡 설치 (하둡 환경 설정)하둡 테스트하둡 설치 확인자율 주행 빅데이터 프로젝트 (배치성 로그 데이터 적재)자율 주행 빅데이터 프로젝트 (실시간 데이터 적재)자율 주행 빅데이터 프로젝트 (실시간 데이터 적재 기능 테스트)빅데이터 처리 시스템,빅데이터 처리 유형데이터웨어하우스 특징하둡 설치 및 설정주제에 따른 데이터 정의서 및 스파크 소개하둡 설치 및 설정주키퍼 설치 및 설정하둡 환경파일 설정분산 배치 처리, 컬럼 기반 스토리지(Column-oriented storage)이벤트 처리스파크 주요 구성 요소 요구 사항에 따른 빅데이터 처리 모델을 설계분산 처리 방식의 유형스파크 설치하이브를 통한 탐색단계별 주제에 따른 탐색Apache Spark Streaming하이브 QL로 마트 구성자료의 분류가설의 개요불편추정량확률적/비확률적 추출방법벡터, 리스트 데이터프레임 등평균분할표R 데이터 가져오기중심 경향도, 산포도분산, 표준편차, 범위, 사분위수, 백분위수모분산, 표본분산확률확률변수이항분포정규분포정규화 표준화z분포, t분포카이스퀘어 분포통계 기반 데이터 분석 - 추론 통계학빅데이터 분석에서 사용할 기술(임팔라, 제플린) 설치데이터마이닝 단계예제로 배우는 데이터마이닝 (예측)데이터 정규화(표준화) 및 리스케일링모델 구축: 선형 회귀 분석을 이용한 예제데이터 탐색을 위한 시각화차트 조절특화된 시각화주성분 분석피벗 테이블PCA예측 성능의 평가분류 모형 평가향상 차트(Lift Chart)분류 목적의 머신러닝 기법 적용knn나이브 베이즈(Naive Bayes) 기법분류 회귀 나무전처리추정, 신뢰구간가설검정두 모집단 간의 추론분산분석일원분산분석이원분산분석교차분석회귀분석데이터 사이언스 전체에 대한 실무 이슈들에 대해 다양하게 다뤄보고 학습해보시기 바랍니다.