[Machine Learning] 타이타닉 생존자 머신러닝 -1-
In [4]: df_train=pd.read_csv('Dataset/Titanic/train.csv') df_test=pd.read_csv('Dataset/Titanic/test.csv') In [5]: df_train.head() Out[5]: PassengerId Survived ...
In [4]: df_train=pd.read_csv('Dataset/Titanic/train.csv') df_test=pd.read_csv('Dataset/Titanic/test.csv') In [5]: df_train.head() Out[5]: PassengerId Survived ...
📌 들어가며 이번 글에서는 타이타닉 데이터셋으로 생존자 분석 EDA를 진행한다. 결측치 확인·대치(특히 나이의 그룹별 평균 대치)부터, 좌석 등급·성별·연령대에 따른 생존률을 시각화로 파헤친다. EDA 목표 — 단순히 결측치를 채우는 게 아니라, 원래 분포를 훼손하지 않으면서 데이터를 보완하고, 어떤 요인이 생존에 영향을 주는지 찾는 것이다....
📌 들어가며 이번 글에서는 보스턴 부동산 데이터셋으로 집값(MEDV)에 영향을 주는 요인을 찾는 EDA를 진행한다. 상관관계 히트맵으로 핵심 지표를 찾고, 상권/비상권·가격대별로 데이터를 나눠 숨은 패턴을 관찰한다. EDA란? 다양한 각도에서 데이터를 관찰·이해하는 과정. 이해도가 높아지면서 숨은 의미와 잠재적 문제를 발견하고, 이를 바탕으로...
📌 들어가며 JPA의 데이터는 크게 엔티티 타입과 값 타입으로 나뉜다. 이번 글에서는 값 타입(기본값·임베디드·컬렉션)을 정리한다. 타입 특징 엔티티 타입 @Entity, 식별자로 추적 가능 (변해도 추적) 값 타입 식별자...
📌 들어가며 이번 글에서는 데이터 정리(대푯값·분산·시각화)와 확률(순열·조합·조건부확률·분포)을 인공지능 관점에서 정리한다. 1. 대푯값 — 평균과 중앙값 대푯값 정의 특징 평균(mean) 모두 더해 개수로 나눔 가장 많이 쓰이나 이...
📌 들어가며 이번 글에서는 수 체계·데이터 인코딩·수학 기호·필요/충분조건, 그리고 인공신경망의 시초인 퍼셉트론을 다룬다. 수학이 인공지능 이론과 결합되니 복잡하지만 그만큼 재미있다. 1. 수 체계 수 정의 자연수 셀 때·순서 매길 때 (1, 2, 3…) ...
📌 들어가며 이번 글에서는 행렬(Matrix)을 정리한다. 인공지능의 연산이 대부분 행렬 연산으로 이루어지므로 매우 중요하다. 행렬: 사각 괄호로 둘러싸인 숫자들의 배열. 1. 행렬의 곱셈 덧셈은 요소끼리 더하면 되지만, 곱셈은 규칙이 다르다. 행과 열의 인덱스를 각각 곱해 더한 값이 결과의 한 원소가 된다. impo...
📌 들어가며 이번 글에서는 그래프(Graph)를 정리한다. 그래프는 인공지능의 뉴럴넷·계산 그래프와 직결되는 중요한 구조다. 그래프: 정점(vertex)의 집합 V와, 서로 다른 정점쌍을 연결하는 모서리(edge)의 집합 E로 구성된 구조. G = (V, E) 1. 그래프 용어 용어 정의 ...
📌 들어가며 이번 글에서는 여러 종류의 함수(다항·지수·시그모이드·로그)와 스칼라·벡터를 다루며, 이들이 인공지능에 어떻게 활용되는지 살펴본다. 함수란? 입력 변수가 어떤 연산을 거쳐 출력 변수로 나오는 구조. 첫 집합의 한 원소를 두 번째 집합의 오직 한 원소에 대응시키는 관계. 1. 여러 함수의 종류 ...
📌 들어가며 이번 글에서는 IT의 꽃 알고리즘을, IT 관점이 아닌 수학적 관점에서 다룬다. 알고리즘: 주어진 문제를 해결하기 위한 방법을 순차적으로 나열한 것. 1. 알고리즘의 5가지 특징 특징 설명 입력(input) 입력값을 가진다 ...