빅데이터 분석기사/실기 요약

[빅데이터분석기사/실기요약] 제1유형. 파이썬 핵심코드

✨️데이터분석가✨️ 2025. 6. 25. 23:36
728x90
728x90

빅데이터분석기사 실기 제1유형은 총 3문제가 출제되며 각 10점씩이고,

코드를 어느 정도까지 활용할 수 있는지를 확인하는 유형 같습니다.

 

그래서 예상하지 못한 다양한 문제가 나오고 있고, 점점 더 어려워지는 추세입니다.

그래도 아직 1~2문제 정도는 노가다로 풀 수 있어 안되면 몸으로 때우자~!ㅎㅎ

(소수점 셋째짜리까지 제출이라 못 풀면 오답입니다ㅠ)

 

 


 

pandas, numpy를 활용한 '데이터 전처리', '그룹별 통계', '조건 필터링 및 정렬', '날짜 처리' 등에 대한 문제가 자주 출제됩니다. 공부할 시간이 부족하다면, 자주 출제되는 코드 위주로 공부해서 1~2문제만 맞추는 전략으로 가도 좋을 것 같습니다!

 

# 데이터 확인하기
print( df.head() ) # 앞 5줄 추출
print( df.shape ) # 행열 개수 추출
print( df.info() ) # 컬럼 정보
print( df.describe() ) # 기초 통계 정보 (수치형)
print( df.describe(include='object') ) # 기초 통계 정보 (범주형)
print( df.describe(include='all') ) # 기초 통계 정보 (모두)
print( df.count() ) # 열별(컬럼) 데이터 개수, 결측치 제외
print( df.count(axis=1) ) # 행별 데이터 개수, 결측치 제외
print( df.nunique() ) # 항목 종류 수
print( df['지역'].nunique() ) # 항목 종류
print( df['지역'].value_counts() ) # 항목별 개수
print( df['나이'].max() ) # 최대값
print( df.T.sum() ) # 행렬변환, 행 단위로 합하기
 
# 그룹별 통계
df.groupby(['지역', '성별'])['나이'].mean() # 지역 및 성별 평균 나이
df.groupby(['지역', '성별']).mean().reset_index() # 인덱스 형태로 리셋
df['나이'].quantile(0.25) # 하위 25% 값

# 조건 필터링
a = df['지역'] == '서울특별시'
b = df['나이'] < 30
df[a & b] # 해당 조건 조회
len(df[a & b]) # 해당 조건 데이터 개수
a = df['continent'] == 'Europe' # 유럽 데이터만 저장
df = df[a]

# 정렬
df.sort_index(ascending=False# 인덱스 기준 내림차순
df.sort_values(['지역''성별'], ascending=[FalseTrue]) # 지역 내림차순, 성별 오름차순

# 중복값 제거
df = df.drop_duplicates() # 중복값 제거
df = df.drop_duplicates(subset=['지역', '성별'], keep='last') # 특정 컬럼만 중복값 제거 (last는 뒤에 값을 살림)

# 인덱싱
df.loc[0] # loc[인덱스 명] → ID 이름이 0인 데이터 출력
df.iloc[0] # iloc[인덱스 번호] → 0번째줄 데이터 출력
df.iloc[:3] # 상위 3개 데이터 출력
df[:int(len(df)*0.7)] # 상위 70% 데이터 출력

# 슬라이싱
df.loc[:,'지역':'성별'] # loc[인덱스 명, 컬럼 명], 마지막 포함O → 지역~성별 컬럼의 모든 데이터 출력
df.iloc[0:3:,0:1] # iloc[인덱스 번호, 컬럼 번호], 마지막 포함X 0번째 컬럼의 0~2번째 데이터 출력
df['지역'].str[:2] # 앞 두글자 추출 강원, 경기, 서울, 인천...
df['지역'][:2] # 두 개 데이터 추출 강원특별자치도, 경기도

# 데이터 나누기
df['음료'].str.split() # 띄어쓰기 기준으로 단어 나누기 → 블루베리, 에이드
df['음료'].str.split().str[0] # 첫번째 값만 추출 → 블루베리

# 데이터 찾기
df['음료'].str.contains('딸기') # 일부 단어 찾기 O → False True False...
df.isin(['블루베리 에이드', '딸기 에이드']) # 일부 단어 찾기 X → True, True, False...

# 날짜 형식 변환
pd.to_datetime(df['date'])
df['date'].dt.year # year 값만 분리 (month, day, hour, minute, second도 가능)
df['day'] = df['date'].dt.day_name() # 요일 값을 day 컬럼에 저장
df[df['day'] == 'Sunday']['categoryId'].value_counts().index[0] # 일요일에 가장 많은 categoryId

 

 

 

 

 

 

 

[빅데이터분석기사/실기] 제1유형. 판다스 실습 - 날짜 변환

제1유형의 날짜를 변환하는 실습 내용입니다.날짜 및 시각 형식 변환, 날짜 계산, 기간 계산 등 날짜에 관한 다양한 유형들이 있습니다. 문1-1. Date1 형식 변환 (2024-02-17)print(df['Date1'])df['Date1'] = pd.t

dataslog.tistory.com

 

 

[빅데이터분석기사/실기] 제1유형. 판다스 실습 - 문자열

제1유형에서 문자열을 다루는 다양한 방법들을 담고 있으며,문자열 변경, 나누기, 찾기, 길이 구하기, 대/소문자 변경, 공백제거, 추출에 대해 알아 봅시다!ㅎ 문1. 일부 문자 값 변경, replace( ) 함

dataslog.tistory.com

 

 

[빅데이터분석기사/실기] 제1유형. 판다스 실습 - 모의문제

제1유형의 모의문제 입니다.다양한 문제를 많이 풀어보는 것이 시험에 가장 큰 도움이 되기에 아래 문제들도 꼭 풀어보시기 바랍니다. [문제 1번]① f1 컬럼의 결측치는 중앙 값으로 대체② 나머

dataslog.tistory.com

 

 

 

 

 

728x90
728x90