빅데이터 분석기사/실기 요약

[빅데이터분석기사/실기후기] 10회 시험 후기 및 문제 복기

✨️데이터분석가✨️ 2025. 6. 22. 23:42
728x90
728x90

드디어! 빅데이터분석기사 실기시험을 응시했습니다.

 

저는 9회 필기시험에 합격했었고, 9회 실기시험은 접수일정을 놓치는 바람에 신청하지 못했고,

10회 실기시험은 10시에 땡 하고 바로 신청했지만 결제하지 않아서 취소당했다는...

(접수 후 2시간 내 결제해야 한다고 합니다!!)

당일 밤에 접속해보니 집 근처는 이미 다 마감되어서 1시간 넘게 걸리는 양재로 신청했습니다아하하

그래도 신청한 게 어디야 멍청한 내 자신 몸이 고생하자

 

9시 반까지 입실이라 시간 맞춰서 갔는데, 그 이후에도 입장은 가능한 것 같았습니다.

저희 반은 3명 결석했는데, 자격증 시험치곤 꽤나 출석률이 높은 것 같습니다. (시험료가 비싸서 그런 듯)

전자기기를 9시 25분부터 끄라고 하고, 진짜 OFF가 되었는지 감독관이 다 만져서 확인합니다. WOW

그러고 바로 책까지 집어넣으라고 하니 시험까지 책을 못 보는 시간이 꽤나 깁니다.

9시 반부터는 로그인 / 시험환경 Test를 진행하고, 10시 정각에 시험이 시작됩니다.

11시 반부터 퇴실할 수 있었고, PC 문제로 시간이 지연되는 경우에는 추가시간을 준다고 하고,

그리고 시험 중간에 몇 차례 알림이 떠서 문제에 대한 추가 안내가 있었다는 정도가 특이했습니다~

 

10회 실기시험전반적으로 최근 시험 중에서 가장 쉬웠다는 평입니다. (저도 동의)

빈번하게 출제되었던 유형들로 나왔고, 꼬는 문제없이 정석대로 나온 것 같습니다.

저는 1유형의 3번 문제(split)만 못 풀었는데, 찍어보려고 해도 다 소수점 셋째짜리까지 제출해야 해서 찍는 게 의미가 없습니다.

 

자! 그럼 제가 복기하는 10회 실기 문제 및 정답입니다.

 

 

 


제1유형 (3문제, 각 10점, 소수점 셋째자리 제출)

1. 소주제별 정답률 구하기 (= 소주제별 정답수 / 소주제별 응답수)

- 계산하다가 잘 안돼서 소주제 약 30개 정도를 노가다를 했고, 1/2위가 동점이라 공동 1등으로 처리하고, 3위를 구하는 것입니다. 동점처리에 대한 안내가 중간에 팝업으로 알림이 왔어서 잘 고려했습니다.

(이 부분이 가장 시끌시끌한 것 같습니다. 처음부터 문제를 잘 냈어야 하는 거 아니냐는...)

☞ 0.568

 

2. 날짜 그룹핑, 정렬 문제

1) 연월별 매출액이 두 번째로 높은 매출액 구하기

- pd.to_datetime(), .dt.strftime()

☞ 4655000

2) 1)의 결과에서 매출액이 네 번째로 높은 연월의 Category 매출액 구하기

☞ coffee, 2000000

 

3. 메일 내용 문장의 단어수를 구하고, spam/ham별 단어수 평균 차이 구하기

- 3000개 메일 내용의 단어수를 구하고, spam/ham별로 단어수 평균의 차이를 구하는 것입니다.

- 저는 df['내용'].str.split()로 하면 다 2로 나오고, df['내용'].str.split(' ')로 하면 다 3000으로 나왔나

다 똑같은 값이 나와서 실패했는데, df['내용'].str.split().str.len() 으로 작성해야 하는 것 같습니다.

☞ 9.747

 

 


제2유형 (1문제, 40점)

- 회귀문제 / 결측치 없음 / 범주형 1개 / RMSE / 가스사용량 예측

- 저는 train 가스사용량 제외, 원핫인코딩, RandomForestRegressor 적용했습니다.

- 대부분 RMSE 값이 400~600 사이로 나온 듯합니다. (저는 얼마 나왔는지 기억이 안 나요ㅠㅠ)

(여기는 0값이 결측치냐 아니냐, 0값은 제외하고 돌려야 한다 등등의 논란이 있어 보입니다)

 

 


제3유형 (2문제, 각 15점)

1. 로지스틱 회귀분석

1) 편차를 제외한 나머지 회귀계수의 합

- from statsmodels.formula.api import logit, model.summary(), model.params['']

☞ -0.002

2) Age 1단위 증가할 때의 오즈비

- np.exp(coef)

☞ 0.967

3) 신규 데이터로 예측값 구하기

- model.predict(pd.DataFrame({'a':[0], 'b':[0]}))

☞ 0.724

 

2. 다중선형회귀

1) 95%에서 유의미한 p-value 회귀계수

- from statsmodels.formula.api import ols, model.summary(), model.params['']

☞ -40.261

2) 95%에서 유의미한 p-value 값을 가진 항목으로 만든 모델의 결정계수 구하기

R-squared / Adj. R-squared 0.913 (동일했음)

3) 2)에서 학습시킨 모델로 신규 데이터 예측하기

- model.predict(pd.DataFrame({'a':[0], 'b':[0]}))

☞ 24.702

 

 

 

 

 

 

728x90
728x90