답변함

실기 2유형 관련 질문 사항

일단 빅분기 필기가 12회와 더불어 이번 13회도 상당히 어렵게 나왔다는 반응을 보니까

실기 준비함에 있어 부담감이 좀 더 커진거 같습니다. 제가 필기를 합격했던 11회차도

어려웠는데 최근 3년간 후기를 보면 10회 필기 시험 빼고는 다들 어려웠다는 후기가 많더라구요.

실기의 경우 12회차 2유형에서 회귀(RMSLE)가 나옴에 따라 13회의 경우 분류가 나올 가능성이

제가 볼때는 80~90% 이상 예상이 됩니다.

그럴 가능성이 높을 수 밖에 없다면 2021년은 분류만 2번 나오다가 2022년 하반기 시험부터

회귀 유형이 출제된 이후로 작년까지는 모두 분류와 회귀를 서로 번갈아 가며

1년에 한번 씩 출제된 경향이 있고 이미 올해 회귀 문제가 나와버리다 보니 더더욱 13회 분류가

출제될 가능성이 높아 보여요.

그 다음 2유형에서 많이 쓰이는게 랜덤포레스트인데 작년 11회 2유형 분류 문제 부터 성능 추가 및

랜덤포레스트가 아닌 라이트지비엠이 고득점을 받아버리는 상황이 나왔어요.

게다가 올해 12회의 경우 라이트지비엠은 오류로 0점이 많이 나오고 랜덤포레스트가 고득점이

나옴에 따라 13회는 한가지 모델만 시험 출제 기관에서 고집하지 않는 이상 라이트지비엠이나

다른 모델을 이용해서 고득점하는 문제가 출제되지 않을까 하는 생각도 추가로 듭니다.

그래서 실제로 분류 모델을 이용한다면 라이트 지비엠이 랜덤포레스트 보다 좀 더 우세하고

회귀 모델을 이용한다면 랜덤포레스트가 라이트 지비엠보다 성능이 더 우세한지도 궁금하고

13회 2유형을 어떤식으로 준비하는게 좋은지 고민이 됩니다. 

추가적으로 평가지표의 종류와 분류에서 코딩 내용은 어떤 것들을 추가 하거나 변경하면 되는지 

등도 다 궁금하네요. 12회차 문제를 풀어보니까 분류, 회귀에서 사용되는 평가지표의 모든 종류와 분류에서 

추가 및 변경되는 내용을 모른다면 2유형 고득점 너무 어렵다는 생각이 많이 들더군요.

(RMSLE라는 생각지도 못한 문제가 나오니 평가지표에 대한 불신도 커진 상황)

시간 되시면 답변 부탁합니다.

0

댓글

댓글 4개
날짜 투표수
  • 좋은 의견 남겨주셔서 감사합니다. 저도 답변 드려볼게요.

    말씀하신 "회귀→분류 교대 패턴"은 논리적으로 설득력 있지만, 표본이 4~5회밖에 안 되다 보니 우연과 의도적 안배를 구분하긴 어렵습니다. 확률적으로 베팅하시는 건 이해하지만, 분류·회귀 둘 다 준비하시고 시간 배분만 분류 쪽에 조금 더 두시는 걸 추천드려요. 회귀가 2년 연속 나온 해도 있었으니 완전히 배제하시면 위험합니다.

    "분류=LightGBM 유리, 회귀=RandomForest 유리"라는 부분은 조금 다르게 보고 있습니다. 11회 분류에서 LightGBM이 고득점 났던 건 해당 데이터의 비선형 패턴을 잘 잡아서였을 가능성이 높고, 12회에서 LightGBM이 대거 0점 처리된 건 알고리즘 성능 문제가 아니라 실기 CBT 환경의 LightGBM 버전/설치 이슈로 인한 실행 오류였다는 후기가 많았죠. 즉 "분류엔 부스팅이, 회귀엔 배깅이 유리하다"는 일반화는 머신러닝 이론적으로 근거가 약합니다. 실제 우열은 문제 유형이 아니라 그때그때 데이터 특성과 환경 이슈에 좌우된다고 보시는 게 맞습니다.

    그래서 13회 2유형은 이렇게 준비하시는 걸 권해드립니다:

    1. 알고리즘보다 "실행 안정성"을 최우선으로: 환경에서 100% 검증된 RandomForest(Classifier/Regressor)를 기본 템플릿으로 고정하고, LightGBM은 시험 시작 직후 import lightgbm 및 간단한 fit 테스트로 정상 동작하는지 먼저 확인한 뒤 쓰세요. 안 되면 미련 없이 RandomForest로 가시면 됩니다.
    2. 분류·회귀 공용 템플릿을 하나로 통합: target dtype 확인 → if 연속형: Regressor / else: Classifier 분기만 바꿔서 나머지 전처리·평가·저장 코드는 동일하게 재사용할 수 있게 미리 짜두면, 어느 유형이 나와도 당황하지 않습니다.
    3. 여러 모델을 항상 같이 학습해서 비교: RandomForest 하나만 믿지 마시고 RandomForest + GradientBoosting(또는 LightGBM) + 기본모델(로지스틱/선형)을 한 번에 학습해서 검증 스코어(AUC/F1 또는 RMSE/RMSLE) 비교 후 최고 성능 모델을 제출하는 방식이 특정 모델에 "베팅"하는 것보다 훨씬 안전합니다.
    4. 평가지표(RMSLE 등) 계산 함수는 암기가 아니라 손으로 짤 수 있게 연습하세요. 12회처럼 생소한 지표가 나와도 sklearn에 없으면 직접 구현해야 합니다.

    요약하면 "어떤 모델이 유리할까"를 예측하기보다, 어떤 모델이 나와도 안정적으로 돌아가는 파이프라인을 만들어두는 게 13회 대비의 핵심이라고 생각합니다.  조금이라도 도움이 되셨으면 좋겠어요!

    0
  • 답변 감사합니다. 그런데 제가 12회 응시하면서 또 추가된 내용이 있는데 이것도 확인 부탁할깨요.

    (추가적으로 라는 부분 이후부터)

    그리고 답변에서 말씀하신 4번은 제가 지난번 시험장 가서 좀 낚인 부분이긴 한데

    이것 때문에 실기 원서 접수할 때 시험장도 바꿔야 될지 말지도 살짝 고민됩니다.

    아무튼 2유형 좀 더 깊게 공부해야 되는건 맞는 듯 해요.

    0
    • 낯선 지표명(RMSLE, MAPE, Log Loss 등)일수록 대부분 sklearn.metrics에 이미 있는 함수이거나 기존 지표의 간단한 변형(제곱근·퍼센트 변환·로그 변환)입니다. 이름만 보고 "이건 OO의 변형이겠구나" 유추하는 연습이 중요합니다.
    • 오차 크기 계열: MAE → MSE → RMSE → RMSLE (제곱 → 제곱근 → 로그가 순차적으로 붙는 구조)로 묶어서 외우면 응용이 쉽습니다.
    • 확률 기반 지표(Log Loss, ROC-AUC)는 predict가 아니라 predict_proba가 필요하다는 점을 꼭 기억하세요.
    • 답안 제출 시 문제에서 요구하는 소수점 자리수를 정확히 맞추는 것도 중요합니다(round() 필수).

             도움이 되셨으면 좋겠습니다. 추가로 궁금하신 지표 있으면 언제든 질문 주세요!

    0
  • 확률 기반 지표에서 log loss, roc-auc 빼고 나머지는 predict가 맞나요?

    (roc-auc는 알고 있었지만 log loss는 강사님에게 처음 들음)

    그리고 회귀와 달리 분류는 음수 오류 없는거 맞는지도 궁금합니다.

    0

댓글을 남기려면 로그인하세요.

 

원하는 것을 찾지 못하셨나요?

질문하기