| < 2.1.5 Regression Versus Classification Problems | 2.2.1 Measuring The Quality Of Fit > |
💡 학습 팁: 통계 수식과 용어가 낯설고 어렵다면? 아주 쉽게 풀어쓴 📖 쉬운 해설(의역본) 보기를 추천합니다!
2.2 Assessing Model Accuracy
2.2 모델 정확도 평가
One of the key aims of this book is to introduce the reader to a wide range of statistical learning methods that extend far beyond the standard linear regression approach.
이 책의 핵심 목표 중 하나는 독자에게 표준 선형 회귀 접근법을 훨씬 넘어서 확장되는 광범위한 통계적 학습 방법들을 소개하는 것입니다.
Why is it necessary to introduce so many different statistical learning approaches, rather than just a single best method?
단지 하나의 가장 좋은(best) 방법보다는, 왜 그렇게 여러 다양한 통계적 학습 접근법들을 소개하는 것이 필요할까요?
There is no free lunch in statistics: no one method dominates all others over all possible data sets.
통계학에 공짜 점심은 없습니다(There is no free lunch in statistics): 어떠한 방법도 모든 가능한 데이터 세트들에 걸쳐 다른 모든 것들을 압도하지는 않습니다.
On a particular data set, one specific method may work best, but some other method may work better on a similar but different data set.
특정 데이터 세트에서는 하나의 특정 방법이 가장 잘 작동할 수 있지만, 비슷하면서도 다른 데이터 세트에서는 어떤 다른 방법이 더 잘 작동할 수도 있습니다.
Hence it is an important task to decide for any given set of data which method produces the best results.
따라서 어떤 주어진 데이터 세트에 대해서도 어느 방법이 최고의 결과들을 산출하는지 결정하는 것은 중요한 과제입니다.
Selecting the best approach can be one of the most challenging parts of performing statistical learning in practice.
가장 좋은 접근법을 선택하는 것은 실무에서 통계적 학습을 수행하는 데 있어 가장 도전적인 부분들 중 하나일 수 있습니다.
In this section, we discuss some of the most important concepts that arise in selecting a statistical learning procedure for a specific data set.
이 섹션에서, 우리는 특정 데이터 세트에 대한 통계적 학습 절차를 선택함에 있어 발생하는 가장 중요한 개념들의 일부를 논의합니다.
As the book progresses, we will explain how the concepts presented here can be applied in practice.
이 책이 전개됨에 따라, 우리는 여기에 제시된 개념들이 실무에서 어떻게 적용될 수 있는지 설명할 것입니다.
2.2.1 Measuring the Quality of Fit (적합성 품질 측정)
회귀 환경에서 모형의 우수성을 평가할 때 가장 보편적으로 사용되는 척도인 평균 제곱 오차(MSE, Mean Squared Error)를 설명합니다.
단순히 학습 데이터만 잘 맞추는 것보다는 낯선 시험 데이터에도 좋은 성능을 발휘하는 일반화(Generalization)의 중요성을 강조합니다.
2.2.2 The Bias-Variance Trade-Off (편향-분산 트레이드오프)
시험 데이터의 오차를 구성하는 본질적인 요소인 편향(Bias)과 분산(Variance) 간의 복잡한 상관관계를 다룹니다.
모델의 유연성이 증가함에 따라 분산은 커지고 편향은 서서히 줄어드는 U자형 검증 곡선(U-Shape)을 수학적으로 탐구합니다.
2.2.3 The Classification Setting (분류 환경에서의 평가)
이산적인 클래스 결과를 예측해야 하는 모델 환경에서 성능을 비교하기 위한 비율 지표인 오분류율(Error Rate)을 도입합니다.
주어지는 데이터 공간 내에서 최적의 예측을 수행하여 최소 한계를 규정하는 베이즈 에러율(Bayes Error Rate)을 학습합니다.
2.2.1 Measuring the Quality of Fit (적합성 품질 측정)
회귀 환경에서 모형의 우수성을 평가할 때 가장 보편적으로 사용되는 척도인 평균 제곱 오차(MSE, Mean Squared Error)를 설명합니다. 단순히 학습 데이터만 잘 맞추는 것보다는 낯선 시험 데이터에도 좋은 성능을 발휘하는 일반화(Generalization)의 중요성을 강조합니다.
2.2.2 The Bias-Variance Trade-Off (편향-분산 트레이드오프)
시험 데이터의 오차를 구성하는 본질적인 요소인 편향(Bias)과 분산(Variance) 간의 복잡한 상관관계를 다룹니다. 모델의 유연성이 증가함에 따라 분산은 커지고 편향은 서서히 줄어드는 U자형 검증 곡선(U-Shape)을 수학적으로 탐구합니다.
2.2.3 The Classification Setting (분류 환경에서의 평가)
이산적인 클래스 결과를 예측해야 하는 모델 환경에서 성능을 비교하기 위한 비율 지표인 오분류율(Error Rate)을 도입합니다. 주어지는 데이터 공간 내에서 최적의 예측을 수행하여 최소 한계를 규정하는 베이즈 에러율(Bayes Error Rate)을 학습합니다.
Sub-Chapters (하위 목차)
| < 2.1.5 Regression Versus Classification Problems | 2.2.1 Measuring The Quality Of Fit > |