전체 글 16

관리도의 통계적 개념

통계적 공정관리는 주된 목적은 공정에서 이상원인의 발생을 탐지하여 공정을 조사하고 이를 수정할 수 있도록 하는 것이다. 관리도는 이러한 통계적 공정관리에서 널리 사용되는 온라인 공정 모니터링의 한 방법이다. 통계적 공정관리의 최종 목표는 공정의 변동을 제거하는 것인데, 특히 우연원인과 이상원인 중 이상원인을 제거하는 것이 목표라고 볼 수 있다. 관리도의 핵심 요소는 다음과 같다:중심선(Center Line, CL): 통제 대상 특성의 평균값을 나타낸다. 이 선을 기준으로 공정의 성능을 평가한다.관리 상한선(Upper Control Limit, UCL): 공정 변동의 상한을 나타낸다. 측정값이 이 선을 넘어가면 공정이 통제되지 않고 있다는 신호일 수 있다.관리 하한선(Lower Control Limit, ..

Statistics 2024.10.14

Parametric, Non-parametric Method

Parametric(매개변수적) 방법과 Non-parametric(비매개변수적) 방법은 데이터를 분석하고 모델을 만드는 두 가지 주요 방식입니다.1. Parametric Method(매개변수적 방법)정의: Parametric 방법은 함수의 형태(모델)를 미리 가정하고, 데이터를 이용해 그 함수의 파라미터를 추정하는 방법입니다. 특징:모델 가정: 모델의 형태(예: 선형 회귀에서 직선)를 사전에 가정합니다.파라미터 추정: 주어진 데이터를 바탕으로 모델의 파라미터(예: 선형 회귀의 기울기와 절편)를 추정합니다.고정된 파라미터 수: 모델 복잡도는 데이터의 크기와 무관하게 고정된 파라미터 수로 결정됩니다.장점: 계산이 상대적으로 빠르고, 적은 데이터에서도 잘 동작합니다. 모델이 단순하기 때문에 해석이 용이합니다...

Statistics 2024.10.08

Colab과 Google Drive 환경에서 .zip.part 파일 병합 및 압축 해제

데이터를 다운받아서 다루다 보면 zip.part01203 이런식의 파일명을 접하게 될 때가 있다. Google Colab 상에서 이러한 파일들을 병합하고 압축을 해제해 데이터를 분석하는 방법을 간단히 정리해보았다. 일단 zip.part01203 이건 뭘 의미할까? 그냥 대강 설명하자면 zip 파일이 여러개의 part로 나뉘었다 정도로 생각하면 될 것이다. 파일을 잘 살펴보면 part0, part123123, part256 이런식으로 part0,1,2,,, 나뉘어져 있을 것이다. 이 파일을 csv파일등으로 전환하기 위해선 병합하고, 압축 해제하면 된다.  1. Google Drive 연결하기먼저 Colab과 Google Drive를 연결해야 한다. 아래 코드를 실행하면 Google Drive에 접근할 수 ..

Python 2024.10.08

왜도 (Skewness)

왜도 회귀분석에서 종속 변수 또는 독립 변수의 분포가 얼마나 비대칭인지를 나태는 통계적 척도. negative skewness 분포의 대칭성을 기준으로 왼쪽으로 치우침 positive skewness 분포의 대칭성을 기준으로 오른쪽으로 치우침 회귀 분석에서는 종속 변수의 왜도를 고려하는 것이 중요하다. 왜도가 존재하면 선형성 가정 위반 이 일어나거나 분석결과가 편향적으로 나올 수 있기 때문이다. 따라서 종속변수의 왜도가 큰 경우 변수변환을 사용하거나 , 비모수적 방법을 이용해 회귀 모델을 구축한다.

Dropout

드롭아웃(Dropout)은 신경망의 과적합을 방지하기 위한 정규화 기법 중 하나이다. 서로 연결된 연결망에서 랜덤하게 선택된 일부 뉴런을 제외시키는 것이다. 각 뉴런은 일정 확률로 드롭아웃되어 해당 뉴런의 출력이 무시된다. 이를 통해 특정 뉴런에만 의존하는 것을 방지하고 다양한 특징을 학습할 수 있게 된다. 드롭아웃은 일반적으로 합성곱 신경망 (CNN) 이나 완전 연결 신경망 (Fully Connected Neural Network) 같은 심층 신경망에 많이 사용된다. 이를 통해 모델의 일반화 성능을 향상시키고 과적합을 줄일 수 있다. 드롭아웃은 훈련 단계에서만 적용되며 훈련시에는 드롭아웃으로 생성된 다양한 부분 집합들을 이용하여 각각의 네트워크를 학습하고 테스트나 예측시에는 전체 네트워크를 사용하여 결..

Deep Learning 2023.06.07

솔리디티의 기본 자료형

솔리디티는 스마트 컨트랙트에 최적화된 자료형을 지원. 1. 변수 선언 자료형 변수명 = 데이터; type name = data; # 변수 선언 시 데이터는 생략할 수 있지만, 자료형과 변수명은 필수적으로 명시해야 한다. # 'constant' 키워드를 붙여 상수로 선언할 수 있다. 이때는 데이터를 반드시 넣어주어야 한다. 2. 변수의 유형 1) 상태 변수 (State variable) -함수 외부에서 선언된 변수로 블록체인에 값이 영구적으로 저장된다. 2) 지역 변수 (Local variable) -함수 내부에서 선언된 변수로 블록체인에 값이 영속적으로 저장되지 않는다. 3) 특수 전역 변수 (Special global variable) -블록체인과 관련된 정보를 제공하기 위해 내장된 변수 3. 자료형의..

중회귀모형의 분산분석표(ANOVA table)

중회귀모형의 분산분석표(ANOVA table) 목차 ANOVA table in R ANOVA table의 구성요소 결론 ANOVA table in R lmF) 1 29 4297 2 23 1149 6 3148 10.502 1.24e-05 *** ANOVA table의 구성요소 총제곱합(Total Sum of Squares, SST) 각 관측값에서 종속변수의 평균값(y_bar)을 뺀 차이의 제곱을 모두 더한 값으로 계산됩니다. SST = Σ(yi - y_bar)^2 모형제곱합(Model Sum of Squares, SSM) 중회귀모형이 설명할 수 있는 변동을 계산합니다. 즉, 각각의 설명변수가 종속변수와 연관이 있는지를 판단하는데 사용됩니다. SSM = Σ(중회귀모형으로 예측된 y값 - y_bar)^2 잔차..