반도체 Engineer의 Python | 반복 분석과 시각화

Python은 반복되는 데이터 정리·통계·시각화를 코드로 재현하는 데 활용됩니다. Lot·Wafer·Step·단위·누락·중복의 정의가 자동화보다 먼저입니다.

기초 · 직무 연결 · 업데이트 2026-10-06

3줄 요약

  • Python은 반복되는 데이터 정리·통계·시각화를 코드로 재현하는 데 활용됩니다.
  • Lot·Wafer·Step·단위·누락·중복의 정의가 자동화보다 먼저입니다.
  • 코드가 실행됐다는 사실은 데이터와 결론이 맞다는 보장이 아닙니다.
이 페이지 목차쉬운 설명: 같은 질문을 여러 Lot에 반복하기핵심 원리: 입력과 검증부터여러 표를 연결할 때왜 중요한가: 반복과 추적 가능성현업 연결: 시각화에서 가설 검증으로자주 하는 오해공개 참고 자료

쉬운 설명: 같은 질문을 여러 Lot에 반복하기

매주 여러 Lot의 CD Trend를 비교한다면 수작업 복사 대신 같은 분석을 코드로 실행할 수 있습니다. Python은 Data Cleaning·집계·시각화·통계를 재현하는 도구입니다. 어떤 값을 비교하는지 정의하지 않고 자동화하면 같은 실수를 더 빠르게 반복할 수 있습니다.

핵심 원리: 입력과 검증부터

한 행이 측정점인지 Wafer인지, 단위·Step·시간·결측·중복을 먼저 확인합니다. 교육용 CSV는 lot_id, wafer_id, step, site, cd_nm 열을 가진 가상의 자료입니다. 다음 pandas 예는 같은 Step에서 Wafer별 평균·산포·유효 개수를 집계합니다. 실제 데이터는 포함하지 않습니다.

import pandas as pd

data = pd.read_csv('demo_cd.csv')
data['cd_nm'] = pd.to_numeric(data['cd_nm'], errors='coerce')
selected = data.loc[data['step'].eq('AFTER_ETCH')]
wafer_stats = selected.groupby(['lot_id', 'wafer_id'])['cd_nm'].agg(
    mean='mean', std='std', count='count'
)
print(wafer_stats)

숫자로 바꿀 수 없던 값은 결측으로 남으며 유효 개수와 제외 원인을 확인합니다. 측정점 하나인 그룹은 표본 표준편차가 정의되지 않을 수 있습니다. 실행 성공과 데이터 품질은 별도 검증입니다.

여러 표를 연결할 때

SQL이나 CSV로 가져온 장비 이력을 붙일 때 키·Step·시간 관계를 확인합니다. pandas merge의 관계 검증 같은 기능은 예상하지 않은 중복을 발견하는 데 도움이 됩니다. 누락 행과 행 수·고유 키 수를 비교하며 무조건 중복을 삭제하지 않습니다.

왜 중요한가: 반복과 추적 가능성

동일한 코드로 Lot별 Trend·분포·Wafer Map 입력을 정리할 수 있습니다. 원본·코드·필터·환경·출력 시점을 남겨 분석을 재현합니다. 결과 이미지 하나보다 어떤 데이터를 어떻게 집계했는지 설명하는 것이 Engineer 업무에 중요합니다.

현업 연결: 시각화에서 가설 검증으로

Wafer별 CD 변화와 Chamber 이력을 비교하고 분포·산포·공통 변화점을 찾습니다. Correlation은 가설의 단서이며 인과를 보장하지 않습니다. SPC와 DOE는 데이터 해석과 검증의 후속 학습입니다. 이 글은 Firmware·System SW 전체를 설명하는 트랙이 아닙니다.

자주 하는 오해

결측을 0으로 바꾸거나 제품이 다른 Lot를 한 평균으로 묶으면 결과가 왜곡될 수 있습니다. 보기 좋은 그래프와 높은 상관이 정답을 뜻하지 않습니다. 데이터 정의와 분석 가정을 먼저 검토하고 자동화 효과는 그 다음에 평가합니다.

공개 참고 자료

개념 확인: 2026-10-06. 공개 자료로 원리를 확인하고 학생용 설명·가상 예·연습문제는 FlashMemory가 작성했습니다. 회사 내부 Recipe나 Spec을 사용하지 않습니다.

LEARNING DEPTH

어디까지 알아야 하나요?

아래는 반도체 Engineer의 Python | 반복 분석과 시각화의 학습 목표입니다. 직무별 모듈에서 필요한 수준을 함께 확인하세요. 회사의 공식 평가 기준이나 합격 기준은 아닙니다.

LEVEL 1 · 공통 기초

설명할 수 있어야 합니다

자동화의 목적과 범위 설명

LEVEL 2 · 직무 핵심

설명할 수 있어야 합니다

Data Cleaning과 검증 구분

LEVEL 3 · 실무 연결

생각해볼 수 있어야 합니다

Wafer 평균과 전체 측정점 평균 구분

LEVEL 4 · 심화

더 깊게 연결해보세요

코드·입력·결과의 재현성

이 기술을 이해했나요?

FlashMemory 자체 연습문제입니다. 먼저 본인의 말로 설명한 뒤 답변 방향을 확인하세요. 심화 목표의 상세 전문 글은 순차적으로 보강합니다.

공통 기초 · Python은 반도체 Engineer에게 왜 필요한가요?

여러 Lot의 같은 분석을 반복하고 정리·시각화·통계를 재현할 수 있습니다. 복잡한 SW 개발 자체가 이 트랙의 목표는 아닙니다.

직무 핵심 · 빈 값을 모두 0으로 바꿔도 되나요?

결측과 실제 0은 다릅니다. 원인·의미·제외 기준을 기록하고 표본 변화와 결과 영향을 확인합니다.

실무 연결 · groupby 결과 한 줄이 무엇을 뜻하나요?

그룹 키에 따라 Wafer·Lot·장비별 요약이 됩니다. 측정점 수와 단위, 시간·Step을 맞춰 해석해야 합니다.

심화 · 자동으로 그린 Correlation이 원인을 알려주나요?

상관은 가설의 단서입니다. 데이터 연결·공통 원인·시간 추세와 실험 검증을 확인하며 코드·입력·환경을 기록합니다.

연결해서 공부하기

다음으로 무엇을 공부할까요?

먼저 필요한 개념과 이어서 읽을 기술을 연결했습니다. 실제 제조 순서가 아니라 학습을 돕는 제안입니다.

전체 학습 로드맵에서 다음 단계 선택하기 →

면접 키워드와 연결하기

자료 구분과 출처를 확인하고, 학습 질문에 본인의 말로 답해보세요.

관련 기술