반도체 Engineer의 Python | 반복 분석과 시각화
Python은 반복되는 데이터 정리·통계·시각화를 코드로 재현하는 데 활용됩니다. Lot·Wafer·Step·단위·누락·중복의 정의가 자동화보다 먼저입니다.
추천 읽기 순서용어사전어디까지 알아야 하나요?관련 직무
3줄 요약
- Python은 반복되는 데이터 정리·통계·시각화를 코드로 재현하는 데 활용됩니다.
- Lot·Wafer·Step·단위·누락·중복의 정의가 자동화보다 먼저입니다.
- 코드가 실행됐다는 사실은 데이터와 결론이 맞다는 보장이 아닙니다.
이 페이지 목차
쉬운 설명: 같은 질문을 여러 Lot에 반복하기핵심 원리: 입력과 검증부터여러 표를 연결할 때왜 중요한가: 반복과 추적 가능성현업 연결: 시각화에서 가설 검증으로자주 하는 오해공개 참고 자료쉬운 설명: 같은 질문을 여러 Lot에 반복하기
매주 여러 Lot의 CD Trend를 비교한다면 수작업 복사 대신 같은 분석을 코드로 실행할 수 있습니다. Python은 Data Cleaning·집계·시각화·통계를 재현하는 도구입니다. 어떤 값을 비교하는지 정의하지 않고 자동화하면 같은 실수를 더 빠르게 반복할 수 있습니다.
핵심 원리: 입력과 검증부터
한 행이 측정점인지 Wafer인지, 단위·Step·시간·결측·중복을 먼저 확인합니다. 교육용 CSV는 lot_id, wafer_id, step, site, cd_nm 열을 가진 가상의 자료입니다. 다음 pandas 예는 같은 Step에서 Wafer별 평균·산포·유효 개수를 집계합니다. 실제 데이터는 포함하지 않습니다.
import pandas as pd
data = pd.read_csv('demo_cd.csv')
data['cd_nm'] = pd.to_numeric(data['cd_nm'], errors='coerce')
selected = data.loc[data['step'].eq('AFTER_ETCH')]
wafer_stats = selected.groupby(['lot_id', 'wafer_id'])['cd_nm'].agg(
mean='mean', std='std', count='count'
)
print(wafer_stats)
숫자로 바꿀 수 없던 값은 결측으로 남으며 유효 개수와 제외 원인을 확인합니다. 측정점 하나인 그룹은 표본 표준편차가 정의되지 않을 수 있습니다. 실행 성공과 데이터 품질은 별도 검증입니다.
여러 표를 연결할 때
SQL이나 CSV로 가져온 장비 이력을 붙일 때 키·Step·시간 관계를 확인합니다. pandas merge의 관계 검증 같은 기능은 예상하지 않은 중복을 발견하는 데 도움이 됩니다. 누락 행과 행 수·고유 키 수를 비교하며 무조건 중복을 삭제하지 않습니다.
왜 중요한가: 반복과 추적 가능성
동일한 코드로 Lot별 Trend·분포·Wafer Map 입력을 정리할 수 있습니다. 원본·코드·필터·환경·출력 시점을 남겨 분석을 재현합니다. 결과 이미지 하나보다 어떤 데이터를 어떻게 집계했는지 설명하는 것이 Engineer 업무에 중요합니다.
현업 연결: 시각화에서 가설 검증으로
Wafer별 CD 변화와 Chamber 이력을 비교하고 분포·산포·공통 변화점을 찾습니다. Correlation은 가설의 단서이며 인과를 보장하지 않습니다. SPC와 DOE는 데이터 해석과 검증의 후속 학습입니다. 이 글은 Firmware·System SW 전체를 설명하는 트랙이 아닙니다.
자주 하는 오해
결측을 0으로 바꾸거나 제품이 다른 Lot를 한 평균으로 묶으면 결과가 왜곡될 수 있습니다. 보기 좋은 그래프와 높은 상관이 정답을 뜻하지 않습니다. 데이터 정의와 분석 가정을 먼저 검토하고 자동화 효과는 그 다음에 평가합니다.
공개 참고 자료
개념 확인: 2026-10-06. 공개 자료로 원리를 확인하고 학생용 설명·가상 예·연습문제는 FlashMemory가 작성했습니다. 회사 내부 Recipe나 Spec을 사용하지 않습니다.
어디까지 알아야 하나요?
아래는 반도체 Engineer의 Python | 반복 분석과 시각화의 학습 목표입니다. 직무별 모듈에서 필요한 수준을 함께 확인하세요. 회사의 공식 평가 기준이나 합격 기준은 아닙니다.
설명할 수 있어야 합니다
자동화의 목적과 범위 설명
설명할 수 있어야 합니다
Data Cleaning과 검증 구분
생각해볼 수 있어야 합니다
Wafer 평균과 전체 측정점 평균 구분
더 깊게 연결해보세요
코드·입력·결과의 재현성
이 기술을 이해했나요?
공통 기초 · Python은 반도체 Engineer에게 왜 필요한가요?
여러 Lot의 같은 분석을 반복하고 정리·시각화·통계를 재현할 수 있습니다. 복잡한 SW 개발 자체가 이 트랙의 목표는 아닙니다.
직무 핵심 · 빈 값을 모두 0으로 바꿔도 되나요?
결측과 실제 0은 다릅니다. 원인·의미·제외 기준을 기록하고 표본 변화와 결과 영향을 확인합니다.
실무 연결 · groupby 결과 한 줄이 무엇을 뜻하나요?
그룹 키에 따라 Wafer·Lot·장비별 요약이 됩니다. 측정점 수와 단위, 시간·Step을 맞춰 해석해야 합니다.
심화 · 자동으로 그린 Correlation이 원인을 알려주나요?
상관은 가설의 단서입니다. 데이터 연결·공통 원인·시간 추세와 실험 검증을 확인하며 코드·입력·환경을 기록합니다.