이미지·영상·음성47개

AI가 사진 속 물체를 알아보고, 사람의 자세를 잡아내고, 말을 글로 바꾸는 원리예요. CNN, 객체 인식, 세그멘테이션, 포즈 추정, TTS, STT처럼 웹캠과 마이크로 직접 체험할 수 있는 개념이 많아요.

난이도
가우시안 스플래팅Gaussian Splatting

색 얼룩 수백만 개로 담아 둔 3D 장면

생성형 심화
객체 인식Object Detection

사진 속 물건마다 찾아 네모를 치는 일

입문
객체 추적Object Tracking

같은 대상에 같은 번호를 계속 붙여 두는 일

기본
깊이 추정Depth Estimation

사진 한 장에서 멀고 가까움을 알아내는 일

기본
노이즈 제거Denoising

원본은 두고 섞여 든 잡티만 덜어 내는 일

생성형 기본
동작 인식Action Recognition

이어진 장면을 보고 무슨 동작인지 알아내기

기본
랜드마크Landmark

정해진 자리마다 번호가 매겨진 기준점

기본
립싱크Lip Sync

소리의 박자에 입 모양을 맞춰 붙이는 일

기본
모션 캡처Motion Capture

몸의 움직임을 점의 자리 기록으로 남기는 일

입문
바운딩 박스Bounding Box

물체를 감싸는 네모와 그 네모의 자리

입문
배경 제거Background Removal

사진에서 배경을 지우고 대상만 남기는 일

입문
보코더Vocoder

소리 설계도를 실제 파형으로 바꾸는 부분

심화
비전 트랜스포머Vision Transformer

사진을 조각으로 잘라 글처럼 다루는 구조

심화
세그멘테이션Segmentation

사진의 점 하나하나에 이름표를 붙이는 일

기본
소리 분류Sound Classification

짧은 소리 한 토막에 이름표 하나를 붙이는 일

입문
손 추적Hand Tracking

손의 마디 자리를 매 순간 이어서 따라가는 일

입문
스펙트로그램Spectrogram

소리를 눈으로 볼 수 있게 그린 그림

기본
신뢰도 점수Confidence Score

모델이 자기 답에 스스로 매긴 확신 숫자

입문
실시간 추론Real-Time Inference

매 순간 정해진 시간 안에 판단을 끝내는 일

기본
얼굴 검출Face Detection

사진 어디에 얼굴이 있는지 네모로 찾아내는 일

입문
얼굴 인식Face Recognition

얼굴을 견주어 누구인지 알아내는 일

입문
업스케일Upscaling

없던 세부를 만들어 채우며 그림을 키우는 일

생성형 입문
음성 복제Voice Cloning

짧은 녹음으로 남의 목소리를 흉내 내기

기본
음성 비서Voice Assistant

말로 불러 시키고 말로 답을 듣는 AI

활용 입문
음성 인식Speech Recognition

사람의 말소리를 글자로 옮겨 적는 기술

기초 입문
음악 생성Music Generation

주문 몇 줄로 곡을 만들어 내는 일

생성형 입문
음원 분리Source Separation

섞여 있는 소리를 갈래별로 나누기

기본
음정 검출Pitch Detection

소리의 높낮이를 짚어 내는 일

입문
이미지 분류Image Classification

사진 한 장에 이름표 하나를 붙이는 일

입문
이미지 캡셔닝Image Captioning

사진을 보고 그 내용을 문장으로 써 주는 일

생성형 기본
제스처 인식Gesture Recognition

손이나 몸의 동작을 정해진 뜻으로 읽는 일

입문
채색Colorization

흑백 그림에 어울리는 색을 입히는 일

생성형 입문
컴퓨터 비전Computer Vision

사진과 영상을 컴퓨터가 알아보게 하는 기술

기초 입문
키포인트Keypoint

이미지에서 위치를 콕 집어 표시해 둔 점

기본
특징 맵Feature Map

훑은 결과를 자리 그대로 늘어놓은 그림

심화
패턴 인식Pattern Recognition

되풀이되는 규칙을 알아보는 일

기초 입문
포즈 추정Pose Estimation

몸의 관절 자리를 점으로 찍어 자세를 알아내는 일

입문
풀링Pooling

구역마다 대표값만 남겨 그림을 줄이는 단계

기본
필터Filter / Kernel

무엇을 찾을지가 적혀 있는 작은 값 판

기본
합성곱Convolution

작은 판을 옮겨 가며 사진을 훑는 계산

기본
해상도Resolution

그림을 이루는 점의 개수

생성형 입문
화자 인식Speaker Recognition

목소리로 누가 말했는지 가려내는 일

기본
CNNConvolutional Neural Network

사진의 무늬를 층층이 찾아내는 신경망 구조

기본
NeRFNeural Radiance Field

자리와 방향을 물으면 빛을 답하는 3D 장면

생성형 심화
OCR

그림 속 글자를 읽어 문자로 바꾸는 일

입문
STTSpeech-to-Text

소리를 넣으면 글자가 나오는 변환

입문
TTSText-to-Speech

글을 넣으면 목소리로 읽어 주는 기술

입문