Visión y audio47
Cómo reconoce la IA objetos en fotos, sigue la postura del cuerpo y convierte la voz en texto. CNN, detección de objetos, segmentación, estimación de pose, TTS, STT: muchos se prueban con una simple webcam y un micrófono.
Una IA que se llama y responde con la voz
Captura de movimientoMotion CaptureGuardar el movimiento del cuerpo como un registro de posiciones
Clasificación de imágenesImage ClassificationPoner una sola etiqueta a una foto completa
Clasificación de sonidosSound ClassificationPonerle una etiqueta a un trozo corto de sonido
Clonación vocalVoice CloningImitar la voz de una persona a partir de una grabación breve
CNNConvolutional Neural NetworkLa red que encuentra patrones en fotos, capa por capa
ColoreadoColorizationPoner un color adecuado a una imagen en blanco y negro
ConvoluciónConvolutionEl cálculo que recorre la foto moviendo un panel pequeño
Cuadro delimitadorBounding BoxEl recuadro que envuelve un objeto y su posición exacta
Descripción de imágenesImage CaptioningMirar una foto y escribir su contenido en una frase
Detección de objetosObject DetectionEncontrar cada objeto de una foto y marcarlo con un recuadro
Detección de rostrosFace DetectionEncontrar con un cuadro dónde hay una cara en la foto
Detección de tonoPitch DetectionAveriguar qué tan aguda o grave es una nota
Eliminación de fondoBackground RemovalBorrar el fondo de una foto y dejar solo el objeto
Eliminación de ruidoDenoisingRetirar solo la mancha mezclada, dejando el original intacto
EscaladoUpscalingAgrandar una imagen inventando el detalle que no tenía
EspectrogramaSpectrogramEl dibujo que deja ver el sonido con los ojos
Estimación de posePose EstimationMarcar con puntos las articulaciones para descubrir la postura
Estimación de profundidadDepth EstimationAveriguar qué está cerca y qué lejos en una sola foto
FiltroFilter / KernelEl panel pequeño de números que dice qué buscar
Gaussian SplattingUna escena 3D guardada en millones de manchas de color
Generación de músicaMusic GenerationCrear una canción a partir de unas pocas líneas de petición
Inferencia en tiempo realReal-Time InferenceTerminar cada juicio dentro de un tiempo fijo, siempre
LandmarkPunto de referencia numerado que siempre marca el mismo lugar
Mapa de característicasFeature MapLa imagen que deja el resultado del recorrido en su lugar
NeRFNeural Radiance FieldUna escena en 3D que responde con luz a un lugar y una dirección
OCRLeer las letras de una imagen y convertirlas en texto
PoolingEl paso que reduce la imagen dejando solo un valor por zona
Punto claveKeypointPunto que marca con precisión una posición en la imagen
Puntuación de confianzaConfidence ScoreEl número de seguridad que el modelo se pone a su propia respuesta
Reconocimiento de accionesAction RecognitionVer una secuencia de cuadros para descubrir qué acción es
Reconocimiento de gestosGesture RecognitionLeer un movimiento de mano o cuerpo como un significado fijo
Reconocimiento de locutorSpeaker RecognitionDistinguir, por la voz, quién es la persona que habla
Reconocimiento de patronesPattern RecognitionReconocer las regularidades que se repiten
Reconocimiento de vozSpeech RecognitionLa tecnología que transcribe la voz humana en texto
Reconocimiento facialFace RecognitionComparar rostros para averiguar quién es esa persona
ResoluciónResolutionLa cantidad de puntos que forman una imagen
SegmentaciónSegmentationPoner una etiqueta a cada punto de la foto
Seguimiento de manosHand TrackingSeguir de un cuadro a otro el lugar de los nudillos de la mano
Seguimiento de objetosObject TrackingMantener el mismo número sobre el mismo objeto siempre
Separación de fuentesSource SeparationSeparar un sonido mezclado en sus distintas partes
Sincronización labialLip SyncAjustar la forma de la boca al ritmo del sonido
STTSpeech-to-TextLa conversión que recibe sonido y devuelve letras
TTSText-to-SpeechLa tecnología que lee un texto en voz alta
Visión por computadoraComputer VisionLa tecnología que hace que la computadora entienda fotos y videos
Vision TransformerLa estructura que corta la foto en trozos y los trata como texto
VocoderLa parte que convierte el plano del sonido en forma de onda real