Md. Asif Uddin

Book II

Vision

ViT, DINOv2, self-supervised visual representation

Explain how a machine represents and interprets visual information, from pixels to self-supervised representations.

7 chapters0 propositions written

  1. Chapter IImages as DataWhat a picture is once it is a tensor.Pixels · Channels · RGB · Resolution · Normalisation · Convolution · Receptive fieldsnot yet written
  2. Chapter IIConvolutional VisionThe architecture that made vision work.Kernels · Convolution · Padding · Stride · Pooling · Feature maps · LeNet · AlexNet · VGG · ResNet · EfficientNetnot yet written
  3. Chapter IIIRepresentation LearningWhat a network learns before it learns your task.Low-level features · Hierarchical features · Transfer learning · Pretrained representations · Self-supervised learningnot yet written
  4. Chapter IVVision TransformersPatches as tokens.Image patches · Patch embeddings · Positional information · ViT · Hierarchical transformers · Swin Transformernot yet written
  5. Chapter VSelf-Supervised VisionLearning without labels.Contrastive learning · Positive and negative pairs · Augmentations · Siamese learning · Masked image modelling · DINO · DINOv2not yet written
  6. Chapter VIVision TasksOne image, many questions.Classification · Detection · Segmentation · Depth · Retrievalnot yet written
  7. Chapter VIIMedical and Scientific VisionWhere a wrong answer has consequences.Medical imaging · CT · MRI · X-ray · Fundus imaging · Segmentation · Domain shift · Sensitivity and specificity · AUROC · Calibrationnot yet written