# Vision models Projects at AI Tinkerers

> Canonical HTML: https://aitinkerers.org/technologies/vision-models
> Markdown URL: https://aitinkerers.org/technologies/vision-models.md
> Technology record last updated: 2026-06-15T07:49:33Z
> Generated: 2026-09-23T01:36:38Z

AI systems engineered to interpret visual data (images, video), replicating human perception for automated analysis.

Vision models are deep learning architectures (CNNs, Vision Transformers) trained on massive datasets to enable machines to "see" and understand visual information. They power critical applications: object detection (YOLOv8), image classification (ResNet), and complex segmentation (SAM 2). These models extract meaningful features—like object identity and location—to automate tasks in autonomous vehicles, medical diagnostics, and real-time surveillance.

- Official technology site: https://en.wikipedia.org/wiki/Computer_vision
- Public AI Tinkerers demos and talks: 1
- Result page: 1 of 1

## Recent Public Talks and Demos

### [YT shorts finder](https://austin.aitinkerers.org/talks/rsvp_TpbSnDWuX0s)

A way to extract meaning from youtube shorts and search over your personalized database of them, using a mix of vision models, speech transcription models, and general purpose LLMs

- Event context: Community AI Demos - September Edition — 2024-09-12 — Austin
- Public talk page: https://austin.aitinkerers.org/talks/rsvp_TpbSnDWuX0s

## Related Technologies

- [Amazon Transcribe](https://aitinkerers.org/technologies/amazon-transcribe) ([Markdown](https://aitinkerers.org/technologies/amazon-transcribe.md)) — 2 public demos
- [BERT](https://aitinkerers.org/technologies/bert) ([Markdown](https://aitinkerers.org/technologies/bert.md)) — 179 public demos
- [BLOOM](https://aitinkerers.org/technologies/bloom) ([Markdown](https://aitinkerers.org/technologies/bloom.md)) — 115 public demos
- [CMU Sphinx](https://aitinkerers.org/technologies/cmu-sphinx) ([Markdown](https://aitinkerers.org/technologies/cmu-sphinx.md)) — 2 public demos
- [Database](https://aitinkerers.org/technologies/database) ([Markdown](https://aitinkerers.org/technologies/database.md)) — 8 public demos
- [DeepSpeech](https://aitinkerers.org/technologies/deepspeech) ([Markdown](https://aitinkerers.org/technologies/deepspeech.md)) — 1 public demo
- [Google Cloud Speech-to-Text](https://aitinkerers.org/technologies/google-cloud-speech-to-text) ([Markdown](https://aitinkerers.org/technologies/google-cloud-speech-to-text.md)) — 2 public demos
- [GPT-3](https://aitinkerers.org/technologies/gpt-3) ([Markdown](https://aitinkerers.org/technologies/gpt-3.md)) — 191 public demos
- [GPT-4](https://aitinkerers.org/technologies/gpt-4) ([Markdown](https://aitinkerers.org/technologies/gpt-4.md)) — 529 public demos
- [IBM Watson Speech to Text](https://aitinkerers.org/technologies/ibm-watson-speech-to-text) ([Markdown](https://aitinkerers.org/technologies/ibm-watson-speech-to-text.md)) — 2 public demos
- [Kaldi](https://aitinkerers.org/technologies/kaldi) ([Markdown](https://aitinkerers.org/technologies/kaldi.md)) — 2 public demos
- [Llama-2](https://aitinkerers.org/technologies/llama-2) ([Markdown](https://aitinkerers.org/technologies/llama-2.md)) — 227 public demos
- [PaLM 2](https://aitinkerers.org/technologies/palm-2) ([Markdown](https://aitinkerers.org/technologies/palm-2.md)) — 116 public demos
- [RoBERTa](https://aitinkerers.org/technologies/roberta) ([Markdown](https://aitinkerers.org/technologies/roberta.md)) — 118 public demos
- [wav2vec 2](https://aitinkerers.org/technologies/wav2vec-2) ([Markdown](https://aitinkerers.org/technologies/wav2vec-2.md)) — 2 public demos
- [Whisper](https://aitinkerers.org/technologies/whisper) ([Markdown](https://aitinkerers.org/technologies/whisper.md)) — 26 public demos
- [YouTube Shorts](https://aitinkerers.org/technologies/youtube-shorts) ([Markdown](https://aitinkerers.org/technologies/youtube-shorts.md)) — 1 public demo
