# Vision-Language Models Projects at AI Tinkerers

> Canonical HTML: https://aitinkerers.org/technologies/vision-language-models
> Markdown URL: https://aitinkerers.org/technologies/vision-language-models.md
> Technology record last updated: 2026-04-26T05:24:42Z
> Generated: 2026-09-23T02:27:07Z

Multimodal AI systems that seamlessly fuse computer vision and natural language processing, enabling models to 'see' and 'reason' about visual data using text.

Vision-Language Models (VLMs) are multimodal AI architectures that integrate a vision encoder (e.g., ViT, CLIP) and a language model (e.g., LLaMA, GPT) via an alignment layer. This setup allows them to jointly process and understand both image and text inputs, bridging the gap between pixels and semantic meaning. Key applications include Visual Question Answering (VQA), sophisticated image captioning, and object grounding. State-of-the-art models like LLaVA and Qwen3-VL demonstrate robust zero-shot capabilities, executing complex tasks by simply following natural language instructions.

- Official technology site: https://www.encord.com/blog/guide-to-vision-language-models-vlms/
- Public AI Tinkerers demos and talks: 1
- Result page: 1 of 1

## Recent Public Talks and Demos

### [Applying 4o Vision Finetuning to Chemistry Diagrams](https://singapore.aitinkerers.org/talks/rsvp_7w9joR3W_oI)

The task is to extract student's attempts for chemistry diagram questions. These diagrams are a graph with nodes and edges. Using VLLMs out of the box often results in the model correcting the chemistry equations or missing key notation. Here we explore Vision Finetuning, and see how far we can go with less than 10 hand-labelled examples. Kuang Wen and I will show the data we have, the augmentation techniques, and our current demo app comparing finetuned with non-finetuned.

- Event context: AI Tinkerers Singapore: 3rd Meetup - November 19th, 2024 — 2024-11-19 — Singapore
- Public talk page: https://singapore.aitinkerers.org/talks/rsvp_7w9joR3W_oI

## Related Technologies

- [ABBYY FineReader](https://aitinkerers.org/technologies/abbyy-finereader) ([Markdown](https://aitinkerers.org/technologies/abbyy-finereader.md)) — 3 public demos
- [Amazon Textract](https://aitinkerers.org/technologies/amazon-textract) ([Markdown](https://aitinkerers.org/technologies/amazon-textract.md)) — 5 public demos
- [Azure Computer Vision](https://aitinkerers.org/technologies/azure-computer-vision) ([Markdown](https://aitinkerers.org/technologies/azure-computer-vision.md)) — 1 public demo
- [BLIP](https://aitinkerers.org/technologies/blip) ([Markdown](https://aitinkerers.org/technologies/blip.md)) — 4 public demos
- [BLIP-2](https://aitinkerers.org/technologies/blip-2) ([Markdown](https://aitinkerers.org/technologies/blip-2.md)) — 3 public demos
- [CLIP](https://aitinkerers.org/technologies/clip) ([Markdown](https://aitinkerers.org/technologies/clip.md)) — 10 public demos
- [Data Augmentation](https://aitinkerers.org/technologies/data-augmentation) ([Markdown](https://aitinkerers.org/technologies/data-augmentation.md)) — 1 public demo
- [Demo App](https://aitinkerers.org/technologies/demo-app) ([Markdown](https://aitinkerers.org/technologies/demo-app.md)) — 1 public demo
- [Flamingo](https://aitinkerers.org/technologies/flamingo) ([Markdown](https://aitinkerers.org/technologies/flamingo.md)) — 3 public demos
- [Google Cloud Vision API](https://aitinkerers.org/technologies/google-cloud-vision-api) ([Markdown](https://aitinkerers.org/technologies/google-cloud-vision-api.md)) — 1 public demo
- [Image Structured Extraction](https://aitinkerers.org/technologies/image-structured-extraction) ([Markdown](https://aitinkerers.org/technologies/image-structured-extraction.md)) — 1 public demo
- [LXMERT](https://aitinkerers.org/technologies/lxmert) ([Markdown](https://aitinkerers.org/technologies/lxmert.md)) — 4 public demos
- [OpenCV](https://aitinkerers.org/technologies/opencv) ([Markdown](https://aitinkerers.org/technologies/opencv.md)) — 26 public demos
- [PaddleOCR](https://aitinkerers.org/technologies/paddleocr) ([Markdown](https://aitinkerers.org/technologies/paddleocr.md)) — 2 public demos
- [Tesseract](https://aitinkerers.org/technologies/tesseract) ([Markdown](https://aitinkerers.org/technologies/tesseract.md)) — 3 public demos
- [UNITER](https://aitinkerers.org/technologies/uniter) ([Markdown](https://aitinkerers.org/technologies/uniter.md)) — 3 public demos
- [ViLBERT](https://aitinkerers.org/technologies/vilbert) ([Markdown](https://aitinkerers.org/technologies/vilbert.md)) — 4 public demos
- [Vision Fine-Tuning](https://aitinkerers.org/technologies/vision-fine-tuning) ([Markdown](https://aitinkerers.org/technologies/vision-fine-tuning.md)) — 1 public demo
