Home

Writing

All posts

Engineering Sub-Second Voice AI: Inside Cogniva

How we cut response latency from 2.8s to 850ms in a voice-first AI learning platform using OpenAI streaming, Vapi, and WebSocket callbacks.

Voice AIOpenAIVapiReactTypeScript
Mar 2026

Building GitIntellect: Semantic Codebase RAG with Gemini & pgvector

How we built a codebase AI engine using AST chunking, Gemini embeddings, and PostgreSQL pgvector for sub-200ms semantic code retrieval.

RAGPostgreSQLpgvectorGeminiNext.js
Feb 2026