# Raj Chhapariya — Complete Engineering Context (llms-full.txt) > Comprehensive, verified technical context for Raj Chhapariya, an AI / Data Engineer based in Bengaluru, India. > This file is automatically generated from the portfolio's verified single-source-of-truth data models. --- ## 1. Identity & Overview - **Full Name**: Raj Chhapariya - **Professional Role**: AI / Data Engineer - **Location**: Bengaluru, India (UTC+5:30) - **Canonical Website**: https://rajchhapariya.space - **Contact Email**: rajchhapariya8@gmail.com - **Verified GitHub**: https://github.com/Rajchhapariya - **Verified LinkedIn**: https://www.linkedin.com/in/raj-chhapariya-63aa86201/ - **Verified Twitter / X**: https://x.com/raj_chhapariya - **Availability**: Available for AI / Data Engineering roles, data platform engineering, and technical collaborations. ### Professional Biography Raj Chhapariya is an AI / Data Engineer based in Bengaluru, India, focused on building reliable data pipelines, in-process analytical engines, and evaluated LLM systems. His background spans Python, SQL, JavaScript, and TypeScript, with practical experience designing deterministic query guardrails and assessing LLM outputs for groundedness and citation faithfulness. Full-stack and backend development serve as supporting capabilities that allow him to take data systems from concept to production-ready interfaces. ### Core Operating Principles 1. **Accuracy and Grounding**: AI and analytical tools must verify outputs against underlying data and provide transparent citations. 2. **Safety by Architecture**: Restrict execution privileges (such as read-only SQL) rather than relying on unconstrained code execution. 3. **Clarity and Maintainability**: Write clear, modular code with structured Pydantic and TypeScript validation contracts. --- ## 2. Education & Credentials ### Education - **Degree**: Bachelor of Technology (B.Tech) - **Major**: Information Technology - **Institution**: Dr. A.P.J. Abdul Kalam Technical University - **Timeline**: 2020 – 2024 ### Certifications - **Google Data Analytics Professional Certificate**: Coursera (Issued May 2023) - **Cloud Computing Certification**: Honeywell Student Empowerment Program, Grade A (Issued Oct 2023) --- ## 3. Verified Technical Competencies - **Core Data & Machine Learning**: Python, SQL, DuckDB, Pandas, NumPy, Scikit-learn, XGBoost - **AI & LLM Systems**: RAG Systems, OpenAI API, Rank-BM25, Pydantic, Prompt & Output Evaluation, Reciprocal Rank Fusion (RRF) - **Databases & Storage**: PostgreSQL, Supabase, MongoDB, Redis, REST APIs, Firebase - **Supporting Full-Stack**: TypeScript, JavaScript, Next.js (App Router, Server Components), React, Node.js, Streamlit - **Tools & Analytics**: Git, GitHub, Plotly, Power BI, Matplotlib, Seaborn - **Languages & Mobile**: Python, SQL, TypeScript, Java, Kotlin, Android Studio --- ## 4. Verified Project Case Studies ### 4.1. Agentic RAG Knowledge Assistant - **URL**: https://rajchhapariya.space/projects/agentic-rag-assistant - **Repository**: https://github.com/Rajchhapariya/Agentic-RAG-Knowledge-Assistant - **Status**: Open Source - **Role**: AI / Data Engineer (Aug 2026 – Present) - **Tech Stack**: Python, OpenAI API, Rank-BM25, NumPy, Pydantic, Streamlit - **Problem Formulation**: Standard feed-forward RAG architectures retrieve top-k chunks and immediately generate answers without verifying factual sufficiency. When queries are out-of-scope or contain false premises, naive generators fabricate plausible answers from parametric memory. - **System Solution**: Built a closed-loop Agentic RAG pipeline in Python combining dense vector search and BM25 keyword matching via Reciprocal Rank Fusion (RRF, k=60). Implemented an explicit Evidence Auditor for atomic claim verification and dynamic PDF ingestion with SHA-256 Content-Addressable Storage (CAS) vector caching. - **Architecture Pipeline**: User Query → Query Planner (decomposition) → Hybrid RRF Retriever (BM25 + NumPy dense similarity) → Evidence Auditor (atomic claim verification & gap diagnosis) → Grounded Generator (GPT-4o-mini restricted to evidence) → Grounded Answer with citations or structured refusal. - **Measured Evaluation Results**: - Unanswerable Hallucination Rate: 0.0% (0/4 hallucinations on adversarial unanswerable questions vs 4/4 for baseline) - True Refusal Rate: 100.0% (correctly refused all 4 out-of-scope test questions) - Answer Accuracy: 45.8% on 24 answerable test questions under conservative evidence gating - Automated Test Suite: 87 passing unit & integration tests running with mocked API fixtures (0 external token cost) - Citation Precision: 55.2%, Evidence Recall: 52.1% across 64-question benchmark (32 Dev / 32 Held-Out Test) - **Limitations**: - Auditing loop latency overhead (~17.7s avg for full agentic loop vs ~1.86s for single-pass baseline). - Conservative evidence thresholds produce higher false refusal rates (12.5%) on questions with sparse source documentation. ### 4.2. AI Data Analyst Agent - **URL**: https://rajchhapariya.space/projects/ai-data-analyst - **Repository**: https://github.com/Rajchhapariya/AI-Data-Analyst-Agent - **Status**: Open Source - **Role**: AI / Data Engineer (Aug 2026 – Present) - **Tech Stack**: Python, DuckDB, Plotly, Streamlit, Pydantic, Pandas - **Problem Formulation**: Commercial LLM data analysis demos often prompt models to write and execute arbitrary Python code via exec(), exposing severe security vulnerabilities (RCE), non-deterministic crashes, and unverified numerical claims in narrative summaries. - **System Solution**: Engineered an interactive analytics agent utilizing 4 constrained deterministic tools (query_data, plot_chart, summary_stats, clarify), an AST SQL filter with 33 disallowed keywords, an automated dataset profiler, and a post-synthesis Numerical Faithfulness Guard verifying cited numbers within 5% tolerance. - **Architecture Pipeline**: Custom CSV Upload / Superstore Sales (7,500 rows) → Dataset Profiler (schema & temporal reference anchors) → LLM Agent Router (selects 1 of 4 tools with structured Pydantic parameters) → DuckDB Read-Only OLAP (capped at 500 rows) → Response Synthesizer & Numerical Faithfulness Guard → Inspectable Report with Plotly charts and AgentTrace telemetry. - **Measured Evaluation Results**: - Tool Selection Accuracy: 100.0% (20 / 20 correct routing decisions on ground-truth benchmark) - Execution Success Rate: 100.0% (20 / 20 queries executed without runtime crashes or syntax errors) - Answer Correctness: 85.0% (17 / 20 value-level correctness across complex aggregations and edge cases) - Average Single-Turn Latency: 4,142 ms (compared to ~12s for iterative code-fix loops) - Numerical Faithfulness: 80% on 20-question ground-truth benchmark - **Limitations**: - Multi-hop compound questions requiring chained operations must execute as single flattened SQL queries or trigger clarification. - In-memory DuckDB dataset processing is bounded by available system RAM for large CSV files. ### 4.3. Resume Roaster - **URL**: https://rajchhapariya.space/projects/resume-roaster - **Live Application**: https://www.atsroast.com/ - **Status**: Live Production SaaS (Proprietary Codebase) - **Role**: Founder & Full-Stack Developer (Jul 2026 – Present) - **Tech Stack**: Next.js 15, TypeScript, Supabase (PostgreSQL, RLS), OpenAI API (GPT-4o), Tailwind CSS, Razorpay - **Problem Formulation**: Job seekers frequently encounter resume parsing failures in Applicant Tracking Systems (ATS) due to non-standard spatial layouts, repetitive action verbs, and unquantified bullet accomplishments. - **System Solution**: Built a full-stack platform leveraging Next.js 15 App Router, TypeScript, Supabase, OpenAI API structured JSON schemas, Razorpay payments, Brevo transactional emails, and Vercel Cron orchestrator. Features instant client-side heuristic strength scoring, zero-duplicate action verb rewriting, and ATS-safe PDF generation. - **Architecture Pipeline**: User Upload PDF → Spatial Text Parser → Client-Side Heuristic Scoring → Server Action Quota Validation → GPT-4o Zero-Duplicate Verb Rewriter → ATS-Safe PDF Builder (@react-pdf/renderer) → Nightly Vercel Cron (storage bucket cleanup, trending skills analysis, Telegram metrics alerts). - **Production Capabilities**: - Spatial PDF Parser, Zero-Duplicate Bullet Rewriter, Cover Letter Generator, Declarative PDF Builder - Deployed and actively accessible at atsroast.com - **Limitations**: - Spatial text extraction with pdf-parse is limited on complex multi-column graphic resumes with embedded canvas elements. - API rate limits on LLM generation require strict user quota management in Supabase. ### 4.4. Satta Darshan - **URL**: https://rajchhapariya.space/projects/satta-darshan - **Repository**: https://github.com/Rajchhapariya/SattaDarshan - **Status**: Open Source - **Role**: Data & Full-Stack Engineer (Apr 2026 – Jul 2026) - **Tech Stack**: Next.js, TypeScript, MongoDB, Puppeteer, Tailwind CSS, Mongoose - **Problem Formulation**: Civic and parliamentary information in India is dispersed across government portals, unstructured tables, and fragmented records, making legislative tracking cumbersome for researchers and citizens. - **System Solution**: Developed an open-source civic data platform with automated TypeScript/Node.js scrapers (Puppeteer, Cheerio) that fetch, validate, and normalize records of Lok Sabha & Rajya Sabha MPs from sansad.in, ministers, and state assemblies into a normalized MongoDB database. - **Architecture Pipeline**: Government Portals (sansad.in) → Puppeteer Ingestion Scripts with Exponential Backoff → Data Cleaning & Normalization → MongoDB/Mongoose Collections → Upstash Redis Caching → Next.js App Router Dossier Pages & D3-Geo State Visualizations. - **Capabilities & Verification**: - Public repository: github.com/Rajchhapariya/SattaDarshan - Tracks members of Lok Sabha & Rajya Sabha with normalized schema and legislative committee mappings. - **Limitations**: - Scrapers require maintenance if official government portal DOM structures change. - Historical term data completeness depends on public archive availability. --- ## 5. Other Verified Projects - **Truly** (Founder & Full-Stack Engineer, Apr 2026 – Present): Intentional social video platform for young urban Indians (ages 18–30) featuring structured 60-minute video circles, double-blind mutual matching (2-hour SLA), Panda CSS tokens, and Neon serverless PostgreSQL with Drizzle ORM. Implemented pessimistic row-locking (SELECT ... FOR UPDATE) across 8-seat allocations to eliminate overbooking, UUIDv7 primary keys, and Transactional Outbox pattern. Live at: https://trulyapp.online/ (Instagram: @trulyapp.online). - **AI Detector (SlopTotal)** (Empirical Validation, Aug 2026): Forensic multi-engine AI text detection ensemble (23 engines across neural classifiers, GPT-2 token likelihood, surprisal CV, and heuristics) benchmarked across N=136 corpora with ROC-AUC 0.978 on RTX 4060 GPU and 0.0% false positives on pre-1920 classics. - **Aarohana Trails** (Client Deployment, Aug 2026 – Sep 2026): Freelance client trekking and adventure travel platform with custom CMS admin dashboard, dynamic trip calendar, Prisma ORM, and PostgreSQL deployment. Live at: https://www.aarohanatrails.com/ - **SubsSync** (Proprietary, Jul 2026): B2B SaaS subscription recurring billing platform for Indian businesses with Razorpay API, UPI AutoPay mandate integration, and automated dunning/retry webhooks. - **GSTify** (Proprietary, Jul 2026): Invoicing and GST compliance web application for Indian freelancers featuring automated CGST/SGST/IGST calculation, pdf-lib invoice generation, and Drizzle ORM on Neon PostgreSQL. - **Namma Metro Guide** (In Testing, Android): Offline Android transit navigation application for Bengaluru Namma Metro commuters with route calculation, fare lookup, and station details built in Kotlin and Java. --- ## 6. Verified Technical Publications & Research Essays ### 6.1. Hybrid Retrieval Systems in Production: Combining BM25, Dense Embeddings, and Reciprocal Rank Fusion - **URL**: https://rajchhapariya.space/blog/hybrid-retrieval-bm25-dense-embeddings-rrf - **Date Published**: 2026-08-10 - **Tags**: RAG, Information Retrieval, BM25, Vector Search, Python - **Key Concepts**: Dense embeddings fail on exact alphanumeric tokens (SKUs, IDs) and out-of-vocabulary domain shift. BM25 provides exact keyword saturation. Reciprocal Rank Fusion (RRF, with smoothing constant k=60) merges disparate score distributions rank-wise without fragile linear scaling: RRF_Score(d) = Σ [1 / (k + r(d))]. Demonstrates Python implementation and two-stage cross-encoder reranking. - **Related Case Study**: Agentic RAG Knowledge Assistant (https://rajchhapariya.space/projects/agentic-rag-assistant) ### 6.2. Deterministic Guardrails for LLM Agents: Enforcing Safe SQL and Pydantic Schemas without Open-Ended Code Execution - **URL**: https://rajchhapariya.space/blog/deterministic-guardrails-sql-pydantic-llm-agents - **Date Published**: 2026-08-14 - **Tags**: AI Security, DuckDB, Python, Pydantic, SQL - **Key Concepts**: Arbitrary code execution via exec() introduces severe remote code execution (RCE) and non-deterministic crash risks. Describes the four-tool deterministic dispatch architecture (query_data, plot_chart, summary_stats, clarify), AST SQL validation blocking 33 dangerous keywords, read-only DuckDB boundaries, and post-synthesis numerical verification against raw tool output matrices. - **Related Case Study**: AI Data Analyst Agent (https://rajchhapariya.space/projects/ai-data-analyst) ### 6.3. In-Process Columnar OLAP with DuckDB: Architecture, Vectorized Execution, and Analytics Engineering - **URL**: https://rajchhapariya.space/blog/in-process-columnar-olap-duckdb-architecture - **Date Published**: 2026-08-18 - **Tags**: DuckDB, OLAP, Database Internals, Data Engineering, Performance - **Key Concepts**: Traditional client-server database architectures incur high serialization and network overhead for analytical workloads. Explores DuckDB's vectorized columnar execution, Morsel-driven multi-core parallelism, and zero-copy Apache Arrow interoperability for processing millions of rows directly in the host application's memory space. - **Related Case Study**: AI Data Analyst Agent (https://rajchhapariya.space/projects/ai-data-analyst) ### 6.4. Next.js 16 App Router Architecture: Server Components, Streaming SSR, and Static Site Generation - **URL**: https://rajchhapariya.space/blog/nextjs-16-app-router-server-components-ssr - **Date Published**: 2026-08-22 - **Tags**: Next.js, React, TypeScript, Web Architecture, Performance - **Key Concepts**: React Server Component (RSC) execution boundaries, streaming HTML via React Suspense, RSC payload wire format serialization, cache revalidation mechanics, and runtime memory optimization. - **Related Case Study**: Resume Roaster (https://rajchhapariya.space/projects/resume-roaster) ### 6.5. Evaluating Hallucination and Citation Faithfulness in Retrieval-Augmented Generation - **URL**: https://rajchhapariya.space/blog/evaluating-hallucination-citation-faithfulness-rag - **Date Published**: 2026-08-25 - **Tags**: AI Evaluation, RAG, Hallucination, Testing, Python - **Key Concepts**: Comprehensive breakdown of four core RAG evaluation metrics: Context Precision, Context Recall, Faithfulness (grounded assertions), and Answer Relevance. Details automated offline evaluation harnesses using pytest fixtures, deterministic assertion scoring, and cost-effective testing with mocked embeddings without incurring external API costs. - **Related Case Study**: Agentic RAG Knowledge Assistant (https://rajchhapariya.space/projects/agentic-rag-assistant) --- ## 7. Site Hierarchy & Navigation - **Home**: https://rajchhapariya.space/ - **About & Philosophy**: https://rajchhapariya.space/about - **Selected Work**: https://rajchhapariya.space/projects - **Technical Writing**: https://rajchhapariya.space/blog - **Resume & CV**: https://rajchhapariya.space/resume - **Download Resume PDF**: https://rajchhapariya.space/resume.pdf - **Privacy Policy**: https://rajchhapariya.space/privacy - **Sitemap XML**: https://rajchhapariya.space/sitemap.xml - **Robots Directives**: https://rajchhapariya.space/robots.txt - **LLM Summary Index**: https://rajchhapariya.space/llms.txt - **LLM Full Context**: https://rajchhapariya.space/llms-full.txt