ORAM.AI: A multi-agent chatbot with RAG-based reasoning and MCP integration for adaptive fitness recommendation
Konstantinos I. Roumeliotis, Orestis N. Zestas, Kyriakos D. Kyriakou, Dimitrios N. Soumis, Sofia Kapellaki, Kyriaki Seklou, Nikolaos D. Tselikas · Array · 2026
The proliferation of conversational AI systems has created opportunities for personalized fitness guidance, yet current implementations face significant limitations in domain-specific knowledge retrieval, multi-modal interaction, and adaptive reasoning. This paper presents ORAM.AI, a multi-agent system that integrates Retrieval-Augmented Generation (RAG) with Model Context Protocol (MCP) for adaptive fitness recommendations. Unlike single-model chatbot architectures, ORAM.AI employs a coordinated ensemble of specialized agents: a keyword extraction agent for intent classification, an MCP-based exercise database retrieval service, a fine-tuned exercise advisor agent trained on 1572 training domain-specific prompt-completion pairs (from a 1746-pair corpus), and an orchestrator agent synthesizing multi-source information into coherent responses. Voice interaction is supported through Speech-to-Text (STT) transcription achieving 96.2% word accuracy, Text-to-Speech (TTS) synthesis, and a hands-free conversation mode via Voice Activity Detection (VAD) with real-time frequency analysis. A seven-dimension evaluation framework empirically characterizes the system: a human expert evaluation by two certified fitness professionals across 50 fitness questions and six quality dimensions yields a grand mean rating of 4.20/5.00 (SD=0.91) with 80.2% of 600 ratings at 4 or above; a controlled baseline comparison quantifies multi-agent orchestration gains over a single-LLM architecture; an ablation study isolates the complementary contributions of MCP retrieval and domain fine-tuning; and a joint comparison against two open-source Agentic RAG fitness chatbots contextualizes system performance. This work demonstrates how multi-agent orchestration, RAG-based knowledge augmentation, and multi-modal interaction can be combined in a deployment-oriented system design to deliver constraint-aware, context-conditioned recommendations through text and voice.