A Reinforcement-Optimized Multimodal Symbolic Reasoning Approach for Mathematical Problem Solving

Junchen Liu, Xinrui Li · 2025

We propose RPR-LLaVA, a reinforcementaugmented program reasoning framework targeting multimodal mathematical tasks that integrate visual perception with symbolic reasoning. The model integrates triple encoding of images, text, and symbolic programs to capture rich semantics across modalities. A symbolic reasoning engine executes domainspecific programs step-by-step, while a reinforcement learning optimizer refines reasoning quality using multi-objective rewards. Training follows a two-stage pipeline, combining supervised learning with policy-gradient fine-tuning. RPR-LLaVA enhances interpretability and symbolic precision, offering a new direction for unifying visual-language models with structured reasoning in educational contexts.

Read the paper · More papers on PaperTik