# Fluent AI: Offline & Cloud LLM

> AI chat assistant with offline models - private, customizable, multimodal

Canonical page: [https://chrome-stats.com/d/com.readheights.fluentai](https://chrome-stats.com/d/com.readheights.fluentai)

## Overview

- **ID:** `com.readheights.fluentai`
- **Platform:** Android
- **Type:** Android app
- **Status:** Available
- **Publisher:** ReadHeights Technologies Private Limited
- **Category:** PRODUCTIVITY
- **Downloads:** 21,109
- **Version:** 1.3.7
- **Last updated:** 2026-08-20
- **First published:** 2025-10-29
- **Publisher country:** IN
- **Size:** 109 MB
- **Data as of:** 2026-09-05
- **Store listing:** [Google Play Store](https://play.google.com/store/apps/details?id=com.readheights.fluentai)
- **Website:** [https://readheights.com/](https://readheights.com/)
- **Privacy policy:** [https://readheights.com/privacy](https://readheights.com/privacy)

## Description

🤖 Fluent AI — Private Offline LLM + Claude, GPT-4 &amp; Gemini<br><br>Run AI entirely on your device — no cloud, no account, no data sent anywhere. Then switch to Claude, GPT-4 or Gemini when you need more power. One app. Every AI. Always private.<br><br>✨ WHAT&#39;S NEW IN v1.3<br><br>🏥 MEDICAL AI (MedGemma)<br>• Google&#39;s MedGemma 4B — clinical Q&amp;A and biomedical text, 100% on-device<br>• Requires accepting Google&#39;s Health AI Developer Foundation Terms<br>• Not a substitute for professional medical advice<br><br>🤖 AGENTIC MODE<br>• On-device AI agent with 12 built-in skills<br>• Runs tasks autonomously: calendar events, web research, document digest, trip planning<br>• Agent Task Inspector — see every reasoning step in real time<br>• 3 free agent runs/day — no subscription needed to start<br>• Scheduled tasks available with Premium<br><br>⚡ LITERT MTP — UP TO 2× FASTER<br>• Gemma 4n E2B/E4B with Multi-Token Prediction on Android GPU<br>• Speculative decoding — more tokens per step, same quality<br>• Tok/s display measures decode-phase speed only for accurate results<br><br>👁️ ON-DEVICE VISION (Android)<br>• Attach photos using Gemma 4n — processed entirely on-device<br>• No image uploaded to any server, ever<br><br>🔒 PRIVACY FIRST<br>• Conversations stay on your device<br>• Optional local models = zero cloud data<br>• API keys encrypted with AES — never stored in plain text<br>• No mandatory account required<br><br>🧠 LOCAL AI MODELS<br>• GGUF / llama.cpp: Gemma 3/4, Qwen 3.5, Phi-4, Llama, DeepSeek R1, Nemotron, MedGemma<br>• LiteRT (Android GPU/NPU): Gemma 4n E2B/E4B — vision + MTP speculative decoding<br>• Apple MLX: Native Metal on Apple Silicon and iOS 18+ (A17 Pro+)<br>• Q5_K GPU acceleration on Qualcomm Adreno (alongside Q4_0)<br>• Device-aware model recommendations based on your RAM and chipset<br>• Browse, download, and manage models in-app — no sideloading needed<br>• Import custom GGUF from HuggingFace URL or device storage<br><br>☁️ CLOUD AI<br>• Claude (Anthropic), GPT-4 (OpenAI), Gemini (Google)<br>• OpenRouter — 200+ models via a single API key<br>• Streaming, vision, and tool calling across all providers<br><br>🌐 ONLINE SERVERS<br>• Ollama Cloud and self-hosted Ollama<br>• LM Studio, vLLM, LocalAI, and any OpenAI-compatible /v1 API<br>• Multiple server profiles with per-profile encrypted auth headers<br><br>🎤 VOICE MODE<br>• 5 conversation modes: Normal, Interview, Learning, Storytelling, Translation<br>• Animated waveform, voice commands (speed, repeat, stop)<br>• Quick-capture mic button directly in the chat input bar<br><br>📚 KNOWLEDGE BASES (RAG)<br>• Import PDFs, TXT, and Markdown — AI references your docs when answering<br>• Semantic search for relevant context, topic and project organisation<br><br>🔧 POWER FEATURES<br>• Tool calling: Calculator, DateTime, Weather, Web Search, mem0 Memory<br>• MCP servers: GitHub, Slack, Notion, Supabase, and 20+ presets<br>• Code execution: Python, Bash, Node.js from code blocks (desktop + mobile JS)<br>• Model benchmarking: tok/s, TTFT, MMLU-50 quality score, shareable PNG cards<br>• Slash commands: /agent, /clear, /export, /voice, /template and more<br>• Per-chat thinking toggle for Qwen3, DeepSeek R1, Nemotron reasoning models<br>• URL context injection — paste a link, AI reads the page for context<br>• Polish Before Send — AI rewrites your draft before you hit send<br>• Continue button — resumes responses cut off at the token limit<br><br>📁 CHAT ORGANISATION<br>• Folders, tags, and cross-chat full-text search across every message<br>• HuggingFace model browser with bookmarks and memory fitness badges<br>• Conversation branching and message reactions<br><br>🌟 PREMIUM (OPTIONAL)<br>• Ad-free experience<br>• Scheduled agent tasks (recurring or one-time)<br>• Priority feature access and advanced analytics<br><br>📱 PERFECT FOR<br>✓ Privacy-focused users — local models, zero cloud data<br>✓ Android power users — LiteRT GPU/NPU with MTP acceleration<br>✓ Developers — benchmark GGUF, LiteRT, and MLX side-by-side<br>✓ Healthcare researchers — MedGemma on-device, no upload needed<br>✓ Students — knowledge bases for study documents and materials<br>✓ Professionals — agentic tasks, document Q&amp;A, and tool calling

## Rankings

- #423,911 — Overall
- #30 — возможности ai

## Permissions and access

### Permissions

- `android.permission.ACCESS_ADSERVICES_AD_ID`
- `android.permission.ACCESS_ADSERVICES_ATTRIBUTION`
- `android.permission.ACCESS_ADSERVICES_TOPICS`
- `android.permission.ACCESS_NETWORK_STATE`
- `android.permission.ACCESS_NOTIFICATION_POLICY`
- `android.permission.BLUETOOTH`
- `android.permission.BLUETOOTH_ADMIN`
- `android.permission.BLUETOOTH_CONNECT`
- `android.permission.FOREGROUND_SERVICE`
- `android.permission.FOREGROUND_SERVICE_DATA_SYNC`
- `android.permission.INTERNET`
- `android.permission.POST_NOTIFICATIONS`
- `android.permission.RECEIVE_BOOT_COMPLETED`
- `android.permission.RECORD_AUDIO`
- `android.permission.REQUEST_IGNORE_BATTERY_OPTIMIZATIONS`
- `android.permission.VIBRATE`
- `android.permission.WAKE_LOCK`
- `com.android.vending.BILLING`
- `com.android.vending.CHECK_LICENSE`
- `com.google.android.c2dm.permission.RECEIVE`
- `com.google.android.finsky.permission.BIND_GET_INSTALL_REFERRER_SERVICE`
- `com.google.android.gms.permission.AD_ID`
- `com.google.android.providers.gsf.permission.READ_GSERVICES`
- `com.readheights.fluentai.DYNAMIC_RECEIVER_NOT_EXPORTED_PERMISSION`

## Similar extensions and apps

- [Private AI](https://chrome-stats.com/d/us.valkon.privateai) — 90,771 users, 3.90 / 5
- [Offline AI Chat - Local LLM](https://chrome-stats.com/d/com.freeai.chat) — 14,672 users, 2.40 / 5
- [MultiAI | Online & Offline AI](https://chrome-stats.com/d/com.matrix.multigpt) — 1,752 users
- [Google AI Edge Gallery](https://chrome-stats.com/d/com.google.ai.edge.gallery) — 2,094,607 users
- [PROLINE AI](https://chrome-stats.com/d/com.prolineweb.prolineai) — 174 users
- [Gemma 4- Offline AI](https://chrome-stats.com/d/com.offlinesecureai.android) — 830 users
- [Gemmi Chat: Offline AI chatbot](https://chrome-stats.com/d/com.sensornotes.gemmi.ai) — 7,024 users
- [Nexus AI: Private Offline LLM](https://chrome-stats.com/d/nexus.ai.offline) — 309 users
- [InferrLM: On-device AI](https://chrome-stats.com/d/com.gorai.ragionare) — 932 users, 3.20 / 5
- [Local LLM](https://chrome-stats.com/d/com.AlexPechkin.LocalLLM) — 1,348 users
- [LocalGPT: Offline AI Assistant](https://chrome-stats.com/d/com.rnllamaexample) — 6,908 users
- [Pocket AI Offline Assistant](https://chrome-stats.com/d/com.hectasquare.pocketAI) — 1,608 users

---

Source: [Chrome-Stats](https://chrome-stats.com/d/com.readheights.fluentai)
