Gemma 4 Edge
Gemma 4 runs on your hardware via LiteRT-LM — private inference, no cloud LLM API keys. Concierge is the intel + payment layer: Gemma 4 decides which route to call; pay curl settles live market data per x402 USDC.
Status: Live — developer preview on conc-exe.xyz
Model: gemma-4-E2B-it (on-device, Apache 2.0)
Preset: concierge-edge-preset.py
Manifest: litert-tools-manifest.json
Agent skill: concierge-edge/SKILL.md
How it works
- Developer installs
litert-lmand downloads Gemma 4 E2B (.litertlm). - Run with Concierge preset — six Python tools wrap
pay curlto intel routes. - User asks a market question locally; Gemma 4 emits
tool_callJSON. - LiteRT-LM executes the tool → Concierge returns live JSON → Gemma synthesizes the answer on-device.
Your device computes. Concierge connects. LLM inference is free and offline-capable after model download. Intel routes still need network + pay.sh wallet for x402 settlement. Concierge does not host Gemma — you do.
Stack split
| Layer | Runs on | Cost |
|---|---|---|
| Gemma 4 inference | User device (CPU/GPU/WebGPU) | Free (open weights) |
| Concierge intel APIs | conc-exe.xyz Edge | $0.02–$0.25 USDC per call |
| x402 settlement | pay.sh wallet | USDC on Solana or Base |
Preset tools (phase 1)
| Function | Endpoint | USDC |
|---|---|---|
intel_macro | POST /api/concierge-intel-macro | $0.02 |
intel_wire | POST /api/concierge-intel-wire | $0.02 |
intel_tvl | POST /api/concierge-intel-tvl | $0.02 |
intel_verdict | POST /api/concierge-intel-verdict | $0.10 |
intel_meteora | POST /api/concierge-intel-meteora | $0.10 |
intel_desk_brief | POST /api/concierge-intel-desk-brief | $0.25 |
Developer setup (repo)
# One-shot toolchain check (Python, uv, litert-lm, pay CLI)
npm run edge:setup
# Start local Concierge + verify all Gemma Edge assets
npm run dev
npm run edge:verify:local
See also distribution/gemma/README.md in the repo.
Quick start
# 1. Install runtime + wallet
uv tool install litert-lm
pay setup && pay topup
# 2. Download Concierge preset
curl -fsSLO https://conc-exe.xyz/distribution/gemma/concierge-edge-preset.py
# 3. Run Gemma 4 with Concierge tools
litert-lm run \
--from-huggingface-repo=litert-community/gemma-4-E2B-it-litert-lm \
gemma-4-E2B-it.litertlm \
--preset=concierge-edge-preset.py
Local dev against npm run dev:
export CONCIERGE_ORIGIN=http://localhost:8080
export CONCIERGE_PAY_CMD="pay --sandbox"
litert-lm run ... --preset=concierge-edge-preset.py
Example flow
> Outlook Solana DeFi — verdict dan pool Meteora terbaik?
[tool_call] {"name": "intel_verdict", "arguments": {"message": "Solana DeFi outlook"}}
[tool_response] {"verdict": {"signal": "watch", "confidence": "medium", ...}}
[tool_call] {"name": "intel_meteora", "arguments": {"pool_hint": "SOL", "sort_by_apy": true}}
[tool_response] {"pools": [...]}
Gemma 4 synthesizes answer locally in Indonesian.
vs cloud Concierge chat
| Gemma 4 Edge | POST /api/concierge | |
|---|---|---|
| LLM location | User device | Concierge server (Gemini default) |
| Privacy | Questions stay on device | Message sent to cloud LLM |
| Live market context | Via paid intel tool calls | Bundled per request ($0.10) |
| Trading plans / images | Not included — use cloud Concierge | Full modes supported |
| Best for | Developer edge agents | End users in Executive Lounge |
Related
- Agent Skills UI — concierge-edge skill
- OOBE Protocol — SAP tools for on-chain agents
- Intel APIs — full route reference
- pay.sh — x402 wallet CLI
- Agent Playground — probe endpoints
- LiteRT-LM CLI docs ↗
- Gemma 4 model card ↗
Concierge Edge × Gemma 4 · Google DeepMind Gemma