Integrations
Google DeepMind

Gemma 4 Edge

Gemma 4 runs on your hardware via LiteRT-LM — private inference, no cloud LLM API keys. Concierge is the intel + payment layer: Gemma 4 decides which route to call; pay curl settles live market data per x402 USDC.

Status: Live — developer preview on conc-exe.xyz

Model: gemma-4-E2B-it (on-device, Apache 2.0)

Preset: concierge-edge-preset.py

Manifest: litert-tools-manifest.json

Agent skill: concierge-edge/SKILL.md

How it works

  1. Developer installs litert-lm and downloads Gemma 4 E2B (.litertlm).
  2. Run with Concierge preset — six Python tools wrap pay curl to intel routes.
  3. User asks a market question locally; Gemma 4 emits tool_call JSON.
  4. LiteRT-LM executes the tool → Concierge returns live JSON → Gemma synthesizes the answer on-device.

Your device computes. Concierge connects. LLM inference is free and offline-capable after model download. Intel routes still need network + pay.sh wallet for x402 settlement. Concierge does not host Gemma — you do.

Stack split

LayerRuns onCost
Gemma 4 inferenceUser device (CPU/GPU/WebGPU)Free (open weights)
Concierge intel APIsconc-exe.xyz Edge$0.02–$0.25 USDC per call
x402 settlementpay.sh walletUSDC on Solana or Base

Preset tools (phase 1)

FunctionEndpointUSDC
intel_macroPOST /api/concierge-intel-macro$0.02
intel_wirePOST /api/concierge-intel-wire$0.02
intel_tvlPOST /api/concierge-intel-tvl$0.02
intel_verdictPOST /api/concierge-intel-verdict$0.10
intel_meteoraPOST /api/concierge-intel-meteora$0.10
intel_desk_briefPOST /api/concierge-intel-desk-brief$0.25

Developer setup (repo)

# One-shot toolchain check (Python, uv, litert-lm, pay CLI)
npm run edge:setup

# Start local Concierge + verify all Gemma Edge assets
npm run dev
npm run edge:verify:local

See also distribution/gemma/README.md in the repo.

Quick start

# 1. Install runtime + wallet
uv tool install litert-lm
pay setup && pay topup

# 2. Download Concierge preset
curl -fsSLO https://conc-exe.xyz/distribution/gemma/concierge-edge-preset.py

# 3. Run Gemma 4 with Concierge tools
litert-lm run \
  --from-huggingface-repo=litert-community/gemma-4-E2B-it-litert-lm \
  gemma-4-E2B-it.litertlm \
  --preset=concierge-edge-preset.py

Local dev against npm run dev:

export CONCIERGE_ORIGIN=http://localhost:8080
export CONCIERGE_PAY_CMD="pay --sandbox"
litert-lm run ... --preset=concierge-edge-preset.py

Example flow

> Outlook Solana DeFi — verdict dan pool Meteora terbaik?
[tool_call] {"name": "intel_verdict", "arguments": {"message": "Solana DeFi outlook"}}
[tool_response] {"verdict": {"signal": "watch", "confidence": "medium", ...}}
[tool_call] {"name": "intel_meteora", "arguments": {"pool_hint": "SOL", "sort_by_apy": true}}
[tool_response] {"pools": [...]}
Gemma 4 synthesizes answer locally in Indonesian.

vs cloud Concierge chat

Gemma 4 EdgePOST /api/concierge
LLM locationUser deviceConcierge server (Gemini default)
PrivacyQuestions stay on deviceMessage sent to cloud LLM
Live market contextVia paid intel tool callsBundled per request ($0.10)
Trading plans / imagesNot included — use cloud ConciergeFull modes supported
Best forDeveloper edge agentsEnd users in Executive Lounge

Related

Concierge Edge × Gemma 4 · Google DeepMind Gemma