FROM ghcr.io/ggml-org/llama.cpp:server-cuda@sha256:5f245844a3244287bf69d4964670a021acf6f336467ae1feaa0024b4665c018d LABEL org.opencontainers.image.title="Qwen3.8-27B Responses API server" \ org.opencontainers.image.description="Authenticated llama.cpp server for unsloth/Qwen3.8-27B-GGUF" \ org.opencontainers.image.source="https://huggingface.co/spaces/Pablo-Flores-Mollinedo/inferecence" ENV LLAMA_CACHE=/data/models USER root RUN mkdir -p /data/models && chown -R 1000:1000 /data COPY --chown=1000:1000 --chmod=0555 start.sh /app/start.sh USER 1000:1000 EXPOSE 7860 ENTRYPOINT ["/bin/sh", "/app/start.sh"]