v0.1.5 现已发布 模型、算力与数据全部留在本机

本地大模型
一体化桌面工作台

模型、算力与数据全部留在本机。16 个应用、4 大推理引擎、统一三协议网关——对话、生图、语音、Agent、知识库,一站全开。

macOS · Windows · Linux|支持 20 家云端厂商接入|2733 条内置提示词

LlamaDesk — 本地大模型工作台
收起侧边栏
对话
智能体
JEV 判定
知识库
记忆
设置
llama.cpp · Qwen3.5-4B 运行中
我
帮我把这份 PDF 的要点整理进知识库,再总结成三句话。
AI
已完成:解析 42 页文档,切分 128 段并写入知识库,BM25 与向量双路召回就绪。要点总结如下——①…②…③…
本地推理 · 0 上传 · 数据不出本机
给 LlamaDesk 发送消息,或输入 / 选择提示词…
16
内置一级应用
4
本地推理引擎
3
网关开放协议
2733
内置提示词
20家
云端厂商预设
2778
自动化测试
快速上手

从零到全能力,只要三步

不需要先搭一套复杂的推理服务,装好就能用。

01

装引擎、选模型

llama.cpp / vLLM / SGLang / MLX 四大引擎一键安装;HuggingFace 模型市集按整模型聚合下载,支持镜像加速与断点续传。

02

一键启动本地服务

启动参数自动规划(上下文 / 显存 / 闪存注意力),显卡采样与逐模型显存占用一目了然;失败卡片直接给出日志首条 error,还能一键交给 Agent 修复。

03

16 个应用全开

所有应用共用同一套本地模型——对话、Agent、生图、语音、知识库直接切换,云端厂商 API 也能在同一个界面里按需接入。

能力矩阵

一套工作台,装下整条本地 AI 链路

最左图标栏切换应用,所有页面共用同一套布局;菜单项可拖拽排序、按需显隐。

AI 对话
流式输出 · 消息分支 · 多模态
智能体 Agent
工具调用 · 沙箱 · 子智能体
JEV 类型化判定
概率判定 · 驾驶舱 · 游乐场
语音通话
实时对话 · 多厂商实时模型
语音合成 / 识别
TTS · ASR · 克隆音色
AI 生图
云端 API / 本地 MLX / ComfyUI
AI 视频
MiniMax H3 / Seedance 等
AI 音乐
Suno API · 批次任务管理
OCR 文字识别
截图取字 · 本地识别
翻译
划词 / 文档 · 双语对照
提示词广场
2733 条 · 分类检索
Skills
skills.sh 榜单 · 一键安装
知识库
混合检索 · Rerank · 多模态
记忆
跨会话 · Agent 可读写
性能基准
本地模型实测打分
小应用中心
抠图 / 高清修复 / 贴纸等
深入架构

从模型管理,到全协议接入

底层能力对开发者同样开放——同一台机器上的任何工具都能直接调用。

推理引擎

四大引擎,统一管理

按硬件与模型自动匹配最合适的引擎,一处启动、处处可用。

  • 显存采样与逐模型占用——装载前后都看得见资源去向
  • 空闲自动卸载 + 备选模型——释放资源不断服务
  • 启动失败可诊断——失败卡片直达日志首条 error,一键交给 Agent 修复
llama.cpp
GGUF · CPU / GPU 通吃
vLLM
高吞吐 · 连续批处理
SGLang
分块预填充 · 结构化输出
MLX
Apple Silicon 原生加速
Qwen3.5-4B · 上下文 256K 6.8 / 10 GB
加载模式 · 自动规划启动参数 运行中
应用接入

统一网关 · 三协议全兼容

同一端口同时提供 OpenAI Chat Completions、Anthropic Messages、OpenAI Responses 三套协议——现有工具零改造接入。

  • 本地模型与云端厂商在网关层统一成一套 API
  • Claude Code / Cursor / 任意 OpenAI SDK 直接可用
  • omi CLI 可从终端唤起模型列表选模型、管理服务
本地 API · 请求示例 SHELL
# 本地模型走 OpenAI 协议,与云端 API 完全同构
curl http://127.0.0.1:19157/v1/chat/completions \
  -H 'Content-Type: application/json' \
  -d '{
    "model": "Qwen3.5-4B",
    "messages": [
      { "role": "user",
        "content": "请用一句话解释什么是本地模型推理。" }
    ],
    "stream": true
  }'

# Anthropic Messages 协议同样可用
curl http://127.0.0.1:19157/v1/messages \
  -H 'x-api-key: EMPTY' \
  -H 'anthropic-version: 2023-06-01' \
  -d '{ "model": "Qwen3.5-4B", ... }'
知识库 RAG

混合检索,多模态直嵌

文档、笔记、网页导入后即插即用,对话与 Agent 都能引用。

  • BM25 × 向量双路召回 + RRF 融合排序,关键词与语义都不丢
  • 嵌入服务全链路管理,文档图片多模态直嵌与在线查看
  • kb_search 通过 MCP 服务端开放给 Claude Code / Cursor
混合检索 · 召回示意 JSON
{
  "query": "Q3 财报里的风险条款",
  "retrieval": {
    "bm25":      ["doc#42", "doc#17", "doc#88"],
    "vector":    ["doc#17", "doc#91", "doc#42"],
    "rrF_merge": ["doc#17", "doc#42", "doc#88"]
  },
  "rerank": true,
  "citations": ["文件:行号"]
}
MCP 双端

既是客户端,也是服务端

Model Context Protocol 两头都通——把外部工具接进来,也把本地能力开放出去。

  • 客户端:stdio / Streamable HTTP / SSE 三传输,连通检测 + 工具枚举
  • 服务端:POST /mcp 把知识库与记忆开放给任意 MCP 客户端
  • 浏览器打开 GET /mcp 即内置调试工作台
kb_search · kb_list · memory_search · memory_save
通过 MCP Streamable HTTP 服务端开放,Claude Code / Cursor 可直接调用本地知识库与记忆
mcp_* 工具注入 Agent
外部 MCP 服务器的能力以工具形式进入本地 Agent,连接失败自动跳过
产品优势

为什么选择 LlamaDesk

每一个细节都为「长期、重度使用」打磨——从交互手感、底层架构到工程质量。

侧边栏抽屉切换

一级菜单可在图标列与完整宽度间一键切换——展开显示文字标签,收起只留图标,宽度过渡平滑,状态重启保持。

新增交互

Base UI 现代底座

全站界面基于 @appica/ui-react(Base UI) 构建——运行时更轻、交互行为贴近原生规范,动效与焦点管理开箱即得。

架构升级

全链路一致性

数据、工作区目录、CLI 与系统提示贯穿同一个 LlamaDesk 身份(llama-desk.db / .llamadesk / omi),升级与迁移路径清晰可预期。

工程化

2778 项测试全绿

全量 typecheck + 2778 项自动化测试全部通过,每一次发布都经过完整回归验证——从 UI 事件模型到端到端冒烟。

质量保障

v0.1.5 全新能力

最新版本带来 JEV 类型化判定板块、高清修复小应用(Real-ESRGAN 本地 4x 超分)、本地视觉模型 mmproj 投影支持——迭代节奏持续在线。

持续迭代

菜单与外观可定制

左侧一级菜单拖拽排序、按需显隐;主题(浅色 / 深色 / 跟随系统)、语言、界面密度均可在设置中调整。

个性化
立即体验

开始使用 LlamaDesk

选择适用于你平台的安装包,装好即用。

macOS

Apple Silicon (arm64) · macOS 13+
下载安装包

Windows

x64 · Windows 10+
下载安装包

Linux

x64 · 主流发行版
下载安装包

所有安装包均经完整回归测试后发布 · 企业定制与商务合作请通过官网联系