模型、算力与数据全部留在本机。16 个应用、4 大推理引擎、统一三协议网关——对话、生图、语音、Agent、知识库,一站全开。
不需要先搭一套复杂的推理服务,装好就能用。
llama.cpp / vLLM / SGLang / MLX 四大引擎一键安装;HuggingFace 模型市集按整模型聚合下载,支持镜像加速与断点续传。
启动参数自动规划(上下文 / 显存 / 闪存注意力),显卡采样与逐模型显存占用一目了然;失败卡片直接给出日志首条 error,还能一键交给 Agent 修复。
所有应用共用同一套本地模型——对话、Agent、生图、语音、知识库直接切换,云端厂商 API 也能在同一个界面里按需接入。
最左图标栏切换应用,所有页面共用同一套布局;菜单项可拖拽排序、按需显隐。
底层能力对开发者同样开放——同一台机器上的任何工具都能直接调用。
按硬件与模型自动匹配最合适的引擎,一处启动、处处可用。
同一端口同时提供 OpenAI Chat Completions、Anthropic Messages、OpenAI Responses 三套协议——现有工具零改造接入。
# 本地模型走 OpenAI 协议,与云端 API 完全同构 curl http://127.0.0.1:19157/v1/chat/completions \ -H 'Content-Type: application/json' \ -d '{ "model": "Qwen3.5-4B", "messages": [ { "role": "user", "content": "请用一句话解释什么是本地模型推理。" } ], "stream": true }' # Anthropic Messages 协议同样可用 curl http://127.0.0.1:19157/v1/messages \ -H 'x-api-key: EMPTY' \ -H 'anthropic-version: 2023-06-01' \ -d '{ "model": "Qwen3.5-4B", ... }'
文档、笔记、网页导入后即插即用,对话与 Agent 都能引用。
{
"query": "Q3 财报里的风险条款",
"retrieval": {
"bm25": ["doc#42", "doc#17", "doc#88"],
"vector": ["doc#17", "doc#91", "doc#42"],
"rrF_merge": ["doc#17", "doc#42", "doc#88"]
},
"rerank": true,
"citations": ["文件:行号"]
}
Model Context Protocol 两头都通——把外部工具接进来,也把本地能力开放出去。
每一个细节都为「长期、重度使用」打磨——从交互手感、底层架构到工程质量。
一级菜单可在图标列与完整宽度间一键切换——展开显示文字标签,收起只留图标,宽度过渡平滑,状态重启保持。
新增交互全站界面基于 @appica/ui-react(Base UI) 构建——运行时更轻、交互行为贴近原生规范,动效与焦点管理开箱即得。
架构升级数据、工作区目录、CLI 与系统提示贯穿同一个 LlamaDesk 身份(llama-desk.db / .llamadesk / omi),升级与迁移路径清晰可预期。
工程化全量 typecheck + 2778 项自动化测试全部通过,每一次发布都经过完整回归验证——从 UI 事件模型到端到端冒烟。
质量保障最新版本带来 JEV 类型化判定板块、高清修复小应用(Real-ESRGAN 本地 4x 超分)、本地视觉模型 mmproj 投影支持——迭代节奏持续在线。
持续迭代左侧一级菜单拖拽排序、按需显隐;主题(浅色 / 深色 / 跟随系统)、语言、界面密度均可在设置中调整。
个性化