当前位置:首页 >专题 >Ollama 本地模型工程实践专题
Ollama 本地模型
Ollama 本地模型工程实践专题
从模型拉取、API 接入到生产安全
Ollama 把开源模型的下载、运行和 API 调用压缩成一套易上手的本地工作流,但真正用于开发和团队环境时,还要处理模型版本、上下文、流式响应、硬件约束、端口鉴权和服务健康检查。本专题以 Ollama 官方资料为基线,精选 17Golang 真实文章,串起从第一次运行到可维护本地模型服务的工程路径。
本地模型工程实战路径
从安装与模型选择走到 API、Embedding 和安全治理
文章
本地运行性能超越 OpenAI Text-Embedding-Ada-002 的 Embedding 服务,太方便了!
介绍基于 Ollama 的本地 Embedding 服务及其在语义检索场景中的使用。
文章
使用 Quarkus、Ollama 和 Testcontainers 构建本地 LLM AI 支持的应用程序
将 Quarkus、Ollama 和 Testcontainers 组合起来,构建可测试的本地 LLM 应用。
Ollama 上线前验收
用资源、API 和安全边界判断本地模型是否可用
Ollama 应该先选大模型还是小模型?
先按任务质量、上下文长度、内存/显存和可接受延迟做小规模基准。开发验证优先选择能稳定加载的量化模型,再根据真实提示、并发和首 token 延迟决定是否升级模型,而不是只看参数规模。
Ollama API 默认地址可以直接暴露到公网吗?
不建议。默认 API 更适合本机或受控内网调用,公网场景应增加鉴权、反向代理、访问控制、限流和审计,并限制可拉取与可运行的模型;先用健康检查和最小权限验证服务边界。
为什么 Ollama 第一次请求很慢,后面又变快?
常见原因是模型首次拉取、加载到内存或显存以及冷启动。应分别记录模型下载、加载、首 token、持续生成和卸载时间,并用 keep_alive、模型大小和并发策略控制冷启动成本。
Modelfile 能不能替代微调?
Modelfile 主要用于指定基础模型、系统提示、模板和推理参数,也可引用适配器;它不等同于训练或微调。需要改变模型知识或能力时,应评估 RAG、LoRA/Adapter 或重新训练,并保留可复现的模型版本记录。
相关专题
继续查看相近方向内容
查看更多
最新文章
-
- PHP 8.5 get_error_handler 怎么查当前处理器:临时兜底与恢复验证
- 5分钟前 292浏览
-
- GitHub Copilot 仓库级指标怎么查:REST API、PR 数据与团队落地检查
- 19分钟前 434浏览
-
- Redis HGETEX 怎么读并续期 Hash 字段:PERSIST、EX 与 TTL 验收
- 27分钟前 336浏览
-
- PHP 8.5 array_last() 非连续键怎么取最后值:空数组与 Polyfill 边界
- 45分钟前 479浏览
-
- GitHub Copilot 浏览器工具怎么做企业权限验收:共享标签页与域名过滤
- 56分钟前 102浏览
-
- GitHub Copilot 浏览器工具正式可用:企业上线前先查权限与域名控制
- 59分钟前 334浏览

