当前位置: 首页 > news >正文

本地部署DeepSeek-R1 Windows电脑

了解一下大模型是个什么东西

llama

个人理解:这个是大模型的运行环境
以下解释来自网络:
这个单词原本是 Large Language Model Meta AI 的缩写,意思是“Meta 公司推出的大语言模型”。
为什么叫这个名字? 因为 Meta(也就是 Facebook 的母公司)在 2023 年推出了一款名为 LLaMA 的开源大模型。相比当时动辄几千亿参数的 ChatGPT,Meta 发布的 70 亿、130 亿参数的小模型效果惊人,瞬间引爆了整个开源 AI 圈。
为什么项目叫 llama.cpp? 因为作者 Georgi Gerganov 最初开发这个工具,目的就是为了在 C++ 环境下运行 Meta 的 LLaMA 模型。虽然现在这个工具已经能跑几百种其他模型(比如您正在跑的 DeepSeek 和 Qwen),但“Llama”这个名字作为元老被保留了下来。

环境搭建

1、下载deepseek最小的大模型文件

DeepSeek-R1-Distill-Qwen-1.5B-Q4_K_M.gguf
下载地址:https://hf-mirror.com/bartowski/DeepSeek-R1-Distill-Qwen-1.5B-GGUF
巡迅雷下载快,下载完成文件大小大概1.1G。

2、下载llama.cpp执行程序

直接下载压缩包解压即可:llama-b10223-bin-win-cpu-x64.zip
下载地址:https://github.com/ggml-org/llama.cpp/releases

3、尝试启动大模型

将下载的 gguf 文件放到 llama-b10223-bin-win-cpu-x64.zip 解压后的目录下,在解压后的而目录下打开cmd黑框,执行命令:llama-cli -m DeepSeek-R1-Distill-Qwen-1.5B-Q4_K_M.gguf -ngl 0 -p "你好,请介绍一下你自己"

llama-cli 这是 llama.cpp 编译出的命令行交互程序 -m 是 --model(模型)的缩写 ngl 是 --n-gpu-layers 的缩写;指定有多少层神经网络要放到显卡(GPU)上跑 -p 是 --prompt(提示词)的缩写

4、启动一个Web服务

执行:llama-server -m DeepSeek-R1-Distill-Qwen-1.5B-Q4_K_M.gguf -ngl 0 -c 2048 --temp 0.5 --host 0.0.0.0 --port 8080

llama-server 启动 llama.cpp 中的 Web 服务端程序 -c 是 --ctx-size(上下文长度)的缩写 --temp 0.5 控制回答的“发散度”和“稳定度”数值越低(如 0.1~0.2),模型越死板,数值越高(如 0.8~1.0),模型越“乱来” --host 0.0.0.0 允许局域网/外网访问;果写 127.0.0.1,则只有本机电脑能访问。写成 0.0.0.0,意味着这台电脑所在局域网内的所有其他设备 --port 8080 监听端口号

5、页面

可以进行一些简单逻辑性问题分析回答。

http://www.jsqmd.com/news/1318235/

相关文章:

  • 批量提取文件夹文件名工具 按原始顺序排序自定义数量分组 单键连续点依次复制各组名称办公高效整理文件名神器
  • Klick‘r深度解析:Android图像识别自动点击工具架构剖析
  • Python双平台小纸条雨程序开发指南
  • PHP哈希加密技术演进与安全实践指南
  • RHCE作业2
  • 论文大纲逻辑理不清,有哪些实用的AI写论文工具推荐?
  • 2026 年更新:平阴口碑好的燃气辐射加热器厂商竞争格局,冬天户外围坐烧烤却不冻手?这玩意儿才是供暖界的隐藏狠角色。 - 行业推荐官[官方】--
  • SpringBoot+Vue选课系统架构设计与性能优化
  • STM32学习记录之EXTI
  • 从零构建2D游戏引擎:C#与OpenTK实战指南
  • 2026澳大利亚留学机构哪家好?本科硕士申请家庭更值得重点比较的十家机构 - 环球新视野
  • 前沿技术借鉴研讨-2026.7.30(妊娠自杀未遂风险的性别差异/妊娠期高血压共病风险)
  • 从单机到高可用集群:VMware ESXi+vCenter企业级虚拟化实战部署指南
  • Houdini KineFX 程序化角色绑定与动画实战指南
  • 2026 论文AI率助手横向对比:真实体验分享,毕业党生存手册
  • Python薪资飙到200万,2025年不学它等于跟钱过不去
  • FreeRTOS死机排查:从栈溢出到优先级反转的嵌入式系统稳定性实战
  • 警惕隐蔽“跟踪狂”:Chrome 同步功能正沦为黑客与偷窥者的窃听利器
  • 实测MiniMax M3智能体:如何为你的Obsidian知识库装上AI大脑
  • 遗传算法优化农业水资源调度的Matlab实现
  • 2026 年现阶段,青岛比较好的耐烧碱防腐涂料厂家哪家好,你家化工设备的“隐形保护伞”,居然能扛住高浓度烧碱的反复腐蚀?它的核心配方藏着你不知道的门道。-万利兴防腐涂料 - 企业推荐管【认证】
  • Galgame可视化编辑器实战:从节点化剧情到多分支游戏开发
  • OpenStack核心架构与生产环境部署实战指南
  • 第四篇:Redis 的 Key-Value 模型到底是什么?Key 应该怎么设计?
  • Langchain4j分布式链路监控实战:从原理到落地
  • 构建稳定AI角色:结构化提示词与角色扮演工程实践
  • FPGA软核开发实战:Nios II与自定义IP集成及ModelSim仿真全流程
  • 地铁隧道昏暗环境怎么用AR做设备巡检
  • 2026年绵阳电梯安装公司怎么选?本地全链条服务能力观察|公司推荐 - 优质品牌商家
  • 彻底解决Windows软件运行库缺失问题:从VC++ 2005到2022全解析