从此

GPU、AI人工智能、LLM大模型、部署RAG、蒸馏、MCP、SKILL.md、Wrap4D、Nvidia英伟达/辉达

综合

AI人工智能专题Google AIStable Diffusion
当今大模型(Transformer-based)核心原理即“预测下一个词(Next Token Prediction)”,也称之为“文字接龙”,同时通过 Self-Attention(自注意力机制)实现了算力“涌现(Emergence)”。 AI 大模型搭建零基础入门教程 实战: 1. 只使用 AI 对话能力。 2. 知识库融入 AI - 塞上下文、Vector RAG 结构化、SKILL.md + Tool Calling 智能体。 OpenAI 的 Tool Calling JSON 格式被主流 AI 兼容;SKILL.md 技术则为可选。 AI Grep 即传入 Prompt + Tool,AI 根据 Prompt 判断是否需要调用用户机器的 Tool,并返回问题关键词作为参数。 安全: 提示词注入攻击 - 攻击者将恶意指令伪装在输入(即提示词)中,诱使大模型忽略开发者的原始指令,转而执行攻击者设定的操作。 AI Chat(LLM大模型)Web 客户端: 按 Enter 直接提交,Shift + Enter 则只会换行。 AI 服务端为了拿取聊天上下文,会选择 POST 请求,而非 URL 长度有限的 GET 请求。 因 SSE 协议(短上下文场景)不支持 POST,故改换为 fetch POST + Streamable HTTP 流式请求;未来可能切换为 WebTransport 不可靠数据报。 直接响应或长连接 - Accept: application/json, text/event-stream 方案参考文章 - https://juejin.cn/post/7611809566248517638

GPU 显卡

GPU
  手机 GPU 未集成显存,故直接取用普通内存中的数据。
  参数 - 显存容量决定可以同时存放多少数据;显存位宽即显存的每1个Hz传递多少数据,主流为 256-bit。
  原理 - CPU 把 *.png 转换为 RGBA8(32-bit)或 BC7(需 GPU 硬解支持) 后,放显存(VRAM)里交由 GPU 渲染;PC 最强的 VRAM Compressed(显存压缩)格式是专利未过期的 BC7,移动端则为免费的 ASTC。
    PC端采用IMR,而移动端GPU则使用基于块的渲染(TBR/TBDR/Tiled-Based-Deferred-Rendering),原理就是把读写读写读写,变为读读读写来批量写入FrameBuffer,降低写内存频率。

AI(人工智能/Artificial intelligence)

All in AI - 国内外科技大厂均制定了梭哈AI的公司发展方向。
AI 岗位 - AI 本次技术突破将会取代至少一半现有岗位,特别是文化创意类。

ChatGPT 云端对话、OpenAI 编码助手 Codex。
Model Context Protocol (MCP) 模型上下文协议 - 用于 LLM 与外部数据源和工具之间的无缝集成。
Token - 词元。Prompt - AI 提示词。
SKILL.md - AI后端根据Metadata反向拉取客户端技能描述的交互规范。
Claude Code 是 Anthropic 推出的智能编码助手,它不仅能生成代码,更能自主规划任务、调用工具完成开发工作。
Seedance - 字节跳动(ByteDance)国产视频生成AI大模型。
具身智能(Embodied Artificial Intelligence / EAI) - 身体与环境互动。
Vibe Coding - 氛围编程,即描述功能让 AI 编码。

大模型(LLM/Large language model)

云端部署/本地离线 - Gemini 和 ChatGPT 属于云端在线用; Gemma 3 和 DeepSeek R1 则为离线部署用。

RAG(Retrieval Augmented Generation,检索增强生成)将大规模语言模型(LLM)与外部知识源的检索相结合,以改进问答能力。

LLM蒸馏技术:
  将Teacher Model蒸馏为Student Model,虽然会损失部分能力,但可使其硬件要求降低;国内比较火的DeepSeek-R1即为蒸馏模型。

Mac mini M4 16GiB 内存丐版最大可部署 9GiB 大小的 DeepSeek-R1-Distill-Qwen-14B,Tokens/second为11.3、8B为19.6。

LangChain(RetrievalQA) 或 AnythingLLM 通过RAG技术投喂知识库 - https://anythingllm.com/

Ollama

  官网下载 Ollama(700MiB) https://ollama.com/download/windows
  注意 - v0.9.4 之前版本在 Windows 上报 Error: llama runner process has terminated: exit status 2
  ollama list    ollama app.exe 图标右键 Settings 可指定 OLLAMA_MODELS 位置 C:\Users\pc\.ollama\models\blobs\sha256-57c9b4a897df8d1ba26a152eb7b98e8dc743e21a5d5492f8183270565b84932b
  ollama pull gemma3:1b-it-qat    用 1G 小模型测试下是否被墙(河南联通亲测未墙但后半程限速200KB/s,可通过Ctrl+C断开多次重复用前半程全速下载)。
  ollama run gemma3:1b-it-qat "What's your name?"
  [需拉取支持多模态的模型] ollama run gemma3 "caption this image /Users/$USER/Desktop/surprise.png"

Ollama 本地部署 Gemma 3:
  gemma3:27b-it-qat 显存要求15G,比 gemma3:27b-it-q4_K_M 发布晚,质量更好;端侧可用 Gemma 3n E2B 和 Gemma 3n E4B。
  ollama run gemma3:27b-it-qat "What's your name?"

Ollama 本地部署 DeepSeek:
  DeepSeek-R1	7B	4.7GB	ollama run deepseek-r1
  DeepSeek-R1	671B	404GB	ollama run deepseek-r1:671b

LangChain(RetrievalQA) 或 AnythingLLM 通过RAG技术投喂知识库 - https://anythingllm.com/

其他

机器学习(machine learning)
恐怖谷效应 - 当人类看到类似人类的物体,特别是机器人时,会产生不舒服的感受。

英伟达(Nvidia/辉达)特供中国的 H20 取得美国政府外销许可。

光模块 - AI显卡跨机柜时NVLink铜信号衰减厉害,故只能走近光速的光模块儿了,通过光纤为多个GPU算力集群提供通信。

OpenClaw - 开源本地端AI助理,俗称“养龙虾”。

AI 泡沫、AI 短剧。

AI 会出现幻觉和谄媚情况,可通过参数调整其程度。

NVIDIA A2F 开源模型下载 - https://github.com/NVIDIA/Audio2Face-3D#hugging-face-hub
  需要扫描设备采集好数据,传入 R3DS Wrap4D 来进行 3D 人体模型的创建 - https://www.youtube.com/watch?v=_5lMN36NP0Q