GPU、AI人工智能、LLM大模型、部署RAG、蒸馏、MCP、SKILL.md、Wrap4D、Nvidia英伟达/辉达
综合
AI人工智能专题、Google AI、Stable Diffusion
当今大模型(Transformer-based)核心原理即“预测下一个词(Next Token Prediction)”,也称之为“文字接龙”,同时通过 Self-Attention(自注意力机制)实现了算力“涌现(Emergence)”。
AI 大模型搭建零基础入门教程
实战:
1. 只使用 AI 对话能力。
2. 知识库融入 AI - 塞上下文、Vector RAG 结构化、SKILL.md + Tool Calling 智能体。
OpenAI 的 Tool Calling JSON 格式被主流 AI 兼容;SKILL.md 技术则为可选。
AI Grep 即传入 Prompt + Tool,AI 根据 Prompt 判断是否需要调用用户机器的 Tool,并返回问题关键词作为参数。
安全:
提示词注入攻击 - 攻击者将恶意指令伪装在输入(即提示词)中,诱使大模型忽略开发者的原始指令,转而执行攻击者设定的操作。
AI Chat(LLM大模型)Web 客户端:
按 Enter 直接提交,Shift + Enter 则只会换行。
AI 服务端为了拿取聊天上下文,会选择 POST 请求,而非 URL 长度有限的 GET 请求。
因 SSE 协议(短上下文场景)不支持 POST,故改换为 fetch POST + Streamable HTTP 流式请求;未来可能切换为 WebTransport 不可靠数据报。
直接响应或长连接 - Accept: application/json, text/event-stream
方案参考文章 - https://juejin.cn/post/7611809566248517638
GPU 显卡
GPU
手机 GPU 未集成显存,故直接取用普通内存中的数据。
参数 - 显存容量决定可以同时存放多少数据;显存位宽即显存的每1个Hz传递多少数据,主流为 256-bit。
原理 - CPU 把 *.png 转换为 RGBA8(32-bit)或 BC7(需 GPU 硬解支持) 后,放显存(VRAM)里交由 GPU 渲染;PC 最强的 VRAM Compressed(显存压缩)格式是专利未过期的 BC7,移动端则为免费的 ASTC。
PC端采用IMR,而移动端GPU则使用基于块的渲染(TBR/TBDR/Tiled-Based-Deferred-Rendering),原理就是把读写读写读写,变为读读读写来批量写入FrameBuffer,降低写内存频率。
AI(人工智能/Artificial intelligence)
All in AI - 国内外科技大厂均制定了梭哈AI的公司发展方向。
AI 岗位 - AI 本次技术突破将会取代至少一半现有岗位,特别是文化创意类。
ChatGPT 云端对话、OpenAI 编码助手 Codex。
Model Context Protocol (MCP) 模型上下文协议 - 用于 LLM 与外部数据源和工具之间的无缝集成。
Token - 词元。Prompt - AI 提示词。
SKILL.md - AI后端根据Metadata反向拉取客户端技能描述的交互规范。
Claude Code 是 Anthropic 推出的智能编码助手,它不仅能生成代码,更能自主规划任务、调用工具完成开发工作。
Seedance - 字节跳动(ByteDance)国产视频生成AI大模型。
具身智能(Embodied Artificial Intelligence / EAI) - 身体与环境互动。
Vibe Coding - 氛围编程,即描述功能让 AI 编码。
大模型(LLM/Large language model)
云端部署/本地离线 - Gemini 和 ChatGPT 属于云端在线用; Gemma 3 和 DeepSeek R1 则为离线部署用。
RAG(Retrieval Augmented Generation,检索增强生成)将大规模语言模型(LLM)与外部知识源的检索相结合,以改进问答能力。
LLM蒸馏技术:
将Teacher Model蒸馏为Student Model,虽然会损失部分能力,但可使其硬件要求降低;国内比较火的DeepSeek-R1即为蒸馏模型。
Mac mini M4 16GiB 内存丐版最大可部署 9GiB 大小的 DeepSeek-R1-Distill-Qwen-14B,Tokens/second为11.3、8B为19.6。
LangChain(RetrievalQA) 或 AnythingLLM 通过RAG技术投喂知识库 - https://anythingllm.com/
Ollama
官网下载 Ollama(700MiB) https://ollama.com/download/windows
注意 - v0.9.4 之前版本在 Windows 上报 Error: llama runner process has terminated: exit status 2
ollama list ollama app.exe 图标右键 Settings 可指定 OLLAMA_MODELS 位置 C:\Users\pc\.ollama\models\blobs\sha256-57c9b4a897df8d1ba26a152eb7b98e8dc743e21a5d5492f8183270565b84932b
ollama pull gemma3:1b-it-qat 用 1G 小模型测试下是否被墙(河南联通亲测未墙但后半程限速200KB/s,可通过Ctrl+C断开多次重复用前半程全速下载)。
ollama run gemma3:1b-it-qat "What's your name?"
[需拉取支持多模态的模型] ollama run gemma3 "caption this image /Users/$USER/Desktop/surprise.png"
Ollama 本地部署 Gemma 3:
gemma3:27b-it-qat 显存要求15G,比 gemma3:27b-it-q4_K_M 发布晚,质量更好;端侧可用 Gemma 3n E2B 和 Gemma 3n E4B。
ollama run gemma3:27b-it-qat "What's your name?"
Ollama 本地部署 DeepSeek:
DeepSeek-R1 7B 4.7GB ollama run deepseek-r1
DeepSeek-R1 671B 404GB ollama run deepseek-r1:671b
LangChain(RetrievalQA) 或 AnythingLLM 通过RAG技术投喂知识库 - https://anythingllm.com/
其他
机器学习(machine learning)
恐怖谷效应 - 当人类看到类似人类的物体,特别是机器人时,会产生不舒服的感受。
英伟达(Nvidia/辉达)特供中国的 H20 取得美国政府外销许可。
光模块 - AI显卡跨机柜时NVLink铜信号衰减厉害,故只能走近光速的光模块儿了,通过光纤为多个GPU算力集群提供通信。
OpenClaw - 开源本地端AI助理,俗称“养龙虾”。
AI 泡沫、AI 短剧。
AI 会出现幻觉和谄媚情况,可通过参数调整其程度。
NVIDIA A2F 开源模型下载 - https://github.com/NVIDIA/Audio2Face-3D#hugging-face-hub
需要扫描设备采集好数据,传入 R3DS Wrap4D 来进行 3D 人体模型的创建 - https://www.youtube.com/watch?v=_5lMN36NP0Q