从此

GPU、AI人工智能、LLM大模型、部署RAG、蒸馏、MCP、SKILL.md、Wrap4D、Nvidia英伟达/辉达

综合

AI人工智能专题、Google AI、Stable Diffusion、Gen AI API 开发必看
当今大模型(Transformer-based)核心原理即“预测下一个词(Next Token Prediction)”,也称之为“文字接龙”,同时通过 Self-Attention(自注意力机制)实现了算力“涌现(Emergence)”。
AI 名 描述 其他
OpenAI - ChatGPT
GPT-6 Luna 输入 Token 每百万 $0.1,输出 Token 每百万 $0.5。
额度:客户端免费(需登录),API 则收费。
当前最强模型为: GPT-6 Astra,通常比 Genimi 最强模型贵 5 倍。
按产品强弱排名: Astra / Sol / Luna
其他: 最新接口为 OpenAI Responses API(Qwen、LangChain4j 已兼容)
谷歌 - Gemini
Gemini 3.5 Flash-Lite 输入 Token 每百万 $0.3,输出 Token 每百万 $2.5。
额度:客户端免费(免登录),达到消耗上限(未明示)得等 5 个小时重置;Gemini Pro 免费 50 次/天。
当前最强模型为: Gemini 4 Argon、gemini-3.1-pro-preview,预览后缀等下代 Pro 发布方去掉。
按产品强弱排名: Pro / Flash / Flash-Lite
其他: 超长上下文与原生多模态;最新接口为 Gemini Interactions API。
Anthropic - Claude
Claude Sonnet 5 输入 Token 每百万 $2,输出 Token 每百万 $10。
额度:客户端免费(免登录)。
当前最强模型为: Claude Fable 5.1;热门工具 Claude Code。
按产品强弱排名: Fable / Opus / Sonnet
其他: 曾经独此一家的“Token 级别的预算调节”。
反感大陆 AI 厂商的蒸馏黑产!
故连累内地个人用户被误封号。
美国出口管制 AI 大模型和芯片
阿里云百炼 - 千问(Qwen)
qwen3.8-flash 输入 Token 每百万 ¥0.8,输出 Token 每百万 ¥2.7。
额度:客户端免费(免登录),API 则免费试用 3 个月 100 万 Token。
当前最强模型为: qwen3.8-max,价格与 Gemini 相当。
按产品强弱排名: Max / Plus / Flash
其他:也跟进了 Token 预算(thinking_budget)。
Github Copilot
代码补全(Code Completion): 2,000 次 / 月。
聊天对话(Copilot Chat): 50 次 / 月。
Auto Models 简单问题会分配到 mai-code-1.1-flash,复杂可能分配到较强大模型。
概念/术语: 上下文窗口 - Gemini 免费版的 3.2 万个 token 是指每轮有关联记忆对话的最大长度,高阶版则为 1M。 开发时节省方案: 滑动窗口(Sliding Window):仅保留最近 5 轮对话。 摘要压缩(Summarization):累积超过阈值时,调用轻量级模型压缩为一段 200 字的精简背景摘要。 AGENTS.md - 智能体编程(Agentic Coding/或Vibe Coding)的行业通用描述,等于是给 AI 编码看的 README.md。 MCP - https://github.com/modelcontextprotocol/servers 基于 JSON-RPC 进行通讯;Java MCP SDK 等。 Computer Use - 计算机使用,即让 AI 控制你的电脑来执行你提示词中的操作。 流式输出 - 首选 SSE 协议分段响应,避免使用者干等,批处理场景则应采用非流式,比如给文章生成摘要。 Agent ReAct 循环: Reasoning(推理)+ Acting(行动) 的缩写。 成品工具: DeepSeek Harness(搭配本地 Ollama 模型) Google Antigravity(搭配 Gemma 模型) Meta 的 Llama-Agents 体系。 腾讯 WorkBuddy。 里程碑: Transformer 架构(2017年论文) Encoder (编码器) - BERT 路线(2018年/Google);Decoder (解码器) - GPT 路线(2018年/OpenAI)。 2020 年的 GPT-3 能力超过 BERT;2022 年基于 GPT-3.5 的 ChatGPT 出道。 Transformer 架构出现前,即使是最先进的 RNN 也撑不过 3 轮对话。 AI 大模型搭建零基础入门教程 实战: 1. 只使用 AI 对话能力。 2. 知识库融入 AI - 塞上下文、Vector RAG 结构化、SKILL.md + Tool Calling 智能体。 OpenAI 的 Tool Calling JSON 格式被主流 AI 兼容;SKILL.md 技术则为可选。 AI Grep 即传入 Prompt + Tool,AI 根据 Prompt 判断是否需要调用用户机器的 Tool,并返回问题关键词作为参数。 安全: 提示词注入攻击 - 攻击者将恶意指令伪装在输入(即提示词)中,诱使大模型忽略开发者的原始指令,转而执行攻击者设定的操作。 AI Chat(LLM大模型)Web 客户端: 按 Enter 直接提交,Shift + Enter 则只会换行。 AI 服务端为了拿取聊天上下文,会选择 POST 请求,而非 URL 长度有限的 GET 请求。 因 SSE 协议(短上下文场景)不支持 POST,故改换为 fetch POST + Streamable HTTP 流式请求;未来可能切换为 WebTransport 不可靠数据报。 直接响应或长连接 - Accept: application/json, text/event-stream 方案参考文章 - https://juejin.cn/post/7611809566248517638

GPU 显卡

GPU
  手机 GPU 未集成显存,故直接取用普通内存中的数据。
  参数 - 显存容量决定可以同时存放多少数据;显存位宽即显存的每1个Hz传递多少数据,主流为 256-bit。
  原理 - CPU 把 *.png 转换为 RGBA8(32-bit)或 BC7(需 GPU 硬解支持) 后,放显存(VRAM)里交由 GPU 渲染;PC 最强的 VRAM Compressed(显存压缩)格式是专利未过期的 BC7,移动端则为免费的 ASTC。
    PC端采用IMR,而移动端GPU则使用基于块的渲染(TBR/TBDR/Tiled-Based-Deferred-Rendering),原理就是把读写读写读写,变为读读读写来批量写入FrameBuffer,降低写内存频率。

AI(人工智能/Artificial intelligence)

All in AI - 国内外科技大厂均制定了梭哈AI的公司发展方向。
AI 岗位 - AI 本次技术突破将会取代至少一半现有岗位,特别是文化创意类。

ChatGPT 云端对话、OpenAI 编码助手 Codex。
Model Context Protocol (MCP) 模型上下文协议 - 用于 LLM 与外部数据源和工具之间的无缝集成。
Token - 词元。Prompt - AI 提示词。
SKILL.md - AI后端根据Metadata反向拉取客户端技能描述的交互规范。
Claude Code 是 Anthropic 推出的智能编码助手,它不仅能生成代码,更能自主规划任务、调用工具完成开发工作。
Seedance - 字节跳动(ByteDance)国产视频生成AI大模型。
具身智能(Embodied Artificial Intelligence / EAI) - 身体与环境互动。
Vibe Coding - 氛围编程,即描述功能让 AI 编码。
WorkBuddy - 腾讯云推出的 AI 智能工作助理。
Tripo AI(Tripo 3D) 是由 VAST(哇嘶嗒科技) 发布的通用 3D 大模型。

大模型(LLM/Large language model)

云端部署/本地离线 - Gemini 和 ChatGPT 属于云端在线用; Gemma 3 和 DeepSeek R1 则为离线部署用。

推理缓存结构:L1 位于显存,L2 位于内存,L3 位于本地 SSD。

RAG(Retrieval Augmented Generation,检索增强生成)将大规模语言模型(LLM)与外部知识源的检索相结合,以改进问答能力。

LLM蒸馏技术:
  将Teacher Model蒸馏为Student Model,虽然会损失部分能力,但可使其硬件要求降低;国内比较火的DeepSeek-R1即为蒸馏模型。

Mac mini M4 16GiB 内存丐版最大可部署 9GiB 大小的 DeepSeek-R1-Distill-Qwen-14B,Tokens/second为11.3、8B为19.6。

LangChain(RetrievalQA) 或 AnythingLLM 通过RAG技术投喂知识库 - https://anythingllm.com/

Ollama

  官网下载 Ollama(700MiB) https://ollama.com/download/windows
  注意 - v0.9.4 之前版本在 Windows 上报 Error: llama runner process has terminated: exit status 2
  ollama list    ollama app.exe 图标右键 Settings 可指定 OLLAMA_MODELS 位置 C:\Users\pc\.ollama\models\blobs\sha256-57c9b4a897df8d1ba26a152eb7b98e8dc743e21a5d5492f8183270565b84932b
  ollama pull gemma3:1b-it-qat    用 1G 小模型测试下是否被墙(河南联通亲测未墙但后半程限速200KB/s,可通过Ctrl+C断开多次重复用前半程全速下载)。
  ollama run gemma3:1b-it-qat "What's your name?"
  [需拉取支持多模态的模型] ollama run gemma3 "caption this image /Users/$USER/Desktop/surprise.png"

Ollama 本地部署 Gemma 3:
  gemma3:27b-it-qat 显存要求15G,比 gemma3:27b-it-q4_K_M 发布晚,质量更好;端侧可用 Gemma 3n E2B 和 Gemma 3n E4B。
  ollama run gemma3:27b-it-qat "What's your name?"

Ollama 本地部署 DeepSeek:
  DeepSeek-R1	7B	4.7GB	ollama run deepseek-r1
  DeepSeek-R1	671B	404GB	ollama run deepseek-r1:671b

LangChain(RetrievalQA) 或 AnythingLLM 通过RAG技术投喂知识库 - https://anythingllm.com/

其他

机器学习(machine learning)
恐怖谷效应 - 当人类看到类似人类的物体,特别是机器人时,会产生不舒服的感受。

英伟达(Nvidia/辉达)特供中国的 H20 取得美国政府外销许可。

光模块 - AI显卡跨机柜时NVLink铜信号衰减厉害,故只能走近光速的光模块儿了,通过光纤为多个GPU算力集群提供通信。

OpenClaw - 开源本地端AI助理,俗称“养龙虾”。

AI 落地提效。

AI 泡沫、AI 短剧。

AI 会出现幻觉和谄媚情况,可通过参数调整其程度。

特朗普将 AI 改为了 Super Intelligence(SI)。

美国财长贝森特称:中国 Kimi 认为自己是美国 Claude AI 大模型。

智谱 AI 工具 ZCode 偷传 GIT 管控的全量代码后,官方进行了道歉整改并开源。

NVIDIA A2F 开源模型下载 - https://github.com/NVIDIA/Audio2Face-3D#hugging-face-hub
  需要扫描设备采集好数据,传入 R3DS Wrap4D 来进行 3D 人体模型的创建 - https://www.youtube.com/watch?v=_5lMN36NP0Q