--- 标题: "QWEN 3.8 Flash Next LOCAL AI Running" 原文链接: "https://www.youtube.com/watch?v=gR20MGAhll8" 发布日期: 2026-08-27 发现时间: 2026-08-27T06:38:50.964Z 搜索渠道: "youtube-yt-dlp" 搜索词: "QWEN 3.8 Flash Next LOCAL AI Running" 内容类型: 视频 抓取工具: "youtube-yt-dlp(cues-json)" 清洗工具: "字幕格式统一、相邻重复 cue 去重、时间戳保留为正文段落" AI优质: "否" AI打分: 31 AI分档: "非优质" AI质检状态: "不通过" AI打分理由: "正文主线是在四张RTX 3090本地工作站上运行Qwen 3.8 Flash Next量化模型并调试Llama.cpp,新增可核验内容包括93.7GB量化体积、128K上下文、约32.5降至22.3 token/s的实测及长上下文崩溃情况。当前来源是个人YouTube测试视频,转写重复且术语错乱;固定知识库未完整出现该次测试,但也无法据此认定模型首次发布。内容虽有GPU、PCIe、显存和内存参数,却属于本地模型运行教程与单一工作负载优化,没有机架级拓扑、互连、供电、液冷或可复用生产基础设施机制,也无客户、量产或部署信号,命中“教程与运维选型”及“应用与模型效率”硬否决项。" AI质检模型: "gpt-5.6-sol" AI质检时间: "2026-08-28T16:45:11+08:00" AI主题相关性: 3 AI来源权威性: 4 AI新颖性: 8 AI技术细节: 10 AI商业部署信号: 0 AI完整性: 6 AI评分提示词版本: "v17-精简生产版" AI评分提示词SHA256: "48fb9777f386026761b4873eaff30807694fb11e9b352d7c69bf2dfde750cc7d" AI评分知识库版本: "knowledge_base_v1-20260819+runtime.19" AI评分知识库SHA256: "d16bec5d70a665c5a7f45ac9fcbbee21cac06ddf9a5816bccb30c34ebd475408" AI评分知识库检索词: "[\"QWEN 3.8 Flash Next LOCAL AI Running\",\"PCIe\",\"GPU\",\"QWEN\",\"LOCAL\",\"UD\",\"IQ4XS\",\"GB\",\"Q4K\",\"XL\",\"Q4\",\"BLLM\"]" AI评分知识库命中: "[{\"id\":\"july-correct-0001\",\"title\":\"全球首颗2nm GPU来了!苏姿丰甩出“最强AI机架”,CPU性能干翻英伟达 - 智东西\",\"sourceType\":\"labeled_article\",\"time\":\"2026-07\",\"matchedTerms\":[\"PCIe\",\"GPU\",\"QWEN\",\"LOCAL\",\"UD\",\"GB\"],\"rank\":-7.76558330911102},{\"id\":\"historical-may-025\",\"title\":\"附下载|2026 Open AI Infra Summit 成果发布:标准化引领 AI 基础设施规模化落地\",\"sourceType\":\"curated_item\",\"time\":\"2026-05\",\"matchedTerms\":[\"QWEN\",\"UD\"],\"rank\":-7.261961806404548},{\"id\":\"historical-may-081\",\"title\":\"阿里平头哥AI芯片真武M890亮相 三倍性能英伟达H20!\",\"sourceType\":\"curated_item\",\"time\":\"2026-05\",\"matchedTerms\":[\"GPU\",\"QWEN\",\"GB\"],\"rank\":-7.0102213641930256},{\"id\":\"july-correct-0025\",\"title\":\"Marvell Brings Radix, Low Latency, And Bandwidth To Bear With Teralynx T100\",\"sourceType\":\"labeled_article\",\"time\":\"2026-07\",\"matchedTerms\":[\"UD\",\"GB\",\"Q4\"],\"rank\":-6.243097547345958},{\"id\":\"july-correct-0090\",\"title\":\"Scaling Agentic AI Factories Through Extreme Co-Design with NVIDIA BlueField | NVIDIA Technical Blog\",\"sourceType\":\"labeled_article\",\"time\":\"2026-07\",\"matchedTerms\":[\"PCIe\",\"GPU\",\"LOCAL\",\"UD\",\"GB\"],\"rank\":-6.01422292737934}]" AI摘要: "作者用四块 RTX 3090 搭配 Unsloth UD IQ4XS 量化(93.7GB),本地运行即将推出的 Qwen 3.8 Flash Next,并称这是 Qwen 4 架构预览。" AI摘要模型: "ali-deepseek-v4-flash" AI摘要时间: "2026-09-07T02:08:28.704Z" --- 我们正在测试 我们正在测试 Quinn 的最新产品。 这是即将推出的 Quinn 的最新产品。 这是即将推出的 Quinn 的最新产品。 这是即将推出的 Quinn 4 架构的预览,它确实包含 Quinn 4 架构的预览,它确实包含 Quinn 4 架构的预览,它确实包含 相当重大的变化,并且 相当重大的变化,并且 相当重大的变化,并且 有望提高 有望提高 有望提高 大型模型的性能,这对于 大型模型的性能,这对于 像我们今天在这里运行本地 AI 的人来说尤其重要。 像我们今天在这里运行本地 AI 的人来说尤其重要。 我们将使用配备 我们将使用配备 我们将使用配备 Quad 3090 的机架。 我们将运行 Quad 3090 的机架。 我们将运行 Quad 3090 的机架。 我们将运行 Quinn 3.8 Flash Next。 我们将 Quinn 3.8 Flash Next。 我们将 Quinn 3.8 Flash Next。 我们将 使用 Unsloth Quant,并且我们 使用 Unsloth Quant,并且我们 使用 Unsloth Quant,并且我们 将使用 UD IQ4XS, 将使用 UD IQ4XS, 将使用 UD IQ4XS, 它相当大。 它相当大。 它相当大。 这个系列的 这个系列的 这个系列的 基本型号有一些创新之处, 基本型号有一些创新之处, 基本型号有一些创新之处, 当然,就像我之前提到的 当然,就像我之前提到的 当然,就像我之前提到的 Quinn 4 一样,这些创新之处也会陆续推出。所以我建议你仔细阅读一下相关信息 Quinn 4 一样,这些创新之处也会陆续推出。所以我建议你仔细阅读一下相关信息 Quinn 4 一样,这些创新之处也会陆续推出。所以我建议你仔细阅读一下相关信息 。 这里有很多很棒的 。 这里有很多很棒的 。 这里有很多很棒的 信息。 此外,Unsloth 已经 信息。 此外,Unsloth 已经 信息。 此外,Unsloth 已经 提交了 pull 提交了 pull 提交了 pull request,他在这项工作中发挥了重要作用。 所以他们 request,他在这项工作中发挥了重要作用。 所以他们 request,他在这项工作中发挥了重要作用。 所以他们 为此专门制作了一个非常好的文档页面。 目前,您 为此专门制作了一个非常好的文档页面。 目前,您 为此专门制作了一个非常好的文档页面。 目前,您 需要完成此步骤并提交该拉取 需要完成此步骤并提交该拉取 需要完成此步骤并提交该拉取 请求,因为 Llama 请求,因为 Llama 请求,因为 Llama C++ 尚未将其合并到 C++ 尚未将其合并到 C++ 尚未将其合并到 主分支中。 所以我们将使用 主分支中。 所以我们将使用 93.7 GB 的 UD IQ4XS,它肯定 93.7 GB 的 UD IQ4XS,它肯定 比 Q4K XL 小得多,而 Q4K XL 通常 比 Q4K XL 小得多,而 Q4K XL 通常 比 Q4K XL 小得多,而 Q4K XL 通常 是我在 Q4 端选择的量化产品 是我在 Q4 端选择的量化产品 是我在 Q4 端选择的量化产品 。 但是,你知道,我想 。 但是,你知道,我想 。 但是,你知道,我想 确保它能适配 43090s,因为 确保它能适配 43090s,因为 确保它能适配 43090s,因为 这是一个非常流行的配置。 而 这是一个非常流行的配置。 而 这是一个非常流行的配置。 而 我那边那台 4090 我那边那台 4090 我那边那台 4090 目前正被用作桌面电脑,用来 目前正被用作桌面电脑,用来 目前正被用作桌面电脑,用来 编码所有内容。 编码所有内容。 编码所有内容。 不过,其中最酷的功能之一是印痕功能。 不过,其中最酷的功能之一是印痕功能。 不过,其中最酷的功能之一是印痕功能。 我们稍后会详细讨论这个问题。 我们稍后会详细讨论这个问题。 我们稍后会详细讨论这个问题。 但我已经把服务器启动并 但我已经把服务器启动并 但我已经把服务器启动并 运行了。 那么,我们就正式开始吧,我 运行了。 那么,我们就正式开始吧,我 运行了。 那么,我们就正式开始吧,我 将介绍一下 将介绍一下 将介绍一下 我给法学硕士提出的挑战是什么。 我给法学硕士提出的挑战是什么。 我给法学硕士提出的挑战是什么。 这对在场的 Llama C++ 专家来说也是个挑战, 这对在场的 Llama C++ 专家来说也是个挑战, 这对在场的 Llama C++ 专家来说也是个挑战, 因为我知道 因为我知道 因为我知道 有一些专家,而且我通常大部分 有一些专家,而且我通常大部分 有一些专家,而且我通常大部分 时间都在配置 BLLM, 时间都在配置 BLLM, 时间都在配置 BLLM, 现在我已经把配置过程标准化了,仔细 现在我已经把配置过程标准化了,仔细 想想,大部分内容都很有道理, 想想,大部分内容都很有道理, 但我并不了解 Llama C++ 中的所有标志, 但我并不了解 Llama C++ 中的所有标志, 但我并不了解 Llama C++ 中的所有标志, 而 而 而 Llama C++ 的标志又很多。 那么我们来简单了解一下, Llama C++ 的标志又很多。 那么我们来简单了解一下, Llama C++ 的标志又很多。 那么我们来简单了解一下, 我先设置好, 我先设置好, 我先设置好, 然后我们跳到 然后我们跳到 然后我们跳到 更大的显示屏上查看运行模块 更大的显示屏上查看运行模块 更大的显示屏上查看运行模块 。 所以,我基本上是在挑战 。 所以,我基本上是在挑战 。 所以,我基本上是在挑战 法学硕士学位。 能否进一步优化? 法学硕士学位。 能否进一步优化? 法学硕士学位。 能否进一步优化? 这也是件好事。 请 这也是件好事。 请 这也是件好事。 请 在下方评论区分享您的优化方案。 在下方评论区分享您的优化方案。 当然,还要特别感谢我们所有的会员,以及所有点赞 当然,还要特别感谢我们所有的会员,以及所有点赞 和分享这篇文章的人。 您好,您 和分享这篇文章的人。 您好,您 和分享这篇文章的人。 您好,您 是 Quinn 3.8 下一个闪存,运行为 是 Quinn 3.8 下一个闪存,运行为 是 Quinn 3.8 下一个闪存,运行为 Unsloth UDIQ4XS Unsloth UDIQ4XS Unsloth UDIQ4XS 量化器。 去看看关于 量化器。 去看看关于 量化器。 去看看关于 拥抱脸部无懒惰的文章, 拥抱脸部无懒惰的文章, 拥抱脸部无懒惰的文章, 我把它放在那里了。 你 我把它放在那里了。 你 我把它放在那里了。 你 应该去看看。 另外,你必须 应该去看看。 另外,你必须 应该去看看。 另外,你必须 检查一下,因为在 检查一下,因为在 检查一下,因为在 开始考虑 开始考虑 开始考虑 标志和配置之前,模型已经存在。 标志和配置之前,模型已经存在。 标志和配置之前,模型已经存在。 在产品发布之前,您有一个预定的截止日期。 先做那件事。 在产品发布之前,您有一个预定的截止日期。 先做那件事。 在产品发布之前,您有一个预定的截止日期。 先做那件事。 如果你和 Quinn 如果你和 Quinn 如果你和 Quinn 模特打交道,而你还没见过他们质疑 模特打交道,而你还没见过他们质疑 模特打交道,而你还没见过他们质疑 你,那你就错了,他们喜欢质疑你 你,那你就错了,他们喜欢质疑你 你,那你就错了,他们喜欢质疑你 。 所以,最好事先制定一些 。 所以,最好事先制定一些 。 所以,最好事先制定一些 这样的基本规则。 然后 这样的基本规则。 然后 这样的基本规则。 然后 检查一下 Llama C++,它是你 检查一下 Llama C++,它是你 检查一下 Llama C++,它是你 这里使用的引擎。 我提供了GGML链接。 嗯, 这里使用的引擎。 我提供了GGML链接。 嗯, 这里使用的引擎。 我提供了GGML链接。 嗯, 我们来看看你能不能优化我的运行 我们来看看你能不能优化我的运行 我们来看看你能不能优化我的运行 块,特别是 块,特别是 块,特别是 针对 Hermes 代理 针对 Hermes 代理 针对 Hermes 代理 工作流程的提示处理。 我给他们提供了 Hermes 工作流程的提示处理。 我给他们提供了 Hermes 工作流程的提示处理。 我给他们提供了 Hermes 代理的文本文件,该文件比较小巧 代理的文本文件,该文件比较小巧 代理的文本文件,该文件比较小巧 精简,以便它能够读取。 精简,以便它能够读取。 精简,以便它能够读取。 这是我当前的运行模块。 我们将更 这是我当前的运行模块。 我们将更 这是我当前的运行模块。 我们将更 详细地讲解运行模块。 所以 详细地讲解运行模块。 所以 详细地讲解运行模块。 所以 我打算直接跳过那部分。 我打算直接跳过那部分。 我打算直接跳过那部分。 这是您当前的运行块。 我 这是您当前的运行块。 我 这是您当前的运行块。 我 可不是什么C++专家。 真的。 我通常 可不是什么C++专家。 真的。 我通常 可不是什么C++专家。 真的。 我通常 使用VLM,所以需要一些帮助来调整它。 我 使用VLM,所以需要一些帮助来调整它。 我 使用VLM,所以需要一些帮助来调整它。 我 预计可能会有一些股票被 预计可能会有一些股票被 预计可能会有一些股票被 抛售。 抛售。 抛售。 由于你的 由于你的 由于你的 Ingram 附加哈希表,这可能不会产生太大影响,我 Ingram 附加哈希表,这可能不会产生太大影响,我 Ingram 附加哈希表,这可能不会产生太大影响,我 相信我已经有足够的证据可以这样 相信我已经有足够的证据可以这样 相信我已经有足够的证据可以这样 说。 所以我目前使用的是 说。 所以我目前使用的是 说。 所以我目前使用的是 四颗 3090 显卡,搭配 3945WX 12 核 24 线程处理器, 四颗 3090 显卡,搭配 3945WX 12 核 24 线程处理器, 四颗 3090 显卡,搭配 3945WX 12 核 24 线程处理器, 八条 2133 内存, 八条 2133 内存, 八条 2133 内存, 主板是 WRX80,有 128 条 主板是 WRX80,有 128 条 主板是 WRX80,有 128 条 PCIe 通道,所有 GPU 都以 PCIe 通道,所有 GPU 都以 PCIe 通道,所有 GPU 都以 完整的 Gen 4 X16 宽度进行协商。 我们正在 完整的 Gen 4 X16 宽度进行协商。 我们正在 完整的 Gen 4 X16 宽度进行协商。 我们正在 优化的是 Hermes Agentic 优化的是 Hermes Agentic 优化的是 Hermes Agentic 框架,使其能够在此配置下流畅运行, 框架,使其能够在此配置下流畅运行, 框架,使其能够在此配置下流畅运行, 以执行长时间的任务。 以执行长时间的任务。 以执行长时间的任务。 这也是当前的运行块。 所以 这也是当前的运行块。 所以 这也是当前的运行块。 所以 你有一个很大的上下文窗口。 我把 你有一个很大的上下文窗口。 我把 你有一个很大的上下文窗口。 我把 它设置成 13176 072。所以就是 它设置成 13176 072。所以就是 它设置成 13176 072。所以就是 128K。 所以请务必全面详尽。 我 128K。 所以请务必全面详尽。 我 128K。 所以请务必全面详尽。 我 添加这条注释。 UD IQ4 添加这条注释。 UD IQ4 添加这条注释。 UD IQ4 XS 的容量为 93.7 GB。 这应该引起一些 XS 的容量为 93.7 GB。 这应该引起一些 XS 的容量为 93.7 GB。 这应该引起一些 警惕,因为 96 GB 是 警惕,因为 96 GB 是 警惕,因为 96 GB 是 VRAM 的总量,而且还有一些额外 VRAM 的总量,而且还有一些额外 VRAM 的总量,而且还有一些额外 开销。 Llama C++ 将 开销。 Llama C++ 将 开销。 Llama C++ 将 默认使用 fit 函数。 我其实觉得我已经把 默认使用 fit 函数。 我其实觉得我已经把 默认使用 fit 函数。 我其实觉得我已经把 它调整到合适的尺寸了,不过我们再 它调整到合适的尺寸了,不过我们再 它调整到合适的尺寸了,不过我们再 检查一下。 而这正是 检查一下。 而这正是 检查一下。 而这正是 我认为值得 我认为值得 我认为值得 怀疑的事情之一。 请在 怀疑的事情之一。 请在 怀疑的事情之一。 请在 下方评论区畅所欲言。 通常情况下,fit on 都 下方评论区畅所欲言。 通常情况下,fit on 都 下方评论区畅所欲言。 通常情况下,fit on 都 非常好用,但这次我却遇到了 非常好用,但这次我却遇到了 非常好用,但这次我却遇到了 很多困难,fit on 很难正常 很多困难,fit on 很难正常 很多困难,fit on 很难正常 工作。 请考虑将 工作。 请考虑将 工作。 请考虑将 engram 卸载到 RAM 和 Optane 中,以便将来 engram 卸载到 RAM 和 Optane 中,以便将来 engram 卸载到 RAM 和 Optane 中,以便将来 运行更大规模的量化任务 运行更大规模的量化任务 运行更大规模的量化任务 。 如果你有像 。 如果你有像 。 如果你有像 这样的 NVME 固态硬盘, 这样的 NVME 固态硬盘, 这样的 NVME 固态硬盘, 这些硬盘很老了,实际上是 PCIe 这些硬盘很老了,实际上是 PCIe 这些硬盘很老了,实际上是 PCIe Gen 2 设备,我想可能是 Gen 2 设备,我想可能是 Gen 2 设备,我想可能是 900p,但 900p,但 900p,但 这些硬盘的带宽并不重要。 这些人 这些硬盘的带宽并不重要。 这些人 这些硬盘的带宽并不重要。 这些人 带宽并不宽裕。 他们拥有的是 带宽并不宽裕。 他们拥有的是 带宽并不宽裕。 他们拥有的是 惊人的右手耐力。 没错,而且 惊人的右手耐力。 没错,而且 惊人的右手耐力。 没错,而且 延迟真的非常非常低。 现在, 延迟真的非常非常低。 现在, 延迟真的非常非常低。 现在, 它是否和你的系统内存一样低? 不, 它是否和你的系统内存一样低? 不, 它是否和你的系统内存一样低? 不, 它可能不会低于 它可能不会低于 它可能不会低于 你的系统内存。 你的系统内存。 你的系统内存。 如果可以的话,最好还是使用系统内存。 如果可以的话,最好还是使用系统内存。 如果可以的话,最好还是使用系统内存。 然而,很多人都会获得 然而,很多人都会获得 然而,很多人都会获得 NVMe认证。 如果你有一个低延迟的 NVME 固态硬盘, NVMe认证。 如果你有一个低延迟的 NVME 固态硬盘, NVMe认证。 如果你有一个低延迟的 NVME 固态硬盘, 可以分配 4K 数据块,那么 可以分配 4K 数据块,那么 可以分配 4K 数据块,那么 它也可以作为 它也可以作为 它也可以作为 卸载设备,配合 MAPAP 等技术来处理 卸载设备,配合 MAPAP 等技术来处理 卸载设备,配合 MAPAP 等技术来处理 你的负载类型。 现在,我已经 你的负载类型。 现在,我已经 你的负载类型。 现在,我已经 设置成不实际使用它,但 设置成不实际使用它,但 设置成不实际使用它,但 我会解释一下为什么 我会解释一下为什么 我会解释一下为什么 我认为我目前的运行块 我认为我目前的运行块 我认为我目前的运行块 对于我目前的设置来说相当不错。 对于我目前的设置来说相当不错。 对于我目前的设置来说相当不错。 你可以看到, 你可以看到, 你可以看到, 目前 TG 端每秒大约有 32.5 个代币。 目前 TG 端每秒大约有 32.5 个代币。 目前 TG 端每秒大约有 32.5 个代币。 让我们看看上下文窗口打开到什么程度了 让我们看看上下文窗口打开到什么程度了 让我们看看上下文窗口打开到什么程度了 。 所以,我们 。 所以,我们 。 所以,我们 已经进入上下文窗口的第 41,000 页了。 我们还剩下 已经进入上下文窗口的第 41,000 页了。 我们还剩下 已经进入上下文窗口的第 41,000 页了。 我们还剩下 大约9万。 它 大约9万。 它 大约9万。 它 运行得非常流畅,但同时也在 运行得非常流畅,但同时也在 运行得非常流畅,但同时也在 优化一些技术上需要 优化一些技术上需要 优化一些技术上需要 用到的东西。我这就给你展示一下, 用到的东西。我这就给你展示一下, 用到的东西。我这就给你展示一下, 你会惊叹:哇, 你会惊叹:哇, 为了达到这样的速度,它竟然使用了如此多的系统内存,真是 为了达到这样的速度,它竟然使用了如此多的系统内存,真是 太不可思议了!这就是 Engram 的 太不可思议了!这就是 Engram 的 太不可思议了!这就是 Engram 的 强大之处。它本身并 强大之处。它本身并 强大之处。它本身并 没有占用大量的 没有占用大量的 没有占用大量的 带宽,但它却拥有巨大的 带宽,但它却拥有巨大的 带宽,但它却拥有巨大的 空间,这也是为什么它的 空间,这也是为什么它的 模型可能稍微大一些的原因。但是, 模型可能稍微大一些的原因。但是, 正如你在这里看到的,Engram 被放置在 正如你在这里看到的,Engram 被放置在 正如你在这里看到的,Engram 被放置在 一个覆盖张量中,这些嵌入 一个覆盖张量中,这些嵌入 一个覆盖张量中,这些嵌入 被放置在 CPU 上,这基本上就像 被放置在 CPU 上,这基本上就像 被放置在 CPU 上,这基本上就像 我设置中的系统内存一样。 如果 我设置中的系统内存一样。 如果 我设置中的系统内存一样。 如果 你有的话,根据我所 你有的话,根据我所 你有的话,根据我所 看到的,也许 48 GB,也许 56 GB 的系统 看到的,也许 48 GB,也许 56 GB 的系统 看到的,也许 48 GB,也许 56 GB 的系统 内存,可能 64 GB 的系统内存,呃,如果 内存,可能 64 GB 的系统内存,呃,如果 内存,可能 64 GB 的系统内存,呃,如果 没有大量的 没有大量的 没有大量的 其他东西占用,应该可以 其他东西占用,应该可以 其他东西占用,应该可以 很安全地达到 128K。 我还没有 很安全地达到 128K。 我还没有 很安全地达到 128K。 我还没有 尝试过 256 之类的配置, 尝试过 256 之类的配置, 尝试过 256 之类的配置, 但希望这能帮助我达到 但希望这能帮助我达到 但希望这能帮助我达到 256 的水平, 256 的水平, 256 的水平, 因为如果可能的话,我想拥有那样的配置 因为如果可能的话,我想拥有那样的配置 因为如果可能的话,我想拥有那样的配置 。 而且, 。 而且, 。 而且, 我必须说,从技术角度来看,它的性能 我必须说,从技术角度来看,它的性能 我必须说,从技术角度来看,它的性能 比我 比我 在 VLM 下运行的 Quinn 3.827B 慢。 尤其是 在 VLM 下运行的 Quinn 3.827B 慢。 尤其是 在响应处理方面,这 在响应处理方面,这 在响应处理方面,这 方面的速度要慢得多。 方面的速度要慢得多。 方面的速度要慢得多。 所以,我只想快速地把一些 所以,我只想快速地把一些 所以,我只想快速地把一些 我遇到的事情说完。 我看到 我遇到的事情说完。 我看到 我遇到的事情说完。 我看到 前面这两个设备 前面这两个设备 前面这两个设备 指定了设备顺序,PCI 指定了设备顺序,PCI 指定了设备顺序,PCI 总线 ID 就是它的分配方式。 这些都是 总线 ID 就是它的分配方式。 这些都是 总线 ID 就是它的分配方式。 这些都是 很常见的。 我一直都设置这些。 很常见的。 我一直都设置这些。 很常见的。 我一直都设置这些。 羊驼注意力丧失,无法使用。 当 羊驼注意力丧失,无法使用。 当 你观看此视频并 你观看此视频并 自行设置和配置时,很可能已经不需要那个功能了,因为 自行设置和配置时,很可能已经不需要那个功能了,因为 自行设置和配置时,很可能已经不需要那个功能了,因为 它与这里的 KV 缓存为 Q8 它与这里的 KV 缓存为 Q8 它与这里的 KV 缓存为 Q8 和 Q8 有关。 如果你没有 和 Q8 有关。 如果你没有 和 Q8 有关。 如果你没有 对 KV 缓存进行量化,那么你可能不需要 对 KV 缓存进行量化,那么你可能不需要 对 KV 缓存进行量化,那么你可能不需要 它。 但将来很 它。 但将来很 它。 但将来很 可能也会得到解决。 接下来我会快速 可能也会得到解决。 接下来我会快速 可能也会得到解决。 接下来我会快速 浏览一下剩下的部分。 我们有 浏览一下剩下的部分。 我们有 浏览一下剩下的部分。 我们有 典型的内容,我的主机姜 典型的内容,我的主机姜 典型的内容,我的主机姜 模板会吸引人们的注意力。 我 模板会吸引人们的注意力。 我 模板会吸引人们的注意力。 我 关闭了,我关闭的原因是, 关闭了,我关闭的原因是, 关闭了,我关闭的原因是, 我只是想 我只是想 我只是想 在图层模式下分散处理,并且我想 在图层模式下分散处理,并且我想 在图层模式下分散处理,并且我想 确保每个标记嵌入和 确保每个标记嵌入和 确保每个标记嵌入和 印迹嵌入都由 CPU 处理。 如果你 印迹嵌入都由 CPU 处理。 如果你 印迹嵌入都由 CPU 处理。 如果你 知道更好的方法,请务必 知道更好的方法,请务必 知道更好的方法,请务必 在下方评论区留言。 主 在下方评论区留言。 主 在下方评论区留言。 主 GPU被指定为零。 现在我尝试了 20 GPU被指定为零。 现在我尝试了 20 GPU被指定为零。 现在我尝试了 20 27 27 26,这通常 27 27 26,这通常 27 27 26,这通常 在 llama C++ 中进行张量分割时效果很好, 在 llama C++ 中进行张量分割时效果很好, 在 llama C++ 中进行张量分割时效果很好, 但每次都失败 但每次都失败 但每次都失败 。 我当时的想法是,我 。 我当时的想法是,我 。 我当时的想法是,我 知道视觉堆栈 知道视觉堆栈 知道视觉堆栈 目前位于 GPU0 上。 如果你往下看, 目前位于 GPU0 上。 如果你往下看, 目前位于 GPU0 上。 如果你往下看, 可以看到 GPU0 的 meim 使用率为 86%,而 可以看到 GPU0 的 meim 使用率为 86%,而 可以看到 GPU0 的 meim 使用率为 86%,而 其余三个 GPU 的 meim 使用率约为 76% 到 78% 其余三个 GPU 的 meim 使用率约为 76% 到 78% 其余三个 GPU 的 meim 使用率约为 76% 到 78% 。 我以为我试图 。 我以为我试图 。 我以为我试图 转移一些数据,但当上下文数量超过 转移一些数据,但当上下文数量超过 转移一些数据,但当上下文数量超过 4 万时,程序就会 4 万时,程序就会 4 万时,程序就会 崩溃,无法稳定运行。 崩溃,无法稳定运行。 崩溃,无法稳定运行。 实际上,我已经将并行度设置为固定大小 实际上,我已经将并行度设置为固定大小 实际上,我已经将并行度设置为固定大小 1,这使得像基因工程这样的工作 1,这使得像基因工程这样的工作 1,这使得像基因工程这样的工作 很难进行。 呃,批处理 很难进行。 呃,批处理 很难进行。 呃,批处理 大小为 4096,批处理大小为 2048。所以 大小为 4096,批处理大小为 2048。所以 大小为 4096,批处理大小为 2048。所以 缓存提示符,你可以看到它在 缓存提示符,你可以看到它在 缓存提示符,你可以看到它在 这里也正常工作。 我们 这里也正常工作。 我们 这里也正常工作。 我们 确实取得了相当大的成功, 确实取得了相当大的成功, 确实取得了相当大的成功, 现在已经深入到 7 万个目标了。 所以有 43,743 个 现在已经深入到 7 万个目标了。 所以有 43,743 个 现在已经深入到 7 万个目标了。 所以有 43,743 个 缓存命中线程。 我有 6、12 和 缓存命中线程。 我有 6、12 和 缓存命中线程。 我有 6、12 和 4 个 CPU。我认为这是一个非常保守的配置, 4 个 CPU。我认为这是一个非常保守的配置, 4 个 CPU。我认为这是一个非常保守的配置, 但也包括 12 核 24 线程。 这里没有大型 但也包括 12 核 24 线程。 这里没有大型 但也包括 12 核 24 线程。 这里没有大型 机器。 所以 机器。 所以 机器。 所以 在这方面要稍微保守一些。 以及在场 在这方面要稍微保守一些。 以及在场 在这方面要稍微保守一些。 以及在场 处罚。 其余内容都 处罚。 其余内容都 处罚。 其余内容都 像是推荐信息,而且我已经 像是推荐信息,而且我已经 像是推荐信息,而且我已经 启用了指标功能。 所以, 启用了指标功能。 所以, 启用了指标功能。 所以, 我唯一觉得有趣的地方就是 我唯一觉得有趣的地方就是 这里,也就是覆盖张量并将 这里,也就是覆盖张量并将 那些印痕放到 那些印痕放到 那些印痕放到 RAM 中的这部分。 你可以看到,我们现在大约有 37 RAM 中的这部分。 你可以看到,我们现在大约有 37 RAM 中的这部分。 你可以看到,我们现在大约有 37 GB。 情况看起来相当 GB。 情况看起来相当 GB。 情况看起来相当 稳定,但你可以看到衰减情况, 稳定,但你可以看到衰减情况, 稳定,但你可以看到衰减情况, 我们称之为大规模的 TG 衰减,已经 我们称之为大规模的 TG 衰减,已经 我们称之为大规模的 TG 衰减,已经 从上面的 29 28 下降到 从上面的 29 28 下降到 从上面的 29 28 下降到 这里的 22 左右。 所以,我非常希望能够 这里的 22 左右。 所以,我非常希望能够 这里的 22 左右。 所以,我非常希望能够 更 更 更 有效地应对这个问题。 我搞不明白 有效地应对这个问题。 我搞不明白 有效地应对这个问题。 我搞不明白 。 虽然这方面 。 虽然这方面 。 虽然这方面 在生成 在生成 在生成 速度上并没有完全体现出来,但如果能够找到办法在 速度上并没有完全体现出来,但如果能够找到办法在 初始速度较低的情况下稳定性能,那也 初始速度较低的情况下稳定性能,那也 绝对是我所希望的。 如果 绝对是我所希望的。 如果 绝对是我所希望的。 如果 你有什么好想法,特别是 你有什么好想法,特别是 你有什么好想法,特别是 关于 Llama C++ 关于 Llama C++ 关于 Llama C++ 标志的使用方法,请在下面的评论中分享, 标志的使用方法,请在下面的评论中分享, 标志的使用方法,请在下面的评论中分享, 因为这里是人们 因为这里是人们 因为这里是人们 获取信息、分享 获取信息、分享 获取信息、分享 信息的好地方,尤其 信息的好地方,尤其 信息的好地方,尤其 希望这能帮助一些不知道从何入手的人 希望这能帮助一些不知道从何入手的人 。 它 。 它 比 比 比 Quinn 3.827B 的 Q4 版本更好吗? Quinn 3.827B 的 Q4 版本更好吗? Quinn 3.827B 的 Q4 版本更好吗? 这是一个很好的问题,我很 这是一个很好的问题,我很 这是一个很好的问题,我很 期待您对它的 期待您对它的 期待您对它的 质量有何看法。 我现在还不能确定到底是哪种情况 质量有何看法。 我现在还不能确定到底是哪种情况 。 我跑步的 。 我跑步的 时间还不够。 我经历了很多次崩溃。 时间还不够。 我经历了很多次崩溃。 时间还不够。 我经历了很多次崩溃。 我通常喜欢先进行一些调整,然后在 我通常喜欢先进行一些调整,然后在 我通常喜欢先进行一些调整,然后在 运行起来之后,我 运行起来之后,我 运行起来之后,我 实际的评估时间都花在 实际的评估时间都花在 实际的评估时间都花在 Hermes Agent 内部,我不太会在 Hermes Agent 内部,我不太会在 Hermes Agent 内部,我不太会在 Hermes Agent 之外进行评估 Hermes Agent 之外进行评估 Hermes Agent 之外进行评估 。 而且这很困难, 。 而且这很困难, 。 而且这很困难, 因为要让这一切稳定运行下去,我的 因为要让这一切稳定运行下去,我的 因为要让这一切稳定运行下去,我的 意思是,我们做得 意思是,我们做得 意思是,我们做得 比我通常做得要好。 我们 比我通常做得要好。 我们 比我通常做得要好。 我们 现在是 82.9K。 所以,这比 现在是 82.9K。 所以,这比 现在是 82.9K。 所以,这比 我之前的情况要好多了。 我之前的情况要好多了。 我之前的情况要好多了。 现在,它能否给我一个答案,这倒 现在,它能否给我一个答案,这倒 现在,它能否给我一个答案,这倒 成了一个值得探讨的问题。 成了一个值得探讨的问题。 成了一个值得探讨的问题。 我有点担心它能 我有点担心它能 不能及时给出答案。 但他 不能及时给出答案。 但他 是一位爱思考的人。 它的默认值会 是一位爱思考的人。 它的默认值会 是一位爱思考的人。 它的默认值会 是 X 高,这说明爱思考的人 是 X 高,这说明爱思考的人 是 X 高,这说明爱思考的人 肯定会尽可能地过度思考一切 肯定会尽可能地过度思考一切 肯定会尽可能地过度思考一切 。 所以,你可能需要 。 所以,你可能需要 。 所以,你可能需要 把它调低一些。 我也不确定降低价格 把它调低一些。 我也不确定降低价格 把它调低一些。 我也不确定降低价格 会对质量产生什么影响 会对质量产生什么影响 会对质量产生什么影响 。 我以为 。 我以为 。 我以为 这样没问题。 我的意思是,我们 这样没问题。 我的意思是,我们 这样没问题。 我的意思是,我们 这里有 131,000 个代币。 所以,我们还有 这里有 131,000 个代币。 所以,我们还有 这里有 131,000 个代币。 所以,我们还有 一些时间。 说实话,时间不多了 一些时间。 说实话,时间不多了 一些时间。 说实话,时间不多了 。 我们还有 44K 个 。 我们还有 44K 个 。 我们还有 44K 个 剩余代币。 这件事 剩余代币。 这件事 剩余代币。 这件事 很快就会过去。 所以,希望 很快就会过去。 所以,希望 很快就会过去。 所以,希望 它能尽快提出 它能尽快提出 它能尽快提出 一些建议给我。 我觉得 一些建议给我。 我觉得 一些建议给我。 我觉得 用这个配置 Hermes 应该 用这个配置 Hermes 应该 用这个配置 Hermes 应该 足够了,可以看看 足够了,可以看看 足够了,可以看看 Hermes 代理内部的质量表现如何。 进展会比较 Hermes 代理内部的质量表现如何。 进展会比较 Hermes 代理内部的质量表现如何。 进展会比较 慢,但可能会 慢,但可能会 慢,但可能会 在接下来的几天内发布后续视频 在接下来的几天内发布后续视频 在接下来的几天内发布后续视频 。 当然,GLM 5.3 刚刚发布, 。 当然,GLM 5.3 刚刚发布, 。 当然,GLM 5.3 刚刚发布, 我仍然对免费代币感到非常兴奋 我仍然对免费代币感到非常兴奋 我仍然对免费代币感到非常兴奋 。 我希望 GLM 5.3 能被 。 我希望 GLM 5.3 能被 。 我希望 GLM 5.3 能被 免费代币用户接受,而且 免费代币用户接受,而且 我肯定也已经准备好了 Epic 版本 我肯定也已经准备好了 Epic 版本 。 所以,运一两块GPU 。 所以,运一两块GPU 。 所以,运一两块GPU 过去,在Epic上运行。 我的意思是,就 过去,在Epic上运行。 我的意思是,就 过去,在Epic上运行。 我的意思是,就 目前而言,Free Token 是 目前而言,Free Token 是 目前而言,Free Token 是 单 GPU 的。 我听说即将 单 GPU 的。 我听说即将 单 GPU 的。 我听说即将 推出的免费代币将支持多 GPU,这 推出的免费代币将支持多 GPU,这 推出的免费代币将支持多 GPU,这 可能是降低本地 AI 硬件实际总成本的最令人兴奋的事情之一, 可能是降低本地 AI 硬件实际总成本的最令人兴奋的事情之一, 希望它能尽快推出 希望它能尽快推出 。 但我们会坚持下去, 。 但我们会坚持下去, 。 但我们会坚持下去, 直到出现崩溃 直到出现崩溃 直到出现崩溃 或得到答案为止。 还有一种 或得到答案为止。 还有一种 或得到答案为止。 还有一种 可能性是, 可能性是, 可能性是, 代币用完了,游戏就停止了。 但愿不是 代币用完了,游戏就停止了。 但愿不是 代币用完了,游戏就停止了。 但愿不是 这样。 但愿不是这样。 这样。 但愿不是这样。 这样。 但愿不是这样。 目前我们已经使用了 42 GB 的 目前我们已经使用了 42 GB 的 目前我们已经使用了 42 GB 的 空间。 所以 空间。 所以 空间。 所以 内存利用率相当高。 你可以看到, 内存利用率相当高。 你可以看到, 内存利用率相当高。 你可以看到, 后端生成的报告 后端生成的报告 后端生成的报告 看起来确实如此。 感觉更像 看起来确实如此。 感觉更像 看起来确实如此。 感觉更像 是17号位。 我不确定 是17号位。 我不确定 是17号位。 我不确定 Llama C++ 的用户界面是否具有某种聚合 Llama C++ 的用户界面是否具有某种聚合 Llama C++ 的用户界面是否具有某种聚合 功能。 我觉得好像还没到25, 功能。 我觉得好像还没到25, 功能。 我觉得好像还没到25, 但我们真的快要 但我们真的快要 但我们真的快要 用完了。 我们距离 用完了。 我们距离 用完了。 我们距离 答案用完还差 11200 个代币 答案用完还差 11200 个代币 答案用完还差 11200 个代币 。 这里真的需要开始生成 。 这里真的需要开始生成 。 这里真的需要开始生成 答案了。 答案了。 答案了。 你已进入危险区域。 它已经进入危险 你已进入危险区域。 它已经进入危险 你已进入危险区域。 它已经进入危险 区域了。 目前还剩 6,800 个代币 区域了。 目前还剩 6,800 个代币 区域了。 目前还剩 6,800 个代币 。 现在,平均速度已降至 。 现在,平均速度已降至 。 现在,平均速度已降至 每秒 22.3 个代币。 高度危险 每秒 22.3 个代币。 高度危险 每秒 22.3 个代币。 高度危险 区域。 高度危险区域。 已使用96%。 区域。 高度危险区域。 已使用96%。 区域。 高度危险区域。 已使用96%。 哦,确定最终配置方案吧。 哦,确定最终配置方案吧。 哦,确定最终配置方案吧。 尚未确定最终配置方案。 尚未确定最终配置方案。 尚未确定最终配置方案。 我告诉它要全面解读,但它 我告诉它要全面解读,但它 我告诉它要全面解读,但它 知道它有 131 个字符。它能够读取 知道它有 131 个字符。它能够读取 知道它有 131 个字符。它能够读取 这个代码块。 那么 这个代码块。 那么 这个代码块。 那么 你正在做什么? 你正在做什么? 你正在做什么? 不过,这条线索里确实包含一些很有价值的信息 不过,这条线索里确实包含一些很有价值的信息 不过,这条线索里确实包含一些很有价值的信息 。 我打算把 。 我打算把 。 我打算把 这个跟踪结果发布到 digitalspaceport.com 网站上, 这个跟踪结果发布到 digitalspaceport.com 网站上, 然后把它放在 Quinn 3.8 的 然后把它放在 Quinn 3.8 的 下一个 Flash 版本下。 这样你还可以将其分块 下一个 Flash 版本下。 这样你还可以将其分块 下一个 Flash 版本下。 这样你还可以将其分块 到你的 LLM 或跟踪库中, 到你的 LLM 或跟踪库中, 到你的 LLM 或跟踪库中, 因为这里面有一些有用的信息。 因为这里面有一些有用的信息。 因为这里面有一些有用的信息。 它实际上进行了一些非常 它实际上进行了一些非常 它实际上进行了一些非常 全面的信息 全面的信息 全面的信息 收集工作。 不过,我觉得它恐怕无法到达 收集工作。 不过,我觉得它恐怕无法到达 收集工作。 不过,我觉得它恐怕无法到达 终点线。 终点线。 剩余1900个代币。 你在干什么? 剩余1900个代币。 你在干什么? 你在干什么? 已使用99%。 我已经 你在干什么? 已使用99%。 我已经 你在干什么? 已使用99%。 我已经 启用了继续按钮,但是我们还有 启用了继续按钮,但是我们还有 启用了继续按钮,但是我们还有 不到一千个代币,而且在达到一千个代币之前,这 不到一千个代币,而且在达到一千个代币之前,这 不到一千个代币,而且在达到一千个代币之前,这 肯定不会退出 肯定不会退出 肯定不会退出 思考模式 思考模式 思考模式 。 所以, 你让我这么做是对的。 哦,是的 你让我这么做是对的。 哦,是的 。 我知道。 我让你那样做是对的 。 我知道。 我让你那样做是对的 。 我知道。 我让你那样做是对的 。 。 。 自从3.5版本以来,我已经和足够多的奎因模型打过交道了,那个模型简直就是个超级 自从3.5版本以来,我已经和足够多的奎因模型打过交道了,那个模型简直就是个超级 自从3.5版本以来,我已经和足够多的奎因模型打过交道了,那个模型简直就是个超级 怀疑者,呃,我当时就想,“什么? 怀疑者,呃,我当时就想,“什么? 怀疑者,呃,我当时就想,“什么? 你为什么这么怀疑我?我知道。我 你为什么这么怀疑我?我知道。我 你为什么这么怀疑我?我知道。我 知道我在和谁打交道。还剩500个代币 知道我在和谁打交道。还剩500个代币 知道我在和谁打交道。还剩500个代币 。我面对的就是他 。我面对的就是他 。我面对的就是他 。” 而且他还是个过度思考的人, 。” 而且他还是个过度思考的人, 。” 而且他还是个过度思考的人, 没有输出已经 没有输出已经 没有输出已经 优化好的代码块,而这本来是一开始就应该 优化好的代码块,而这本来是一开始就应该 优化好的代码块,而这本来是一开始就应该 做的。 相反,它却 做的。 相反,它却 做的。 相反,它却 给我埋下了三个地雷,就像我 给我埋下了三个地雷,就像我 给我埋下了三个地雷,就像我 当前街区里埋了三个地雷一样,还有其他这些 当前街区里埋了三个地雷一样,还有其他这些 当前街区里埋了三个地雷一样,还有其他这些 东西。 东西。 东西。 我的意思是,这并非毫无价值的 我的意思是,这并非毫无价值的 我的意思是,这并非毫无价值的 信息,但我们眼睁睁看着 信息,但我们眼睁睁看着 信息,但我们眼睁睁看着 它走完,然后它就 它走完,然后它就 它走完,然后它就 戛然而止了。 就是这样。 好了 。 还没来得及 。 还没来得及 。 这是最令人失望的 。 这是最令人失望的 。 这是最令人失望的 留言方式,但我不想 留言方式,但我不想 留言方式,但我不想 尝试。 我不会再尝试了。 尝试。 我不会再尝试了。 尝试。 我不会再尝试了。 这会让你获得非常 这会让你获得非常 这会让你获得非常 有价值的信息。 你的 有价值的信息。 你的 有价值的信息。 你的 掩护做得非常好。 我在 掩护做得非常好。 我在 掩护做得非常好。 我在 这里想出的那个和 Quinn 3.827B。 嗯, 这里想出的那个和 Quinn 3.827B。 嗯, 这里想出的那个和 Quinn 3.827B。 嗯, 但是你有了这个运行块,它 但是你有了这个运行块,它 但是你有了这个运行块,它 肯定可以让你在许多 肯定可以让你在许多 肯定可以让你在许多 实例中达到目标,至少达到 131,000 或 实例中达到目标,至少达到 131,000 或 实例中达到目标,至少达到 131,000 或 131,72 个令牌,128k 上下文窗口。 是的 131,72 个令牌,128k 上下文窗口。 是的 131,72 个令牌,128k 上下文窗口。 是的 ,我很期待看到 ,我很期待看到 ,我很期待看到 你们对这些设置的看法, 你们对这些设置的看法, 你们对这些设置的看法, 尤其是我的机器人 尤其是我的机器人 尤其是我的机器人 实际上并没有给我提供这些建议。 我 实际上并没有给我提供这些建议。 我 实际上并没有给我提供这些建议。 我 得去那里仔细找找。 得去那里仔细找找。 得去那里仔细找找。 我确信它们就在里面。 我 我确信它们就在里面。 我 我确信它们就在里面。 我 可能会在重启游戏后进行重新生成之类的操作, 可能会在重启游戏后进行重新生成之类的操作, 可能会在重启游戏后进行重新生成之类的操作, 并给它一些 并给它一些 并给它一些 额外的代币预算,但我 额外的代币预算,但我 额外的代币预算,但我 不会因此而让你失望。 不会因此而让你失望。 不会因此而让你失望。 我 我 我 自己也不会去经历这一切。 车库很热。 自己也不会去经历这一切。 车库很热。 自己也不会去经历这一切。 车库很热。 德克萨斯州现在热得要命。 所以, 德克萨斯州现在热得要命。 所以, 德克萨斯州现在热得要命。 所以, 别忘了点赞、订阅,并把这个分享给 别忘了点赞、订阅,并把这个分享给 别忘了点赞、订阅,并把这个分享给 你的朋友们。 您 你的朋友们。 您 你的朋友们。 您 随时可以访问 digitalspaceport.com。 随时可以访问 digitalspaceport.com。 随时可以访问 digitalspaceport.com。 正如我所说,我会把这个巨大的 正如我所说,我会把这个巨大的 正如我所说,我会把这个巨大的 追踪图发上去,这样你们就可以查看了 追踪图发上去,这样你们就可以查看了 追踪图发上去,这样你们就可以查看了 。 另外,把它下载到你的 。 另外,把它下载到你的 。 另外,把它下载到你的 clanker 里。 或许他们可以帮助你理解 clanker 里。 或许他们可以帮助你理解 clanker 里。 或许他们可以帮助你理解 这个程序过度思考的逻辑, 这个程序过度思考的逻辑, 这个程序过度思考的逻辑, 从而帮助你 从而帮助你 从而帮助你 获得最佳优化。 然后, 获得最佳优化。 然后, 获得最佳优化。 然后, 当你找到最佳优化方案后, 当你找到最佳优化方案后, 当你找到最佳优化方案后, 请在下方评论区留言。 请在下方评论区留言。 请在下方评论区留言。 向频道所有成员致以崇高的敬意。 向频道所有成员致以崇高的敬意。 向频道所有成员致以崇高的敬意。 因为你们,这样的事情 因为你们,这样的事情 因为你们,这样的事情 才会发生。 才会发生。 才会发生。 如果您对 如果您对 如果您对 本地 AI 的入门和运行以及 本地 AI 的入门和运行以及 本地 AI 的入门和运行以及 构建各种奇奇怪怪的东西感兴趣,也请务必查看我们的相关视频,包括 构建各种奇奇怪怪的东西感兴趣,也请务必查看我们的相关视频,包括 构建各种奇奇怪怪的东西感兴趣,也请务必查看我们的相关视频,包括 我们播放列表中的家庭实验室相关内容, 我们播放列表中的家庭实验室相关内容, 我们播放列表中的家庭实验室相关内容, 我们的超级播放列表就在这里。