Lesspon 1. Python

About 11,600 results

Open links in new tab

Any time

zhihu.com
https://www.zhihu.com › tardis › zm › art
一文了解Transformer全貌（图解Transformer）
Sep 26, 2025 · 网上有关Transformer原理的介绍很多，在本文中我们将尽量模型简化，让普通读者也能轻松理解。 1. Transformer整体结构在机器翻译中，Transformer可以将一种语言翻译成另一种语言， …
zhihu.com
https://www.zhihu.com › question
如何最简单、通俗地理解Transformer？ - 知乎
Transformer最开始应用于NLP领域的机器翻译任务，但是它的通用性很好，除了NLP领域的其他任务，经过变体，还可以用于视觉领域，如ViT（Vision Transformer）。这些特点让Transformer自2017 …
zhihu.com
https://www.zhihu.com › question
如何从浅入深理解 Transformer？ - 知乎
Transformer升级之路：1、Sinusoidal位置编码追根溯源 Transformer升级之路：2、博采众长的旋转式位置编码猛猿：Transformer学习笔记一：Positional Encoding（位置编码）解密旋转位置编码解密 …
zhihu.com
https://www.zhihu.com › question
Transformer 和 cnn 是两条差异巨大的路径吗？ - 知乎
Transformer 和 CNN，真的是两条差异巨大的路径吗？两者设计逻辑不一样，但目标一致——让机器看懂东西 CNN 是图像领域的老炮，靠“局部感知+权值共享”吃饭。简单说，它专注于看图像的局部细 …
zhihu.com
https://www.zhihu.com › tardis › zm › art
挑战 Transformer：全新架构 Mamba 详解
Sep 23, 2025 · 而就在最近，一名为 Mamba 的架构似乎打破了这一局面。与类似规模的 Transformer 相比， Mamba 具有 5 倍的吞吐量，而且 Mamba-3B 的效果与两倍于其规模的 Transformer 相当。性 …
zhihu.com
https://www.zhihu.com › question
MoE和transformer有什么区别和联系？ - 知乎
01. Transformer：像“万能翻译官”的神经网络 Transformer 是当今AI大模型（如ChatGPT）的核心架构，最初用于机器翻译，核心是自注意力机制（Self-Attention），能同时分析句子中所有词的关系，而 …
zhihu.com
https://www.zhihu.com › question
Transformer是什么？ - 知乎
Transformer模型的最终输出为每个时间步上各词元的概率分布，主要包括以下步骤：线性层（Linear Layer）：将解码器堆栈输出的每个d_model维向量投影到词汇表大小（vocab_size）维度，得 …
zhihu.com
https://www.zhihu.com › question
Transformer模型怎么用于regression的问题？ - 知乎
回归问题概述 Transformer模型基础回归问题中的Transformer架构调整应用案例优化与技巧挑战与改进 1. 回归问题概述回归问题是监督学习中的一种任务，目标是预测一个连续值。这类问题通常涉及对数 …
zhihu.com
https://www.zhihu.com › question
你对下一代Transformer架构的预测是什么？ - 知乎
2. 引入随机化（Randomized Transformer） Transformer巨大的规模使得不管训练还是推理都极具挑战。然而，很少有人知道的是，引入随机化矩阵算法可以减少Transformer需要的FLOPs。虽然这种做法 …
zhihu.com
https://www.zhihu.com › tardis › bd › ans
如何最简单、通俗地理解Transformer？
Transformer 的整体结构，左图Encoder和右图Decoder 可以看到 Transformer 由 Encoder 和 Decoder 两个部分组成，Encoder 和 Decoder 都包含 6 个 block。之前自然语言处理主要的算法叫RNN（循环 …

Pagination
- Next