打开/关闭搜索
搜索
打开/关闭菜单
506
573
74
3933
寻星
导航
首页
最近更改
随机页面
特殊页面
上传文件
快速入门
新手入门
编辑方针
MediaWiki帮助
隐私政策
版权信息
打开/关闭外观设置菜单
无法加载偏好设置。请检查您的网络连接并重试。
重试
打开/关闭个人菜单
未登录
未登录用户的IP地址会在进行任意编辑后公开展示。
user-interface-preferences
个人工具
讨论
贡献
创建账号
登录
编辑“︁
RWKV
”︁(章节)
✨寻星知识库——携手与您,寻觅群星。
分享此页面
查看
阅读
编辑
编辑源代码
查看历史
associated-pages
页面
讨论
更多操作
温馨提醒:
您没有登录账户。如果您做出任意编辑,寻星会记录您的IP地址,并且此IP地址将会公开可见以便管理和供其他用户参考。如果您不希望公开匿名用户IP地址,请您
登录
或
创建
一个账户,这样寻星就会在贡献记录中公开您的用户名而不是IP地址。使用账户同样也可以让您在寻星获取更多权限,有助于您进行深入贡献。
反垃圾检查。
不要
加入这个!
==== 核心问题:Transformer 模型的效率瓶颈 ==== 目前,像 GPT 这样最主流的 AI 模型建立在一种叫做 '''Transformer''' 的架构上。Transformer 非常强大,但它有一个根本性的“扩展”问题: * '''工作方式:''' 当它处理一个新词时,它必须“回头看”并计算与 ''之前所有'' 词语的关系(这称为“注意力”)。 * '''问题:''' 这导致了“二次方计算复杂度” <math>O(N^2)</math>。简单来说,如果文本长度增加10倍,计算量和内存占用可能会增加近100倍。这在处理非常长的文档或对话时,成本高得惊人。
摘要:
温馨提示:
您在寻星上发布的所有贡献内容,
默认在知识共享署名-相同方式共享 3.0 中国大陆(CC BY-SA 3.0 CN)许可协议下发布
,如果您希望采用其他许可协议或许可约定,请务必在页面中指出。请参阅在
寻星:著作权
列出的相关内容。
未经许可,请勿提交受版权保护的作品!
发布侵权内容可能会让您失去在寻星的贡献权限。
取消
编辑帮助
(在新窗口中打开)
寻星知识库使用 Cookie 技术提升您的浏览体验,这需要在您的浏览器存储部分信息。禁用 Cookie 将导致部分功能无法正常使用。 寻星团队将严格遵守隐私政策,并尽可能保护您的信息安全。 继续浏览寻星知识库,视为您同意启用 Cookie 并生成、存储相关数据。
好的
编辑“︁
RWKV
”︁(章节)
✨寻星知识库——携手与您,寻觅群星。