seq2seq聊天模型(三)—— attention 模型

注意力seq2seq模型

大部分的seq2seq模型,对所有的输入,一视同仁,同等处理。

但实际上,输出是由输入的各个重点部分产生的。

比如:

(举例使用,实际比重不是这样)

对于输出“晚上”,

各个输入所占比重: 今天-50%,晚上-50%,吃-100%,什么-0%

对于输出“吃”,

各个输入所占比重: 今天-0%,晚上-0%,吃-100%,什么-0%

特别是在seq2seq的看图说话应用情景中

睡觉还握着笔的baby

这里的重点就是baby,笔!通过这些重点,生成描述。

下面这个图,就是attention的关键原理

tensorlfow 代码

encoder 和常规的seq2seq中的encoder一样,只是在attention模型中,不再需要encoder累计的state状态,需要的是各个各个分词的outputs输出。

在训练的时候,将这个outputs与一个权重值一起拟合逼进目标值。

这个权重值,就是各个输入对目标值的贡献占比,也就是注意力机制!

dec_cell = self.cell(self.hidden_size)

attn_mech = tf.contrib.seq2seq.LuongAttention(
    num_units=self.attn_size,  # 注意机制权重的size
    memory=self.enc_outputs,  # 主体的记忆,就是decoder输出outputs
    memory_sequence_length=self.enc_sequence_length,
    #   normalize=False,
    name=‘LuongAttention‘)

dec_cell = tf.contrib.seq2seq.AttentionWrapper(
    cell=dec_cell,
    attention_mechanism=attn_mech,
    attention_layer_size=self.attn_size,
    #  attention_history=False, # (in ver 1.2)
    name=‘Attention_Wrapper‘)
initial_state = dec_cell.zero_state(dtype=tf.float32, batch_size=batch_size)

# output projection (replacing `OutputProjectionWrapper`)
output_layer = Dense(dec_vocab_size + 2, name=‘output_projection‘)

 # lstm的隐藏层size和attention 注意机制权重的size要相同

原文地址:https://www.cnblogs.com/panfengde/p/10323140.html

时间: 2024-11-10 19:17:25

seq2seq聊天模型(三)—— attention 模型的相关文章

seq2seq聊天模型(一)

最近完成了sqe2seq聊天模型,磕磕碰碰的遇到不少问题,最终总算是做出来了,并符合自己的预期结果. 本文目的 利用流程图,从理论方面,回顾,总结seq2seq模型, seq2seq概念 你给模型一段输入,它返回一段输出! 可以用在这些情景,聊天模型.翻译.看图说话.主旨提取等等涉及自然语言的层面,用途较广泛 例如: 输入"今天中午吃什么", 输出"吃兰州拉面". seq2seq是通过encoder编译器将一段输入,编译,汇聚成一个状态.再通过decoder解析器,

文本分类实战(五)—— Bi-LSTM + Attention模型

1 大纲概述 文本分类这个系列将会有十篇左右,包括基于word2vec预训练的文本分类,与及基于最新的预训练模型(ELMo,BERT等)的文本分类.总共有以下系列: word2vec预训练词向量 textCNN 模型 charCNN 模型 Bi-LSTM 模型 Bi-LSTM + Attention 模型 RCNN 模型 Adversarial LSTM 模型 Transformer 模型 ELMo 预训练模型 BERT 预训练模型 所有代码均在textClassifier仓库中,觉得有帮助,请

Django学习笔记(三)—— 模型 model

疯狂的暑假学习之 Django学习笔记(三)-- 模型 model 参考:<The Django Book> 第5章 1.setting.py 配置 DATABASES = { 'default': { 'ENGINE': 'django.db.backends.', # 用什么数据库管理系统 'NAME': '', # 数据库名称,如果用sqlite,要写完整路径 'USER': '', # 如果用sqlite,这个不用写 'PASSWORD': '', # 如果用sqlite,这个不用写

盒子模型三要素总结

盒子模型三要素: margin(外边距). border(边框) .padding(内边距) 竖直方向:margin-top + border-top + padding-top + height + padding-bottom + border-bottom + margin-bottom 水平方向: margin-left + border-left + padding-left + width + padding-right + border-right + margin-right

Cisco QOS 知识详解第一篇 三种模型

作为一个努力在IT一线奋斗的人,励志做到以下几点: 搬的了机器,玩的了系统,精通了协议,敲得了代码. --谨以此让自己不断努力! ------------------------------------------------------------------------------------------------------------------------------------- QOS的三种模型 网络服务质量即QOS,在网络中实施QOS,有三种模型需要参考,用来指导在各种需求下,

Javascript事件模型系列(一)事件及事件的三种模型

转载: http://www.cnblogs.com/lvdabao/p/3265870.html 一.开篇 在学习javascript之初,就在网上看过不少介绍javascript事件的文章,毕竟是js基础中的基础,文章零零散散有不少,但遗憾的是没有看到比较全面的系列文章.犹记得去年这个时候,参加百度的实习生面试,被问到事件模型,当时被问的一头雾水,平时敲onclick敲的挺爽,却没有关注到事件模型的整体概念.这个周末难得清闲,决定就javascript中的事件模型写个系列,算是对知识点的一个

[Beego模型] 三、高级查询

[Beego模型] 一.ORM 使用方法 [Beego模型] 二.CRUD 操作 [Beego模型] 三.高级查询 [Beego模型] 四.使用SQL语句进行查询 [Beego模型] 五.构造查询 [Beego模型] 六.事务处理 ORM 以 QuerySeter 来组织查询,每个返回 QuerySeter 的方法都会获得一个新的 QuerySeter 对象. 基本使用方法: o := orm.NewOrm() // 获取 QuerySeter 对象,user 为表名 qs := o.Query

三户模型

今天见群里有童鞋问账户的架构体系,原来做过,但猛一下子还没起来,理了一下才回想回来,为了下次想不起来的时候能有个地方查找,纪录一下. 账户体系一般用的都是三户模型.用户,账户,客户. 一个用户有多个账户,一个账户被多个用户使用,一个客户有多个账户,一个客户有多个用户. 一个用户有且最多是一个客户. 用户是使用者,或者触发交易的.账户是交易结算的地方.客户是交易买单的. 一个用户有多个账户,交易的时候可以选择一个账户进行交易.交易时,根据账户扣款.一个客户可以把自己的账户授权给多个用户使用.一个客

JVM内存模型 三

本文章节: 1.JMM简介 2.堆和栈 3.本机内存 4.防止内存泄漏 1.JMM简介 i.内存模型概述 Java平台自动集成了线程以及多处理器技术,这种集成程度比Java以前诞生的计算机语言要厉害很多,该语言针对多种异构平台的平台独立性而使用的多线程技术支持也是具有开拓性的一面,有时候在开发Java同步和线程安全要求很严格的程序时,往往容易混淆的一个概念就是内存模型.究竟什么是内存模型?内存模型描述了程序中各个变量(实例域.静态域和数组元素)之间的关系,以及在实际计算机系统中将变量存储到内存和