惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

雷峰网
雷峰网
爱范儿
爱范儿
宝玉的分享
宝玉的分享
Apple Machine Learning Research
Apple Machine Learning Research
博客园 - Franky
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
博客园 - 三生石上(FineUI控件)
人人都是产品经理
人人都是产品经理
阮一峰的网络日志
阮一峰的网络日志
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
Last Week in AI
Last Week in AI
博客园 - 聂微东
大猫的无限游戏
大猫的无限游戏
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
罗磊的独立博客
博客园 - 叶小钗
WordPress大学
WordPress大学
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
酷 壳 – CoolShell
酷 壳 – CoolShell
小众软件
小众软件
博客园 - 司徒正美
博客园 - 【当耐特】
IT之家
IT之家

自然语言处理

大语言模型 LLM 中/美两个主要玩家,对应两个语系? Humanize-Text 4 步把 AI 文本变成人类写作: DeepSeek×2 + Google + Niutrans cpu/gpu 高性能中英粤文本转语音 TTS 有人能编译跑通 seamlessM4t 吗? 上海某私募 招聘量化研究员(算法模型,深度学习算法,语音算法, nlp, cv,强化学习等方向) 如何快速接入一个有 MCP 能力的 LLM? 有朋友正在学习 nlp 吗? 国内的翻译平台似乎有一个普遍的 bug [请教] [可有偿] 请问有没有懂自然语言处理的大佬,想请教几个问题 高质量数据集对模型开发和 fine-tune 的重要性 请教下本地部署的语音转文字应用 有没有什么语法检查的模型啊? 我是国内的 NLP 从业者,大模型这一波风吹过来了,在公司做大模型感觉前途未卜的样子 请问有哪些文章改写润色的开源实现啊 有没有文本内容标注的成熟项目。 NLP 有没有这样的模型,比如搜索 fetch 请求,自动帮你把 fetch/xhr/request 的数据相关性较高的内容展示出来的 GPT 用于知识图谱构建的 NER 和 RE 深度学习如何运用到区块链中? Vecuna 7b 部署与实践 请教一下此类场景在 NLP 中属于哪个功能分支,可否通过 NLP 相关模型实现 如何根据浏览记录关键词对用户做聚类分析? 诚招语言模型训练实习生 有什么办法能获取一个城市下的地名? 博客根据文章内容跑自然语言分析自动识别关键字,有什么廉价的实现方法吗? 请教一个 NLP 的问题 使用 NLP 从书中提取各个角色的台词 Feishu(飞书) 聊天机器人应用 - 定制对话,实现知识库、信息查询、意图识别、多轮对话 Snowboy 离线唤醒 2021 年开始就停止维护,有没有其他大厂的产品可以替代使用? 2070s 跑不了 gpt2 深度学习工程师, 80-200W,杭州,幻方 AI Lab
[求助]kaggle 中训练模型遇到的一些问题
dontreply · 2023-10-17 · via 自然语言处理

rt 。在 kaggle 中遇到了一些问题,想请求一下帮助。具体情况是这样的:在 kaggle 上有个名为 tweet sentiment 的竞赛。给定训练集和测试集,训练集中包含原文本、筛选文本和情感词。测试集中包含原文本和情感词,具体任务,就是让模型学会怎么利用情感词,从原文本里筛选出合适的词语。作为初学者,我想要用这个竞赛来练手。
举个例子:my boss is bullying me... 对于这个句子,给出的情感词是 negative ,筛选出的文本是 bullying me 。
我的思路是这样的:使用 transformer 库的 bert 模型。把情感词和原文本拼在一起,tokenizer 编码后,作为训练集输入。 与此同时,用筛选文本逐个比对原文本,得到 0 1 标签,用它来表示原文本里哪个词被选中,以此作为训练集的标签。 测试集的输入也做相同处理。而模型的输出是概率,转为 0 1 标签。
用上面的句子举例,对应的标签大概就是 0 0 0 0 0 1 1 0 这样子。 由于最终的输出还是文本,所以得到测试集标签后还需要再转回文本。
现在模型可以正常使用,但我遇到了一些问题:首先,我的输入都是有注意力掩码的,但是输出标签却存在问题:
由于每个句子长度都不一样,我需要把句子和标签都补充到最大长度。输入有注意力掩码,但输出却总是在没有词语的位置也附加概率,导致概率被稀释了。这个问题还可以通过让输出的概率乘掩码来去掉无用的部分一定程度规避,但还有一个问题我不确定该怎么办。
由于句子长度不一样,所以模型的输出概率没有一个统一的水平。如果筛选文本只有一个词,那分给他的概率就很大,如果整个句子都是要选中的,那分给有效词的概率就很低。这样我就没办法选择一个合适的阈值来划分 0 和 1 。我是自学上来的,这种情况确实没有想到可以怎么做,请问这种情况应该怎么处理?谢谢