宇宙
生活
随笔
大模型
RAG
强化学习
Agent
LLM架构
论文
论文速递
机器学习
多模态
基础模型
理论基础
欢迎订阅
开源
大模型
强化学习
Agent
LLM架构
论文
机器学习
多模态
基础模型
分类
标签
归档
上网导航
1
2W8000字读懂GPT全家桶:从GPT-1到O1的技术演进与突破
2
强化学习详解第八部分 RLAIF 如何实现人工智能反馈的规模化飞跃
3
DeepSeek-R1如何突破语言模型的极限——深入数学视角解读群体相对策略优化(GRPO)
4
强化学习详解第七部分 RLHF:解码 AI 与人类偏好对齐的奥秘
5
2W8000字深度剖析25种RAG变体
登录
柏企
吹灭读书灯,一身都是月
累计撰写
109
篇文章
累计创建
16
个分类
累计收获
183
个点赞
导航
宇宙
生活
随笔
大模型
RAG
强化学习
Agent
LLM架构
论文
论文速递
机器学习
多模态
基础模型
理论基础
欢迎订阅
开源
大模型
强化学习
Agent
LLM架构
论文
机器学习
多模态
基础模型
分类
标签
归档
上网导航
目录
探索ModernBERT:传统BERT模型的重大升级
探索ModernBERT:传统BERT模型的重大升级 这次我们聚焦于ModernBERT,看看它是如何强化上下文嵌入的应用。我们还会讲讲如何生成用于微调的数据集,并展示怎样对ModernBERT进行微调,从而在自然语言处理(NLP)任务中取得更强大的效果。 嵌入在机器学习和NLP中的重要性 嵌入是机
2025-04-12 22:17
22
0
1
28.2℃
基础模型
一文读懂自动编码器:类型、原理与应用
一文读懂自动编码器:类型、原理与应用 近日热文:全网最全的神经网络数学原理(代码和公式)直观解释 欢迎关注知乎和公众号的专栏内容 LLM架构专栏 知乎LLM专栏
2025-04-12 22:13
20
0
0
26.0℃
理论基础
缓存增强生成(CAG)对比检索增强生成(RAG):谁才是大语言模型的最优解?
缓存增强生成(CAG)对比检索增强生成(RAG):谁才是大语言模型的最优解? 1. 前期准备:RAG与KV-Cache(CAG) RAG 是什么 RAG是一种检索增强生成方法,它利用检索器查找相关文档,然后将这些文档传递给大语言模型,以生成最终答案。 优势 处理大型或频繁更新的数据集时,无需一次性加
2025-04-12 22:10
19
0
2
29.9℃
RAG
ReaderLM v2:前沿小型语言模型,实现HTML到Markdown和JSON的转换
ReaderLM v2:前沿小型语言模型,实现HTML到Markdown和JSON的转换 ReaderLM的第二代是一款拥有15亿参数的语言模型,它能将原始HTML转换为格式精美的Markdown或JSON,准确率极高,并且在处理更长文本上下文方面表现更佳。ReaderLM-v2的输入和输出总长度支
2025-04-12 22:04
24
0
2
30.4℃
基础模型
重现 OpenAI o1 的技术路线
重现 OpenAI o1 的技术路线 OpenAI o1发布后,其强大的推理能力远超早期的大语言模型(LLM),达到了媲美博士级专业知识的性能水平。 目前,有两种复现o1的范式: 基于知识蒸馏:这是一种捷径方法,可以提取o1的数据并微调LLM(如Llama 3.2、Qwen2等)以模仿o1的推理风格
2025-04-12 21:56
21
0
1
28.1℃
LLM架构
典型的RAG流程、每个模块的最佳实践和综合评估
典型的RAG流程、每个模块的最佳实践和综合评估 近日热文:全网最全的神经网络数学原理(代码和公式)直观解释 欢迎关注知乎和公众号的专栏内容 LLM架构专栏 知乎LLM专栏
2025-04-12 21:50
19
0
2
29.9℃
RAG
加速大模型推理:深入探究MQA、GQA、MLA(DeepSeek)、KV缓存技术
加速大模型推理:深入探究MQA、GQA、MLA(DeepSeek)、KV缓存技术 回顾:多头注意力机制 为什么LLM推理是串行的 KV缓存的挑战 2019年——多查询注意力机制(Multi Query Attention) 2023年5月——分组查询注意力机制(Grouped Query Atten
2025-04-12 21:41
29
0
3
32.9℃
LLM架构
强化自训练(ReST):让大语言模型更懂你的“心”
强化自训练(ReST):让大语言模型更懂你的“心” 强化自我训练(Reinforced Self-Training,ReST)是一种简单的算法,它能让大语言模型(LLM)的输出更符合人类的偏好。这种算法的灵感来源于不断发展的批量强化学习(RL)。简单来说,先给大语言模型设定一个初始策略,ReST就可
2025-04-12 21:37
19
0
2
29.9℃
基础模型
Qwen2.5-Max:对标DeepSeek V3
Qwen2.5-Max:对标DeepSeek V3 Qwen2.5-Max:阿里巴巴挑战DeepSeek V3的新AI巨头 大语言模型(LLMs)彻底改变了AI领域,实现了从聊天机器人到复杂推理系统等众多应用。这些模型依赖大量数据和计算能力,随着规模的扩大,它们的能力也在不断提升。这一进步背后的关键
2025-04-12 21:31
22
0
1
28.2℃
开源
DeepSeek-R1的顿悟时刻是如何出现的? 背后的数学原理:强化学习如何教大型语言模型进行推理
DeepSeek-R1的顿悟时刻是如何出现的? 背后的数学原理:强化学习如何教大型语言模型进行推理 DeepSeek-R1的卓越表现 DeepSeek-R1的开创性论文《DeepSeek-R1:通过强化学习激励大语言模型(LLMs)的推理能力》,对其性能进行了全面分析,结果令人惊叹。在标准语言模型基
2025-04-12 21:20
18
0
0
25.8℃
强化学习
上一页
下一页
1
2
3
4
5
6
7
…
11
弹