宇宙
生活
随笔
大模型
RAG
强化学习
Agent
LLM架构
论文
论文速递
机器学习
多模态
基础模型
理论基础
欢迎订阅
开源
大模型
强化学习
Agent
LLM架构
论文
机器学习
多模态
基础模型
分类
标签
归档
上网导航
1
2W8000字读懂GPT全家桶:从GPT-1到O1的技术演进与突破
2
强化学习详解第八部分 RLAIF 如何实现人工智能反馈的规模化飞跃
3
DeepSeek-R1如何突破语言模型的极限——深入数学视角解读群体相对策略优化(GRPO)
4
强化学习详解第七部分 RLHF:解码 AI 与人类偏好对齐的奥秘
5
2W8000字深度剖析25种RAG变体
登录
柏企
吹灭读书灯,一身都是月
累计撰写
109
篇文章
累计创建
16
个分类
累计收获
183
个点赞
导航
宇宙
生活
随笔
大模型
RAG
强化学习
Agent
LLM架构
论文
论文速递
机器学习
多模态
基础模型
理论基础
欢迎订阅
开源
大模型
强化学习
Agent
LLM架构
论文
机器学习
多模态
基础模型
分类
标签
归档
上网导航
目录
利用Transformer、DPR、FAISS和BART对检索增强生成(RAG)进行深入技术探索
利用Transformer、DPR、FAISS和BART对检索增强生成(RAG)进行深入技术探索 |文末点击阅读原文查看网页版| 更多专栏文章点击查看: LLM 架构专栏
2025-05-19 16:41
38
0
3
33.8℃
RAG
神经网络系列:源起
神经网络系列:源起 更多专栏文章点击查看: LLM 架构专栏
2025-05-11 11:32
62
0
2
34.2℃
理论基础
强化学习详解第八部分 RLAIF 如何实现人工智能反馈的规模化飞跃
超越人类极限的规模对齐 在我们之前的文章中,我们探讨了人类反馈强化学习(RLHF)是如何通过使用人类评估来教导模型我们的偏好,从而彻底改变了人工智能对齐的方式。 但 RLHF 存在一个令人困扰的局限性,你可能已经猜到了:“人类”。 别误会我的意思 —— 人类反馈是无价的。 但它也很昂贵、缓慢,并且在
2025-04-29 21:26
135
0
2
41.5℃
强化学习
强化学习详解第七部分 RLHF:解码 AI 与人类偏好对齐的奥秘
|文末点击阅读原文查看网页版| 更多专栏文章点击查看: LLM 架构专栏
2025-04-26 15:41
116
0
0
35.6℃
强化学习
牛津大学提出 NoProp : 不再需要反向传播来训练神经网络
深入研究 “NoProp” 算法,无需前向传递和反向传播来训练神经网络,并从头开始学习编码。 论文 NoProp: Training Neural Networks without Back-propagation or Forward-propagation 您不再需要反向传播来训练神经网络 反向
2025-04-26 15:05
34
0
0
27.4℃
基础模型
清华大学| 强化学习是否激励LLM中超越基本模型的推理能力?
|文末点击阅读原文查看网页版| 更多专栏文章点击查看: LLM 架构专栏
2025-04-25 21:20
32
0
1
29.2℃
强化学习
论文速递 基于聚类的迭代数据混合引导:优化数据混合以预训练大语言模型(LLM)的框架
论文:https://arxiv.org/abs/2504.13161 数据集: https://huggingface.co/datasets/nvidia/ClimbLab https://huggingface.co/datasets/nvidia/ClimbMix 识别最佳预训练数据混合仍然
2025-04-23 21:35
27
0
0
26.7℃
论文速递
强化学习详解第六部分 高级策略优化:深度强化学习的演变
高级策略优化:深度强化学习的演变 在我们迄今为止探索强化学习的旅程中,我们见证了深度神经网络如何彻底改变了在复杂环境中可能实现的事情。但就像所有的进化飞跃一样,深度Q网络(DQN)及其直接衍生算法仅仅是更深刻变革的开端。 本文聚焦高级策略优化,深度解析 TRPO、PPO 等经典算法如何解决传统强化学
2025-04-23 21:30
20
0
2
30.0℃
强化学习
掌握Torchtune:高效微调、评估和部署大型语言模型的实用指南
2025-04-13 21:36
38
0
1
29.8℃
LLM架构
掌握Torchtune:高效微调、评估和部署大型语言模型的实用指南 近日热文:全网最全的神经网络数学原理(代码和公式)直观解释 欢迎关注知乎和公众号的专栏内容 LLM架构专栏 知乎LLM专栏
ScholarCopilot:借助精准引用训练大语言模型助力学术写作
ScholarCopilot:借助精准引用训练大语言模型助力学术写作 在学术写作中,精准引用与优质文本生成至关重要,现有检索 - 增强生成系统却难以满足需求。今天为大家带来一篇研究成果介绍,文中提出的ScholarCopilot框架,能训练大语言模型助力学术写作。它表现如何?又有哪些创新?快来一探究
2025-04-13 19:29
101
0
4
42.1℃
开源
上一页
下一页
1
2
3
4
5
6
7
…
11
弹