AI
刷新
基于 HuggingFace Tokenizers 训练自定义分词器

博主头像 在大模型开发流程中,分词器(Tokenizers)是文本预处理的核心组件。神经网络无法直接理解人类的原始文本,分词器的核心作用,就是将自然语言转换为模型可用于计算的数值序列。Hugging Face Tokenizers 是底层由 Rust 编写的高性能开源分词库,原生支持 BPE、WordPiec... ...

奇摩干货铺:WorkBuddy数据分析实战

博主头像 奇摩干货铺:WorkBuddy数据分析实战 背景:企业数据分析为何总卡在"最后一公里" 诚然,很多团队并不缺数据,缺的是把数据真正用起来的能力。销售、运营、财务各自沉淀着表格与系统导出文件,可一旦要出结论,往往又回到人工复制、拼公式、画图的旧路子上。Excel 能解决一部分问题,但当数据分散在多个来 ...

"一人公司"做AI短剧:一个人怎么管住30多人的流水线

博主头像 人民日报04版报道郑州导演李乐瞳辞职注册一人公司做AI短剧,报道里出现了新岗位抽卡师。这篇从工程角度拆解:一个人怎么扛下过去三四十人的流水线——剧本、分镜、画面、配音、剪辑如何收进一个画布工程,人设与参数如何挂成节点资产跨画布复用,3D导演台如何在生成前锁住镜头一致性。 ...

基于 vLLM+Nginx 构建负载均衡推理集群

博主头像 企业内部私有环境部署大模型推理集群时,很容易遇到流量调度混乱、节点负载失衡、会话上下文丢失、接口缺少鉴权防护等一系列问题,单 vLLM 推理节点难以支撑并发请求。本文基于 Ubuntu 22.04 系统环境,搭建 Nginx + vLLM-Semantic-Router + vLLM-Router ... ...

把 AI 解过的题沉淀成共享知识

博主头像 用 AI 排错的人大概都经历过同一个场面:问题解决了,解法留在一段会话记录里,窗口一关就找不回来。下次自己或别人撞上同样的问题,只能从头再问一遍。真正的问题不是 AI 不能重复解决,而是可用的解法已经存在过,只是没人把它留下来。 Shared Knowledge 就是冲着这一点做的。它是一个 MCP... ...

WorkBuddy 浏览器自动化基础教学:从「看不到浏览器」到全自动登录

博主头像 本文由一次真实的 AI 协作过程整理而成:我让 AI 助手打开浏览器访问博客园,然后自动完成登录。整个过程踩了几个坑,也沉淀出一套可复用的方案。全文按实际操作顺序记录。 一、开场:一个看起来很简单的需求 我给 AI 下了一句很普通的话: 打开浏览器,进入博客园,让我可以看到浏览器。 注意最后半句—— ...

AI写的代码你能重写吗?想清楚答案再按Tab

博主头像 最近一次我按下 Tab 键接受 AI 补全时,脑子里闪过一个念头:要是没有这个提示,我还能写出这段代码吗?答案让我有点不舒服。或许你也在回避类似的问题——毕竟,LeetCode 已经很久没人提了。 把代码交给 AI 是否让我们变懒?我觉得问得不对。懒有两种,一种让世界前进,一种让代码变成定时炸弹。 ... ...

LLama-Factory 实现大模型LoRA-SFT微调指南

博主头像 LLaMA Factory 是一款开源、低代码、一站式大语言与多模态模型微调框架,用于降低大模型的微调落地门槛。框架兼容 Qwen、LLaMA、ChatGLM、LLaVA 等上百款主流开源模型,支持增量预训练、SFT 监督微调、DPO、KTO、ORPO 等多种训练对齐方案,原生集成 LoRA、QLo... ...

每天白嫖 WorkBuddy 100 积分,我让WorkBuddy自己领

博主头像 有没有小伙伴跟我一样,每天都去白嫖 WorkBuddy 的 100 积分,每天都怕忘记领。 其实我早就开了会员,但还是会有积分焦虑,天天惦记着今天的积分领没领。后来我发现 WorkBuddy 可以自己领积分,今天把这个技能分享给小伙伴们。 Buddy 加油站每天签到领 100 积分,连续签满 7 天 ...

<1···678···50>