前言
我确实认为普通人,至少大学生们,需要确实了解一些关于AI实际使用上的东西。不同于真的通识课,本文不会说什么神经网络、Transformer这种底层知识,而是从实际落地出发,面向普通人介绍如今AI的真正能力边界。
写在前面的名词辨析:
AI: 泛指普通人使用的大语言模型及其衍生产品
LLM: 指机器学习上的大语言模型
Agent=Model+Harness:
- Model: 指狭义上的模型本身,一般从网络上使用API调用
- Harness: 指任何包装API的工具。包括Deepseek网页端到Codex的一切包装层。Harness需要插入Model才能工作。
- Agent: 具有一定能动性的完整工具。我们人类目前所得到的最强自动生产工具。
一、纯文本
什么是纯文本?就是没有粗体 斜体 下划线 字体等任何在文本上附加的东西,就是一串干干净净的
“字”。AI的原始输出就是一串串这样没有任何样式的纯字。注意,这包括文本没有任何字体、字号、颜色等概念。
TIP纯文本中有大量的标点符号,这包含
- 英文符号
,."':<>[]!$等等。- 中文逗号
,。“”‘’《》【】!¥等等。 这些符号与字体是相互独立的。
二、富文本
人们对于想在文本中指出重点这件事上非常努力。AI崛起之前有很多成功的富文本格式,这包括
手操专业工具
包括但不限于最常用的Microsoft Word。Word文档最大的特点是易用,想必各位都用过。提到专业工具,这也包括但不限于PS, Pr等设计类软件。但Office只有基于用户界面的接口,你看不到那些没删干净但仍然隐藏在内部的样式表,无法做到真正意义上的掌控。
为什么不用Word: 我们无法展示Office的样式在代码上如何展示,它就不是一种语言。它们被层层压缩,根本就不是给人看的。AI无法通过纯文本描述Word文档。
HTML+CSS
HTML是现在用于展示网页的设计语言,但网页本身也可以嵌入到很多地方包括app。它看起来像这样:
<section> <h2>样式演示</h2> <p><b>粗体</b><i>斜体</i><u>下划线</u></p> <p style="font-size: 20pt; color: red">20磅 红色</p></section>显示起来就是:
样式演示
粗体斜体下划线
20磅 红色
绝大多数时候程序员写样式的时候用的就是这些东西。它的特点是实现了通过纯文本的组合来描述富文本。这使得AI有可能通过输出HTML5格式的纯文本来向人们展示富文本。只要在AI的输出的前台侧过一遍HTML解释即可
为什么用HTML: 它在功能上最为灵活。其可能性上基本覆盖Word。
为什么不用HTML: 如你所见,它太繁琐了,非常浪费token。
TIP与Word文档不同,HTML5语言是一种语言,这代表它不依赖于特定的软件,任何浏览器都能识别和显示HTML语言。
Latex
这是一种基本上是纯为论文准备的语言。要实现以上的例子,它写为:
\documentclass{article}\usepackage[utf8]{inputenc}\usepackage{xcolor}\usepackage{ulem}\begin{document}\section{样式演示}\textbf{粗体} \textit{斜体} \uline{下划线}{\fontsize{20pt}{24pt}\selectfont \color{red} 20磅 红色}\end{document}更繁琐了。
但Latex语言有一个无法比拟的优势在于,它有用纯文本精确描述数学公式的能力:
s(x)=\int_0^x\sqrt{1+\left[y'(t)\right]^2}\,dt显示为
基本上所有正常写出来的数学公式都能被LaTeX语言描述出来。
AI描述数学公式时就会使用Latex语言。
为什么用Latex: 在数学排版领域Latex语言是权威。
为什么不用Latex: 如你所见,数学以外它并不好用,而且它的生态也不如HTML广泛。
Markdown
Markdown语言是一个继承自HTML的,有大量方言的语言。它基于HTML简化了大量标签的书写,现在你要写出上面的东西可以写为
## 样式演示
**粗体** *斜体* <u>下划线</u>
<span style="font-size: 20pt; color: red">20磅 红色</span>显然比上面的都简洁。现在AI输出的富文本基本都是Markdown语言。
为什么用Markdown: 它继承H5的灵活性,同时使得语法更简洁。实际上Markdown正是我写这篇文章时使用的语法。
而为Markdown封神的则是方言。比如一种知名的方言:
\[\textrm{Block}\; \LaTeX\; \textrm{expression}\]用于在Markdown中创建一个LaTeX语法的数学块。本质上调用了平台提供的Katex等外部工具的数学渲染能力。
而另一些方言如
```mermaidgraph LRA-->B```则能绘制流程图。其本质上使用的是老牌示意图工具Mermaid的渲染能力。Mermaid本身就是一种能用纯文本表示各种流程图的工具。
所以以后把ai输出复制下来之后看到这样的东西不要再嘲笑是乱码了……那是老程序员们小圈子里写了二十几年的Markdown语言……
TIP欢迎通过Markdown 渲染器 - 绘梦の实验室体验在线渲染Markdown、自定义CSS并打印哦
三、命令行、工具调用和命令行应用
命令行
电脑上有种东西叫命令行,通过特定语法可以处理各种删改新建文件文件夹和用各种东西启动各种程序,几乎无所不能,但语法比较复杂,一般人不用。毕竟谁移动文件不用鼠标拖而是打开黑窗口去敲mv C:/data/A.docx D:/data/.
但AI会用,不如说它只能用命令行做这些事了,它又不能抢你鼠标。
工具调用
其实大部分LLM并非只能输出纯文本。
当然它也不输出富文本。除了我们熟知的图片上下文、视频上下文输入以外,它还有一种称为工具的输入,它在思考后可以不直接给出答案而是给出一个工具调用,像这样

这些工具虽然也是响应,但却是它能动性(个体独立行动和做出选择的能力) 的体现。它会在思考后执行诸如Read(读取文件), Grep(搜索文件中的文本), Glob(搜索文件名)这种工具而非直接向用户给出答案。
这些工具大部分由操作系统的命令行提供,经由Harness整理和提供。
为大模型提供命令行的概念,就是年初小龙虾爆火的底层原理。AI得到命令行控制后突然能够自主完成大量工作,于是十分惊人地出圈了。
更简单一点,Harness甚至可以直接告诉模型,你可以执行任意命令行。AI就明白它能做到什么了。
一个好的模型在被问到小数点后的第789位是多少时,应该主动选择去写代码、执行来计算,或者使用搜索工具从互联网搜索。实在没招时应当主动提出自己不确定。
命令行应用
命令行也不是许愿池,什么都能做到。毕竟以前的电脑只有命令行,也没见他们做出什么惊天地的东西。
于是软件出现了。很多上古的应用程序和现在的底层程序其实都是只能通过命令行调用的。这些东西普通人虽然不能用,但AI可以用,而且还会用,不会用的也知道怎么让自己会用。举例来说:
- FFmpeg
- 一个功能极其强大的开源多媒体框架。
- 处理几乎所有与音视频、图片相关的任务。
- 只能用命令行使用。
- 第三方包装的图形界面版一般人也看不懂。
- AI能看懂。
操作系统本身只提供了很小一部分的命令,比如读文件、循环执行之类的简单命令。结合上这种瑞士军刀,相当于你完全可以做出等同于熟练掌握FFmpeg和命令行的人所做的事。简单的批量压缩任务也自不必说。
除了装“手”,针对LLM运行倾向于使用命令行本身这一特性,催生出了一系列给AI装“眼”的工具,比如
- markitdown, 微软维护的一个能让AI读几乎任何东西的命令行应用。应对PDF等格式无法直接读到文本的问题。
- browser-use, Agent能力觉醒初期出现的让AI能直接使用浏览器的简易Harness
- modlens, 一个为无多模态模型提供视觉理解的SKILL
手眼都齐了,接下来如何组装呢
四、组装和使用
模型供应商
要接入模型首先要找到供应商。提供商会提供其主机(BaseUrl) 和密钥(APIKey) ,你将它们填入各家的Harness或自己的代码中即可使用。注意这一般是付费的,价格单位通常为M token。
目前来说有三种主流的模型接口,分别是Chat Completion API、Anthropic API和Responses API。Chat Completion API是最早OpenAI推出GPT时就有的API,大部分接口都默认使用这种API。Anthropic API是A\家(Anthropic)特有的API,如Claude Code就只能使用这种API。Responses API则是OpenAI推出的新格式,Codex现在只能使用这种格式。
BaseUrl看起来是这样的:
- Deepseek家的Chat Completion API:
https://api.deepseek.com/chat/completions - OpenRouter家的万能baseurl:
https://openrouter.ai/api - 接口AI的Responses API:
https://api.highwayapi.ai/openai/v1/responses
APIKey是保密的,谁拿到了就能拿你账户当信用卡刷。看起来像这样:
sk-b3db88b4dc0c486380728923e8da809esk-e3d1b817018c4a4fa842efbd94ddf5d9
(不要试了,这两个我是随机敲的)
此外还要使用model id对模型指名。一般都会把模型id和价格一起摆上去。

模型供应商我就不列举了,除了各种官方自己,还有各种定价的便宜中转站。关于中转站,第一类是加价转发和聚合平台,避免国内直接买封号,加价幅度105%到120%都有,且基本上纯净。第二类是各种合作和plan渠道,总体可能降价八折到四折,属于赚中间差。第三类是各种黑灰产比如批量产gpt bugteam之类的,价格通常低到离谱,当然也别想用上真正干净的好模型,里面可能掺有各种其他ai工具的提示词、低级模型等等。免费鸡蛋嘛。
Harness
目前来说Harness有
- GUI(图形化用户界面)
- TUI(终端用户界面)
- IDE(集成开发环境,多数基于VSCode二次开发)
三种主流呈现方式。很多harness同时支持几种模式。注意支持TUI的一般都能在VSCode等IDE中无缝嵌入。
按我个人使用轨迹介绍几个有名的:
- Cursor: IDE。面向编程任务。
- 使用即付费。
- 最早兴起的一批概念性炮灰Harness。
- Claude Code: Anthropic家的。GUI/TUI。非常专业向。
- 主要面向TUI。
- 一次源码泄露后被以各种方式流传了下来,被各种改造了,目前github应该还能搜到,需要自己构建。
- Codex: Openai家的老牌工具,GUI/TUI。不面向特定任务。
- 最近在某书被捧上天了。实际上其他Agent照样可以做。
- 卖自家的Plus。
- Trae: 豆包家的。IDE/GUI。不面向特定任务。
- 早年作为Cursor的免费替代品可以用,后因为上下文管理太慢出局。
- 新的产品概念仍然在出现,但暂时都没能上桌,不面向特定任务。
- 卖死贵的优速通。
- OpenCode: GUI/TUI。不面向特定任务。
- 立场比较中立。
- 卖OpenCode Go中转套餐。
- ZCode: 智谱家的。GUI。不面向特定任务。
- 对新人较为友好
- 卖自家的Token Plan。
- DSH: 目前处于测试。Deepseek家的。不面向特定任务。
- 我很看好DSH所定义的新插件生态。
- 但目前安装比较专业向,不推荐不喜欢折腾者使用。
限于个人精力不可能全部体验,欢迎评论区补充Qoder, Pi, Hermes, Reasonix, WorkBuddy/CodeBuddy等等
需要注意的是,各家AI都有harness的很大原因是,他们在训练模型时需要一个harness环境进行评估,而用别人家的harness不仅受制于人还可能受工具、架构、提示词限制,各种风险都不可控。所以各家都会用自己的harness进行模型训练和Agent能力评估。也就是说理论上,各家的模型在自家的harness上才能发挥出最佳效果。
MCP和SKILL都旨在让AI拥有能力这件事协议化。关于配置,各家都不一样是一个问题,所以我个人此处向小白推荐ZCode,它对安装skill流程引导和易用性做的是最好的。
命令行应用的话,告诉它命令是什么就行了。命令行本身就是一个工具。

