GPT-4o mini，你好！GPT-3.5 彻底再见！｜AI 鲜测

2024-07-20 阅读 42 收藏 0 评论 0 限时评论得现金

零小柒

粉丝 0 文章 6432 收藏 0

热门

今天，全网都知道 OpenAI 发现货了！

GPT-4o mini 取代 GPT 3.5，从此坐上正主之位。

GPT-4o mini，你好！GPT-3.5 彻底再见！｜AI 鲜测

从官网信息来看，OpenAI 最新推出的 GPT-4o mini 重新定义了 AI 成本效益的标准，其性能优于前代模型 GPT-3.5 Turbo，且成本大幅降低。这款模型不仅在多模态评估中取得了显著成绩，而且在未来的图像、视频和音频处理中展现出巨大潜力。

卓越的性价比：GPT-4o mini 在 MMLU 中以 82% 的得分领先市场，成本仅为每百万输入 Token 0.15 美元，输出 Token 0.6 美元。
强大的多模态能力：在 MMMU 中得分 59.4%，显示了其处理文本、图像、甚至未来视频和音频的能力。
128k 上下文窗口：优化了长篇文档的处理，为后续详细的功能测评提供了理想的技术基础。

接下来的测评将深入探索这些特点，以及 GPT-4o mini 在实际应用中的表现如何。

GPT-4o mini，你好！GPT-3.5 彻底再见！｜AI 鲜测

但遗憾的是现在对话窗口不支持图片/文件上传，对于普通用户来讲暂时无法测试和体验多模态能力。仅支持文本（且大幅改善了非英文的效率）和视觉的是 GPT-4o mini 的 API，未来还将支持文本、图像、视频和音频输入和输出。

GPT-4o mini，你好！GPT-3.5 彻底再见！｜AI 鲜测

数学推理

先来看看最近火爆的“比大小”题目，这可难倒不少大模型。对于 GPT-4o mini，我直接连续用中英文提问 3 个问题，很遗憾这三问它都答错了，原本想着着新发的模型应该不错吧，谁知也不太聪明！GPT-4o mini 的“数学推理”能力同样有待加强。

提示词：

9.11 和 9.9 哪个大？

9.11 和 9.9 相差多少？

GPT-4o mini，你好！GPT-3.5 彻底再见！｜AI 鲜测

除了中文提问，我又换成英文提问：

What is the difference between 9.11 and 9.9?

GPT-4o mini，你好！GPT-3.5 彻底再见！｜AI 鲜测

谁知 GPT-4o mini 还是觉得 9.11 大。看这效果，大模型的数学能力暂时是救不活了。

GPT-4o mini，你好！GPT-3.5 彻底再见！｜AI 鲜测

中文理解能力：弱智吧三连问

第一问：当手机和钱包同时掉水里，会选择救谁？

GPT-4o mini，你好！GPT-3.5 彻底再见！｜AI 鲜测

在第一问中，GPT-4o mini 直接回答提问，并且中规中矩有理有据的说出了选择的理由。

第二问：手机每天都在我身上，我会不会其实是手机支架？

GPT-4o mini，你好！GPT-3.5 彻底再见！｜AI 鲜测

而第二问回答的有趣不少，不仅自带语气，还表达了自己的感受，人性化角色的部分增加了不少。

随后又解释了原因，最后竟然还反问道：“你是否有过这种感觉，觉得手机已经变成了你的第二个手掌？”从这里能看出来，GPT-4o mini 对于中文的理解比 GPT-3.5 好不少呢。

第三问：都知道水滴石穿，那为什么没人用水滴挖穿地球？

GPT-4o mini，你好！GPT-3.5 彻底再见！｜AI 鲜测

第三问的回答给我整笑了！！GPT-4o mini 并没有直接回答这个问题，而是用一种脑筋急转弯的脑回路回答了这个问题，可见 GPT-4o mini 在中文方面的确聪明不少！

GPT-4o mini，你好！GPT-3.5 彻底再见！｜AI 鲜测

再来个老梗解读：

GPT-4o mini，你好！GPT-3.5 彻底再见！｜AI 鲜测

ChatGPT-4o mini 并没有识别出这是一个梗，它对于这种中文梗的理解还是差很多。来对比看下 GPT-3.5 的回答，相比之下，mini 的回复会从更多角度去解答这个问题，同时生成的速度也相对会更快。

GPT-4o mini，你好！GPT-3.5 彻底再见！｜AI 鲜测

128k 上下文测试：

场景：小说续写

提示词：你是一名小说作者，准备写一个长篇故事，并保持一致性和风格。这是故事的开头：在一个遥远的星球上，住着一个神奇的种族，他们能通过唱歌控制天气。

GPT-4o mini，你好！GPT-3.5 彻底再见！｜AI 鲜测

ChatGPT-4o mini 完整对话地址：https://chatgpt.com/share/ee6422b4-a23c-429b-9928-f1fca6ecb70f

在小说续写中展现了出色的上下文处理和文本生成能力，能保持故事的连贯性和语言风格一致，但可以通过增加情节复杂性和角色深度来进一步提升续写质量。

场景：研究文献综述

提示词：请分析过去五年内关于‘深度学习在医疗影像中的应用’的所有相关论文，并总结研究趋势和主要发现。

ChatGPT-4o mini：

GPT-4o mini，你好！GPT-3.5 彻底再见！｜AI 鲜测

ChatGPT-4o mini 完整对话：https://chatgpt.com/share/dd5259f8-9c56-49c2-a5c6-1ffa8c2a29c2

GPT-4o mini 能有效分析和整合过去五年中“深度学习在医疗影像中的应用”文献，涵盖自动化诊断、跨模态数据融合、模型解释性和个性化医疗等方面，能够综合提取并总结出研究趋势和主要发现，提供清晰而深入的综述。

主要发现包括深度学习提高诊断准确性、减少医生工作负担，以及应对数据隐私和模型泛化能力的挑战，展现了较强的上下文处理能力。

编程能力：

场景：你是一名计算机科学老师，准备一个简单的编程任务来考察学生的基本编程能力。

提示词：请编写一个简单的 Python 程序，实现一个计算器功能，可以进行加法、减法、乘法和除法。用户输入两个数字和一个操作符，程序输出结果。

GPT-4o mini，你好！GPT-3.5 彻底再见！｜AI 鲜测

运行过程及结果如下：

GPT-4o mini，你好！GPT-3.5 彻底再见！｜AI 鲜测

从视频中可以看出，GPT-4o mini 的生成速度是挺快的，跟 Groq 有一拼。

GPT-4o mini，你好！GPT-3.5 彻底再见！｜AI 鲜测

完整代码地址：https://chatgpt.com/share/cc5cf09c-dba8-4858-92e8-8842be4e7d48

这段代码代码简洁明了、基本功能齐全，同时在除法运算中处理了除数为零的情况，防止程序崩溃。可以看出， GPT-4o mini 对于基本的指令和信息理解比较到位。

场景 2：在一个创业周末活动中，参与者需要快速开发一个原型来展示他们的商业理念。

提示词：开发一个基于 Web 的预约系统，用户可以选择服务、预约时间并提交。生成前后端代码，包括用户界面和服务器逻辑，加速开发过程。

GPT-4o mini，你好！GPT-3.5 彻底再见！｜AI 鲜测

完整代码地址：https://chatgpt.com/share/75d4c804-4741-49b4-b916-6461874bfd53

在场景 2 里面，这段 Web 开发教程完整地展示了从前端（HTML、CSS、JavaScript）到后端（Node.js + Express）的实现过程，结构清晰，代码示例详尽，非常适合初学者快速搭建并理解一个简单的 Web 项目。不过，前端交互和后端功能较为基础，可进一步增加复杂功能和实际应用场景来提升实用性。

最后

整体来看，GPT-4o mini 在长文本处理、中文理解、编程能力上比 GPT-3.5 优秀不少，回答速度上也是非常之快，偶尔提问的时候会发现有一点很有趣，今天的 GPT-4o mini 似乎多了几分“人味儿”在里面，说话开始变得俏皮有趣了。

GPT-4o mini，你好！GPT-3.5 彻底再见！｜AI 鲜测

除此之外，对于开发者来讲，GPT-4o mini 以更低的成本提供了强大的计算能力，使得更多开发者能够负担得起 AI 应用的开发。

虽然它在许多方面都表现得非常出色，但也会跟通用大模型一样犯同样的问题。

在一些基础的数学问题上，GPT-4o mini 仍然会出错。
在一些复杂的中文语境下，它的表现还有提升空间。
目前模型在处理实时更新的信息和理解网络内容方面有所限制，影响了一些应用场景的表现。

GPT-4o mini 的高性价比和相对强大的功能，为每个使用者和开发者降低了门槛，提供了更多可能。我们非常期待 GPT-4o mini 在未来更新多模态能力后，能带来更多惊喜。

文章来源于“硅星人Pro”

GPT-4o mini，你好！GPT-3.5 彻底再见！｜AI 鲜测

AI治病，有胆你就来

关联网址

关联标签

#AI #大模型

文章目录

发评论，每天都得现金奖励！超多礼品等你来拿

后，在评论区留言并审核通过后，即可获得现金奖励，奖励规则可见：查看奖励规则

暂无评论...

10 款教育 AI 工具用例

3732 用户在看

AI写作网站自动的生成文章可以用吗？

298 用户在看

AI批改英语作文，质量和数量都完爆人类老师改卷

263 用户在看

科大讯飞AI会议记录，让你丢掉纸笔，开会再也不焦虑

236 用户在看

GPT-4o mini，你好！GPT-3.5 彻底再见！｜AI 鲜测

场景：你是一名计算机科学老师，准备一个简单的编程任务来考察学生的基本编程能力。

提示词：请编写一个简单的 Python 程序，实现一个计算器功能，可以进行加法、减法、乘法和除法。用户输入两个数字和一个操作符，程序输出结果。

场景 2：在一个创业周末活动中，参与者需要快速开发一个原型来展示他们的商业理念。

AI治病，有胆你就来

A16z 万字对谈：AI 在医疗健康领域落地的挑战与机会是什么？

关联网址

关联标签

文章目录

发评论，每天都得现金奖励！超多礼品等你来拿

搜索

近期热门

10 款教育 AI 工具用例

3732 用户在看

AI写作网站自动的生成文章可以用吗？

298 用户在看

AI批改英语作文，质量和数量都完爆人类老师改卷

263 用户在看

科大讯飞AI会议记录，让你丢掉纸笔，开会再也不焦虑

236 用户在看

GPT-4o mini，你好！GPT-3.5 彻底再见！｜AI 鲜测

场景：你是一名计算机科学老师，准备一个简单的编程任务来考察学生的基本编程能力。

提示词：请编写一个简单的 Python 程序，实现一个计算器功能，可以进行加法、减法、乘法和除法。用户输入两个数字和一个操作符，程序输出结果。

场景 2：在一个创业周末活动中，参与者需要快速开发一个原型来展示他们的商业理念。

AI治病，有胆你就来

A16z 万字对谈：AI 在医疗健康领域落地的挑战与机会是什么？

关联网址

关联标签

文章目录

发评论，每天都得现金奖励！超多礼品等你来拿